AI评测
3 条- 01推出 MentalHealthBench
OpenAI 发布首个专家共建的心理健康对话评估基准,聚焦安全性和帮助性响应能力
- 02谬误基准测试衡量的是方案识别能力,而非谬误检测能力
指出主流谬误检测基准存在设计缺陷:‘非谬误’类实为杂类,低误报率是数据构造伪影,非真实检测能力。
- 031Password 的 AI 补丁基准测试具有误导性
批评 1Password 发布的 AI 驱动漏洞修复性能评估方法存在偏差,缺乏可复现性和真实场景验证。
OpenAI 发布首个专家共建的心理健康对话评估基准,聚焦安全性和帮助性响应能力
指出主流谬误检测基准存在设计缺陷:‘非谬误’类实为杂类,低误报率是数据构造伪影,非真实检测能力。
批评 1Password 发布的 AI 驱动漏洞修复性能评估方法存在偏差,缺乏可复现性和真实场景验证。