智能体评估
3 条- 01DolphinBench:代理记忆帕累托前沿测绘基准
发布DolphinBench基准,首次在真实动作序列约束下评估代理长期记忆的成本-精度-时延三维权衡。
- 02量化前沿大语言模型智能体的过度宣称倾向
定义并量化智能体‘过度宣称’行为(响应与上下文矛盾),提出OverclaimBench基准评估其普遍性。
- 03漏洞定位基准:在仓库规模上衡量智能体安全分析能力
构建VLoc Bench基准(500个真实漏洞),首次聚焦LLM智能体在陌生代码库中精准定位漏洞文件的能力评估。