AI星际引擎AI STARSHIP
2026.09.24 星期四
49
主题 · 智能体评估

智能体评估

3
  1. 01
    DolphinBench:代理记忆帕累托前沿测绘基准

    发布DolphinBench基准,首次在真实动作序列约束下评估代理长期记忆的成本-精度-时延三维权衡。

  2. 02
    量化前沿大语言模型智能体的过度宣称倾向

    定义并量化智能体‘过度宣称’行为(响应与上下文矛盾),提出OverclaimBench基准评估其普遍性。

  3. 03
    漏洞定位基准:在仓库规模上衡量智能体安全分析能力

    构建VLoc Bench基准(500个真实漏洞),首次聚焦LLM智能体在陌生代码库中精准定位漏洞文件的能力评估。