基准测试
15 条- 01大语言模型能否推理运行时行为?一个仓库级动态基准
提出SWE-Flux基准,含480个真实Python仓库级执行推理实例,首次支持LLM对完整代码库动态行为的评估。
- 02SWE-Serve:面向生产级推理服务的智能体工程评测基准
发布SWE-Serve基准,首次系统评测智能体在模型支持、运行时执行、API集成等真实推理工程任务中的能力。
- 03DolphinBench:代理记忆帕累托前沿测绘基准
发布DolphinBench基准,首次在真实动作序列约束下评估代理长期记忆的成本-精度-时延三维权衡。
- 04TicTacBench:编码代理时序收敛能力基准测试
首个专用于评估LLM编码代理RTL设计中时序收敛能力的基准,填补PPA之外关键工程能力评测空白
- 05BrainWideBench:面向大规模预训练与跨动物迁移的多脑区神经记录基准
构建首个支持跨动物迁移评估的神经表征基准,统一多区域、多动物电生理数据评测协议,推动通用神经解码模型发展。
- 06面向组合任务持续学习的世界模型基准
提出新基准评估世界模型在组合任务上的持续学习能力,解耦知识保留与环境适应,强调物理世界机制复用对高效泛化的重要性。
- 07
- 08谬误基准测试衡量的是方案识别能力,而非谬误检测能力
指出主流谬误检测基准存在设计缺陷:‘非谬误’类实为杂类,低误报率是数据构造伪影,非真实检测能力。
- 09每瓦特智能:测量本地AI的智能效率
提出衡量边缘设备上AI模型能效的新指标Intelligence per Watt,用于评估本地AI的计算效率与性能权衡。
- 10Real-SWE:在私有、真实企业代码库上对 AI 模型进行基准测试
发布首个基于真实企业私有代码库的软件工程AI评测基准,填补开源代码评测局限
- 11AI数学的最后一道高墙,塌了!GPT-6 Astra刷穿FrontierMath Tier 4
GPT-6 Astra模型在前沿数学基准FrontierMath Tier 4达成满分,标志AI数学推理能力突破临界点。
- 12Embodied-BenchForge:面向具身基准构建的闭环智能体工作流
提出首个支持多步依赖验证与闭环迭代的具身智能基准自动构建框架,解决中间产物缺陷传播问题
- 13MindTopo:基础模型能否在拓扑空间中推理?
构建MindTopo基准,首次系统评测大模型对连续性、连通性等五大拓扑关系的理解能力,揭示其拓扑直觉严重缺失。
- 14CausalArena:基础模型时代的因果发现评测基准
建立统一CausalArena基准,标准化因果图族、生成机制与评估协议,支持公平评测因果发现基础模型(CDFM)性能。
- 15Cognition 的 SWE-2 在 Terminal-Bench 2.1 上取得 92.8 分
AI 编程智能体 SWE-2 在终端代码基准测试中刷新高分,体现自动化软件工程能力突破