AI星际引擎AI STARSHIP
2026.09.24 星期四
49
主题 · 代码大模型

代码大模型

2
  1. 01
    大语言模型能否推理运行时行为?一个仓库级动态基准

    提出SWE-Flux基准,含480个真实Python仓库级执行推理实例,首次支持LLM对完整代码库动态行为的评估。

    arxiv.org·arXiv·11小时前代码大模型程序推理基准测试
  2. 02
    大语言模型代码理解中的词汇迷信:在低词汇质量代码上的再评估

    发现LLM过度依赖标识符名称等词汇线索进行代码理解,提出Face/Off框架验证语义鲁棒性缺陷。

    arxiv.org·arXiv·2天前代码大模型鲁棒性代码理解