代码大模型
2 条- 01大语言模型能否推理运行时行为?一个仓库级动态基准
提出SWE-Flux基准,含480个真实Python仓库级执行推理实例,首次支持LLM对完整代码库动态行为的评估。
- 02大语言模型代码理解中的词汇迷信:在低词汇质量代码上的再评估
发现LLM过度依赖标识符名称等词汇线索进行代码理解,提出Face/Off框架验证语义鲁棒性缺陷。
提出SWE-Flux基准,含480个真实Python仓库级执行推理实例,首次支持LLM对完整代码库动态行为的评估。
发现LLM过度依赖标识符名称等词汇线索进行代码理解,提出Face/Off框架验证语义鲁棒性缺陷。