LLM可靠性
2 条- 01基于LLM的代码漏洞修复中指标失效问题:一项实证研究与变更感知筛选器
实证指出编译率不能可靠衡量C/C++漏洞修复效果,提出变更感知筛选器提升评估科学性。
- 02大语言模型何时应拒绝回答?面向选择性风险控制的链式自提问方法
提出Chain-of-Self-Questioning(CoSQ)提示框架,使LLM在缺乏事实依据时主动拒答,显著提升TruthfulQA上的真实性与风险可控性。
实证指出编译率不能可靠衡量C/C++漏洞修复效果,提出变更感知筛选器提升评估科学性。
提出Chain-of-Self-Questioning(CoSQ)提示框架,使LLM在缺乏事实依据时主动拒答,显著提升TruthfulQA上的真实性与风险可控性。