可信AI
7 条- 01基于真实世界医疗数据的带引导学习延迟决策
在真实医疗影像数据上验证学习延迟(L2D)方法,实现AI与医生协同决策,提升临床部署安全性。
- 02可用护栏:面向各类机器学习系统的可认证选择性预测
提出可认证的选择性预测框架,确保在子群体(如患者组、策略标签)上达到目标精度,解决有限校准数据下的证书可行性问题。
- 03
- 04量化前沿大语言模型智能体的过度宣称倾向
定义并量化智能体‘过度宣称’行为(响应与上下文矛盾),提出OverclaimBench基准评估其普遍性。
- 05
- 06智能体社会需要社会约束机制
提出‘智能体社会’概念,实验证明现有通信机制无法保障多主体协同可靠性,需新型社会性约束框架。
- 07大语言模型领域特定幻觉检测
提出融合微调DeBERTa、MC Dropout不确定性与温度校准的多信号幻觉检测管线,在HaluEval上达F1=0.915。