大语言模型
8 条- 01Mercury 2.5 大语言模型达到每秒 770 个 token
新发布的 Mercury 2.5 LLM 推理速度达 770 tokens/s,属显著性能提升。
- 02用于作者身份验证的对比学习
基于对比学习的ModernBERT双编码器在PAN21任务上达98.4%准确率,优于分类方法,并系统分析关键训练因素。
- 03StudentBench:AI与人类辅导在GRE学习增益上效果相当
通过StudentBench平台收集17.5万条学生-AI交互数据,实证验证LLM辅导在量化推理上产生与人类相当的学习增益。
- 04数学推理中的序不变答案与序敏感表征
在合成函数组合问题中发现:答案可序不变,但模型内部表征对规则顺序高度敏感,SNR量化其秩序编码强度。
- 05Jev 推出新型大语言模型——System One(即决策模型)
TypeSafe AI 发布 Jev,一种输出数值型决策结果(如分类、评分、置信度)而非文本的新型 LLM 架构。
- 06为何在纳维-斯托克斯方程之后,我仍对大语言模型持悲观态度
作者基于流体力学建模困境反思LLM的物理世界理解能力局限,质疑其泛化与可解释性
- 07大语言模型是真实的,人工智能是虚假的
批判当前AI宣传中混淆LLM能力与通用智能的现象,指出LLM缺乏理解与意识
- 08大语言模型领域特定幻觉检测
提出融合微调DeBERTa、MC Dropout不确定性与温度校准的多信号幻觉检测管线,在HaluEval上达F1=0.915。