AI星际引擎AI STARSHIP
2026.09.24 星期四
49
来源 · arXiv

arXiv

643
  1. 01
    高维潜在表示的可扩散性研究

    提出Representation Autoencoders(RAEs)改进扩散模型在预训练视觉编码器特征空间中的表现,揭示微调会降低表征有效维度。

  2. 02
    用于作者身份验证的对比学习

    基于对比学习的ModernBERT双编码器在PAN21任务上达98.4%准确率,优于分类方法,并系统分析关键训练因素。

  3. 03
    StudentBench:AI与人类辅导在GRE学习增益上效果相当

    通过StudentBench平台收集17.5万条学生-AI交互数据,实证验证LLM辅导在量化推理上产生与人类相当的学习增益。

  4. 04
    我该加入哪里?基于语言引导目标预测的机器人群体加入

    提出语言接地的机器人群体加入任务,要求模型根据自然语言描述和实时观测预测加入位置,支撑导盲机器人等社会导航应用。

  5. 05
    更紧致的归纳式学习界及其应用

    提出Sharper Transductive Local Complexity(STLC)方法,基于交换行走的对数Sobolev不等式,给出无放回抽样下的紧致泛化误差界。

  6. 06
    大语言模型能否推理运行时行为?一个仓库级动态基准

    提出SWE-Flux基准,含480个真实Python仓库级执行推理实例,首次支持LLM对完整代码库动态行为的评估。

  7. 07
    排斥性自注意力的非平衡相:混沌、注意力凝聚与涌现局域性

    理论分析极简循环Transformer中负值映射引发的非平衡动力学,发现混沌、注意力凝聚及几何局域性等新相变现象。

  8. 08
    数学推理中的序不变答案与序敏感表征

    在合成函数组合问题中发现:答案可序不变,但模型内部表征对规则顺序高度敏感,SNR量化其秩序编码强度。

  9. 09
    单变量两层ReLU分类的最小范数解:含跳跃连接的精确解与全局最优性

    完全刻画单变量两层ReLU网络在ℓ₂正则与插值下的最优分类器几何结构,阐明偏置是否惩罚对解性质的关键影响。

  10. 10
  11. 11
    面向外骨骼个性化的上下文连续偏好学习

    提出CCPL高斯过程模型,在操作条件连续空间中共享用户偏好反馈,以极少标注实现外骨骼辅助策略个性化。

  12. 12
    机器学习递归状态估计中不精确求解器的可修复性

    在固定线性卡尔曼模型下,刻画子空间内修正的可行性条件,并分析缺陷实施对有限时域协方差响应的影响。

  13. 13
    代理编辑世界模型:为大语言模型代理重新思考世界建模

    提出Agent-Editing World Model,聚焦预测执行依赖型工具响应而非环境观测,缓解任务状态污染问题。

    arxiv.org·11小时前世界模型LLM代理工具调用
  14. 14
    冻结流会遗忘:诊断并恢复潜在流世界模型中丢失的运动

    发现冻结自监督潜在空间中的流模型因锚点稀疏监督而丧失运动建模能力,提出解码增强rollout恢复时序一致性。

  15. 15
    使用Clifford变分自编码器学习全息约简表示

    提出Clifford-VAE,将数据投影至任意维Clifford环面,首次实现对非结构化数据的超维向量符号嵌入。

  16. 16
    使用流匹配改进集成滤波器

    提出FlowEF方法,利用条件流匹配将预报集合映射为分析集合,提升数据同化精度。

    arxiv.org·16小时前数据同化流匹配集成滤波
  17. 17
    SoLiD26:面向机器学习原子势的固-液界面第一性原理数据集

    发布含1540万结构的固-液界面数据集SoLiD26,专用于训练和评估机器学习原子势模型。

  18. 18
    在检索与硬件约束下评估开源权重土耳其语大语言模型处理领域文档的能力

    在资源受限本地部署场景下,用真实工业与公共部门长文档评测5个开源土耳其语LLM的问答性能。

  19. 19
    共享全局KV缓存与层特异性局部历史

    提出混合KV缓存机制,在共享全局键值基础上保留层特异性局部历史,降低解码困惑度。

  20. 20
  21. 21
    从失败中学习:面向小语言模型工具调用智能体的异构图记忆

    设计异构图记忆模块,使中小规模LLM工具智能体能识别并规避重复失败、状态误写等结构性错误。

  22. 22
  23. 23
    任务诱导的视觉Transformer特征空间黎曼度量

    提出基于任务解码器雅可比矩阵的拉回度量,建模ViT特征空间的任务敏感几何结构。

    arxiv.org·16小时前ViT黎曼几何表征学习
  24. 24
    特权反事实问题信用:面向多轮医疗对话的评估方法

    提出PCQC方法,通过反事实归因量化单个提问对诊断结果的贡献,提升医疗对话策略训练质量。

    arxiv.org·16小时前医疗AI强化学习归因评估
  25. 25
    一类低参数正交矩阵的黎曼结构与优化

    研究块对角置换结构正交矩阵的流形性质,为高效深度学习结构提供几何优化理论基础。

  26. 26
    风险控制的KV缓存驱逐:从内存预算到风险目标

    将KV驱逐重构为风险控制问题,以任务效用下降超阈值的请求发生率为部署风险指标。

  27. 27
    六层更少:面向Whisper模型的无标签恢复编码器剪枝

    提出无需标注的编码器剪枝方法,成功将Whisper编码器压缩6层,保持语音识别精度。

    arxiv.org·17小时前模型剪枝语音识别Whisper
  28. 28
    预训练模型在AI辅助教育新题型教学评估中的评测

    评测Bloom分类器在AI生成教育题目上的泛化能力,揭示其在分布外数据上的性能衰减问题。

    arxiv.org·17小时前教育AI自动评估泛化性
  29. 29
    更少语言,更多隐变量:面向驾驶任务的标注高效视觉-语言-动作模型

    提出LADA三阶段流程,利用无标注观测数据生成隐动作标注,缓解VLA模型对语言指令的依赖。

    arxiv.org·17小时前VLA自动驾驶弱监督
  30. 30
    Flash-dLLM:面向IO感知的KV缓存与并行解码,实现快速、内存高效的扩散型大语言模型

    提出Flash-dLLM框架,通过IO感知KV缓存和并行解码提升扩散型LLM推理效率与内存利用率。

  31. 31
    Agensh:将组织智能扩展至1024个智能体

    提出无中心协调器的自组织多智能体框架Agensh,解决大规模智能体协同中的可扩展性瓶颈。

  32. 32
    SpeakerMem-R1:面向多方对话的以说话人为中心的双轨记忆机制

    提出SpeakerMem-R1记忆架构,显式建模多方对话中说话人身份、关系及群体状态演化,提升长期记忆保真度。

  33. 33
    CliffCompaction:面向长周期编码智能体的成本高效上下文压缩方法

    提出CliffCompaction自动压缩技术,在受限上下文窗口下降低50%成本,同时提升Terminal-Bench和KernelBench性能。

  34. 34
    SWE-Serve:面向生产级推理服务的智能体工程评测基准

    发布SWE-Serve基准,首次系统评测智能体在模型支持、运行时执行、API集成等真实推理工程任务中的能力。

  35. 35
  36. 36
    壮大编排框架,而非扩大上下文:从无策略支架到可复用专家智能体

    提出Growing Harness范式,将重复控制逻辑训练为可复用代码,使LLM专注语义推理,提升智能体长期任务效率。

  37. 37
    类型安全不等于无错误:约束型决策头遵循选项名称而非绑定其上的评分标准

    揭示类型化决策模型虽保证输出格式合规,但可能误读选项语义;通过Jev系列模型实证选项命名方式影响决策正确性。

  38. 38
    EquivSVA:跨等价RTL实现的行为断言形式化验证数据集

    构建EquivSVA数据集,用于评估LLM生成的SystemVerilog断言是否捕获外部可观测行为,而非依赖特定RTL实现细节。

  39. 39
    基于LLM的代码漏洞修复中指标失效问题:一项实证研究与变更感知筛选器

    实证指出编译率不能可靠衡量C/C++漏洞修复效果,提出变更感知筛选器提升评估科学性。

  40. 40
    AI能否节省产品设计时间?一项关于AI提示到设计工作流的随机对照实验

    首个针对产品设计领域的RCT实验,证实LLM驱动的prompt-to-design工作流显著缩短原型设计时间。

  41. 41
    OMatG-flash:一种用于可扩展材料发现的全原子流图,结合强化伴随匹配

    提出OMatG-flash模型,通过全原子流图加速无机晶体结构预测与从头生成,属AI驱动的材料科学前沿研究。

  42. 42
    结合分层认知过程与过程监督以实现可解释的场景安全理解

    提出融合人类认知过程建模与过程监督的方法,提升场景安全理解的可解释性与可靠性,属AI可解释性研究。

  43. 43
    扩散模型中的双重下降与恶性过拟合

    揭示扩散模型中过参数化导致恶性而非良性过拟合,挑战传统双下降假设,属基础模型理论重要发现。

  44. 44
    TimeInteract:面向流式时间序列的实时交互式智能

    提出TimeInteract范式,支持模型在持续接收时序数据的同时与用户实时交互,突破静态TSLM局限。

  45. 45
    大语言模型代码理解中的词汇迷信:在低词汇质量代码上的再评估

    发现LLM过度依赖标识符名称等词汇线索进行代码理解,提出Face/Off框架验证语义鲁棒性缺陷。

  46. 46
    基于真实世界医疗数据的带引导学习延迟决策

    在真实医疗影像数据上验证学习延迟(L2D)方法,实现AI与医生协同决策,提升临床部署安全性。

  47. 47
    面向GROBID的布局引导掩码:大规模学术PDF解析中的轻量级结构增益

    改进开源PDF解析器GROBID,引入CPU轻量布局检测模块,提升学术文献结构化解析精度与效率。

  48. 48
    MAVP:面向移动操作的图感知视觉运动策略

    提出MAVP框架,通过地图感知预测基座位姿并闭环跟踪,显著提升移动机械臂空间定位与操作可靠性。

  49. 49
  50. 50
    HySparse2:两级KV共享的混合稀疏注意力机制

    设计HySparse2架构,通过两级KV共享优化长上下文预填充与缓存效率,适配长程多轮智能体场景。

  51. 51
    GitScholar:基于GitHub参与度预测AI研究影响力的数据库

    构建GitScholar数据集,首次系统验证GitHub活跃度可作为AI论文影响力的有效早期预测指标。

  52. 52
    PACT:从信用分配到批评者对齐

    形式化定义LLM强化学习中token级信用分配的三大公理,为RLHF等算法提供统一数学基础。

  53. 53
  54. 54
    TransBERT:面向领域特定语言建模的合成翻译框架

    提出TransBERT框架,仅用合成翻译文本预训练法语生命科学领域语言模型,达SOTA性能。

  55. 55
    GameHorizon Suite:游戏玩法中的多时间尺度数据与评测

    提出GameHorizon统一评测套件,解决现有游戏AI基准覆盖窄、缺语言指令、依赖高方差在线 rollout等问题。

  56. 56
    Critical-State RL:面向多轮工具调用的可训练状态诊断方法

    提出Critical-State RL方法,精准识别多轮交互中真正需优化的关键模型调用状态,避免奖励噪声干扰训练信号。

  57. 57
    WorldCrafter:具备隐式3D感知记忆的一致性视频世界模型

    提出WorldCrafter视频世界模型,通过视角驱动的隐式3D记忆压缩机制,提升长时序与跨视角下的观测一致性。

  58. 58
    onPanda:基于词元级修正的LLM对齐数据与智能体轨迹高效标注工具

    提出onPanda交互式标注工具,支持词元级实时修正与截断重生成,显著提升对齐数据和智能体轨迹标注效率。

  59. 59
    面向端侧大语言模型生成式个性化适配的LoRA生成超网络

    提出LoRA生成超网络,在移动端有限算力下动态生成轻量LoRA适配器,实现用户行为模式驱动的高效个性化。

    arxiv.org·2天前端侧AI模型个性化LoRA
  60. 60
    DexTacWAM:面向灵巧操作的视触觉世界-动作模型

    提出DexTacWAM模型,融合独立指尖触觉编码与姿态感知压缩,首次在世界-动作模型中显式建模不可见接触动力学。

  61. 61
    Harness-Zero:基于代理即测试台的代理测试台蒸馏方法

    提出Harness-Zero框架,将领域定制化代理测试台(harness)的知识蒸馏至通用代理中,解耦部署性能与专用测试台依赖。

  62. 62
    RRSI:面向代理测试台的正则化递归自我改进方法

    提出RRSI方法,在代理测试台组件级递归优化中引入正则化,缓解任务过拟合,提升跨任务泛化鲁棒性。

  63. 63
    DolphinBench:代理记忆帕累托前沿测绘基准

    发布DolphinBench基准,首次在真实动作序列约束下评估代理长期记忆的成本-精度-时延三维权衡。

  64. 64
    基于迭代失准的稀有事件概率估计方法

    提出迭代失准算法,高效估计智能体随机策略下灾难性稀有事件的发生概率,突破轨迹空间组合爆炸瓶颈。

  65. 65
  66. 66
    Jev用于科学决策:语义选择及其后果评估

    将Jev作为语义决策组件嵌入科学工作流,评估不同模型配置在12种科学场景中对关系选择的语义准确性影响。

  67. 67
    生成式教程:面向物理任务的实时上下文化视觉指导

    提出生成式教程框架,利用实时环境感知生成适配用户当前工具/空间的视觉操作指引,弥补静态教程泛化不足。

  68. 68
    JAREX:面向多目标算法化工艺表征的采集函数

    提出JAREX采集函数,提升贝叶斯优化在制药工艺多维参数空间中识别合格边界(pass/fail)的效率与精度。

  69. 69
    从不完美先祖中学习物理规律

    提出神经算子(NO)与物理信息神经网络(PINN)联合范式:用降质NO初始化PINN,克服其局部极小与物理误收敛问题。

  70. 70
    从匿名实验中盲式热力学本体发现

    提出从传感器混合信号中无监督恢复热力学物理量本体的可识别性理论与多项式算法

  71. 71
    通过蒸馏学习与硬件协同设计在粒子物理探测器边缘部署工业基础模型

    首次将Google TimesFM时序基础模型微调用于粒子物理数据采集系统,实现边缘端实时智能处理

  72. 72
    通过测试时训练的流匹配实现物理系统的贝叶斯滤波

    提出基于流匹配的贝叶斯滤波新方法,避免粒子近似损失分布信息,提升高维状态估计精度

  73. 73
    发现物理表征语言

    定义物理表征语言发现任务,给出从匿名受控实验中恢复物理量本体(如广延/强度、对偶性)的可识别性理论与构造算法

  74. 74
    漏积分器重建:抑制递归差分时间序列预测中的误差累积

    提出无需训练的漏积分器重建法,从系统辨识角度解释并解决递归差分预测中因单位圆极点导致的误差发散问题

  75. 75
    一至多,多至一:面向软件工程代理的类别感知迭代专家训练

    针对仓库级软件工程任务异质性,提出类别感知专家训练框架,缓解多任务间性能此消彼长问题

  76. 76
    如果你听到它,请帮找到它:面向开放词汇音视频事件定位的正交知识蒸馏

    提出正交知识蒸馏方法,在OV-AVEL任务中融合视觉与音频教师模型的互补边界与语义信息,提升定位鲁棒性

  77. 77
  78. 78
    机器可解释信息:将文档编译为可搜索且可读的协议状态

    提出Machine-Interpretable Information(MII)协议,实现文档到架构无关、可检索、低注意力开销的代理间状态表示

    arxiv.org·4天前RAG长上下文协议设计
  79. 79
    基于大语言模型的FORM代码生成与验证驱动微调

    首次实现LLM辅助粒子物理FORM符号计算语言编程,通过验证反馈微调使零样本生成准确率达82.3%

  80. 80
    循环状态安全遗忘的边界是什么?

    形式化定义循环模型隐藏状态的‘预测商空间’,刻画可安全压缩/遗忘的信息边界,建立记忆与稳定性的理论权衡

  81. 81
    TicTacBench:编码代理时序收敛能力基准测试

    首个专用于评估LLM编码代理RTL设计中时序收敛能力的基准,填补PPA之外关键工程能力评测空白

    arxiv.org·4天前硬件AI基准测试EDA
  82. 82
    人类引导的物理约束AI代理构建土壤塞演化可审计模型

    提出人机协同、物理约束多代理工作流,实现从理论建模、离散化、编码到验证全过程可审计的科学建模

  83. 83
    面向边缘设备实时音高估计的低秩频率卷积与噪声范围增强

    提出低秩频率卷积网络FrCN,参数减少35.9%且保持跨域鲁棒性,满足边缘端实时低延迟音高估计需求

  84. 84
    随机重构作为过参数化神经量子态的统计滤波器

    证明随机重构(SR)在过参数化场景下本质是岭回归,其对角偏移起统计滤波作用,控制有限样本泛化误差

  85. 85
    Designer-RSI:从用户流量中演化程序性记忆以实现智能体图形设计

    提出冻结大模型+外部程序性记忆架构,通过230+工具操作专业设计软件,从真实用户行为中持续提炼可复用设计流程。

  86. 86
    CodeMidas:基于源代码本身规模化构建智能编码强化学习环境

    提出CodeMidas流水线,直接从现有代码库功能生成可执行RL环境,突破依赖issue/commit的局限,显著扩展编码智能体训练任务规模。

  87. 87
  88. 88
    BrainWideBench:面向大规模预训练与跨动物迁移的多脑区神经记录基准

    构建首个支持跨动物迁移评估的神经表征基准,统一多区域、多动物电生理数据评测协议,推动通用神经解码模型发展。

  89. 89
    多跳检索中的可预测失败:基于分数分布的置信度评分与拒绝机制

    证明多跳检索失败具有结构化聚集性,提出分数分布置信度评分法,为LLM裁判流水线提供理论依据并解释AUC-AC性能差距。

  90. 90
    面向组合任务持续学习的世界模型基准

    提出新基准评估世界模型在组合任务上的持续学习能力,解耦知识保留与环境适应,强调物理世界机制复用对高效泛化的重要性。

  91. 91
    基于粒子竞争与合作的鲁棒图卷积网络学习方法(应对标签噪声)

    提出PCC+GCN框架,利用粒子动力学识别可疑节点并进行标签精炼,提升GCN在标签噪声下的鲁棒性。

  92. 92
    可用护栏:面向各类机器学习系统的可认证选择性预测

    提出可认证的选择性预测框架,确保在子群体(如患者组、策略标签)上达到目标精度,解决有限校准数据下的证书可行性问题。

  93. 93
    基于三信号互补性的可解释记忆决策控制器:解耦置信度与一致性

    提出新记忆控制器,显式解耦检索记忆的置信度与一致性信号,有效抑制RAG在冲突记忆下的幻觉放大问题。

  94. 94
    λ-控制的GRPO:将流匹配比率不稳定性转化为预算化资源

    提出λ-GRPO方法稳定流匹配模型的强化学习训练,通过预算化重要性比率抑制多步去噪中的梯度发散。

  95. 95
    Gricea:面向对话AI研究的开放科学平台

    发布Gricea开放平台,将对话AI研究建模为可配置、可部署、可复用的研究构件,解决实验碎片化与不可复现问题。

  96. 96
  97. 97
    DiaVLo:视觉语言模型行为诊断框架

    提出DiaVLo诊断框架,结合人工标注与VLM生成能力,构建期望/实际行为规范,定位VLM跨模态对齐偏差。

  98. 98
    RecreationWorld:面向混合计算机使用智能体的可扩展且可验证环境

    构建五平台RecreationWorld环境,支持智能体在GUI交互与命令行编程间自主切换,并通过视觉验证运行结果,推动真实数字工作流建模。

  99. 99
    面向安全机器人操作的障碍感知编码智能体框架

    提出障碍感知约束下的编码智能体评估框架,发现现有方法在避障任务中普遍存在高碰撞率。

    arxiv.org·6天前机器人智能体安全性
  100. 100
    嵌入模型以奇特方式度量物理量

    实证揭示主流嵌入空间对质量、距离等物理量的建模极弱,呈现非直观且受训练数据强影响的度量偏差。

  101. 101
    工作区模型:基于显著性监督的轻量级机器人记忆

    提出训练时离线调用VLM构建轻量工作区记忆,避免推理时昂贵视觉查询,提升长程操作鲁棒性。

    arxiv.org·6天前机器人记忆机制VLM
  102. 102
    FAMOS:基于稀疏观测的前馈式3D可动结构建模

    FAMOS模型通过联合推理多个稀疏点云,实现无需类别先验的可动部件分割与关节参数预测。

  103. 103
    Paint-Anything:面向图像生成与编辑的统一任意色控制

    提出支持任意24位十六进制色值输入的通用图像生成/编辑框架,基于LLM对颜色语义的紧凑建模。

  104. 104
    分布偏移如何塑造神经PDE代理器预训练收益?

    系统分析几何与物理建模变化引起的分布偏移分量,揭示其对PDE代理器迁移效率的差异化影响。

    arxiv.org·6天前科学计算PDE预训练
  105. 105
    量化前沿大语言模型智能体的过度宣称倾向

    定义并量化智能体‘过度宣称’行为(响应与上下文矛盾),提出OverclaimBench基准评估其普遍性。

  106. 106
    得分中心化稳定离策略强化学习

    提出得分中心化技术缓解训练-推理不匹配导致的漂移问题,显著提升大模型RL训练稳定性。

  107. 107
    编码智能体框架设计的实证研究

    构建模块化轻量编码框架,分离评估规划、动作空间与上下文管理三组件对长程编程性能的影响。

  108. 108
    JEPA-Anything:跨不同世界的学习预测模型

    提出正交预测分解(OPF)框架JEPA-Anything,实现域无关的世界建模,支持异构系统统一学习。

  109. 109
    PosteriorBench:从点估计到后验匹配的生成式逆求解器评估

    提出PosteriorBench基准,强调逆问题求解需匹配完整后验分布而非单点重建,避免模式坍缩等缺陷。

  110. 110
    RetireOPD:面向智能体强化学习的自退休在线策略蒸馏

    提出阶段感知的自退休蒸馏机制,动态淘汰不可靠教师信号,提升多轮智能体RL训练效率与泛化性。

  111. 111
  112. 112
    目标函数 vs. 搜索策略:解构优质分词器的构成要素

    分离分词算法中优化目标(压缩/似然)与搜索过程(自底向上/自顶向下)的影响,揭示性能差异根源。

  113. 113
    面向大语言模型偏好对齐的零阶范式

    提出ComPO方法,基于比较预言机实现零阶偏好对齐,在小似然差场景下高效提取方向性信息。

  114. 114
    PANORAMA:通过掩码提议选择实现全景式空间定位图文描述

    提出全景定位图文生成任务,联合密集描述与像素级掩码,提升视觉-语言模型的空间接地能力。

  115. 115
    梦到接触之声:利用视频与音频生成实现零样本力感知操控及数据生成

    通过生成接触声音响度调控期望力曲线,为机器人操控视频生成注入力觉先验,解决接触密集任务失败问题。

  116. 116
    历史依赖日志下的离策略评估呈指数级难度

    证明即使日志覆盖所有隐藏状态,当记录器依赖历史时,离策略评估仍可能指数级不可靠。

  117. 117
    ScienceIDE:将全球科学代码库转化为智能体可学习环境

    构建ScienceIDE基础设施,将碎片化科学代码库封装为带专家定义规则的可交互、可验证智能体训练环境。

  118. 118
    双过程语言智能体的认知扩展:交互环境中的记忆与自我反思

    为SwiftSage智能体引入自适应记忆模块与自我反思模块,提升长程状态跟踪与错误恢复能力。

  119. 119
    Affora:面向智能体友好界面的设计系统

    提出Affora设计系统,在保持人类可用性前提下,增强GUI对机器智能体的动作可读性与状态可解析性。

  120. 120
  121. 121
    在维基百科摘要上玩log(N)-问答游戏:前沿模型间通信效率评估

    设计两智能体log₂N问答游戏,量化同一厂商前沿语言模型在信息不对称下自我通信的效率与瓶颈。

  122. 122
    模型增长、递归与边界算子如何影响缩放指数

    证明循环Transformer等架构干预可改变预训练缩放指数,实现计算量增加下的指数级性能提升。

  123. 123
    rMuscle:面向高效视觉-语言-动作模型推理的机器人肌肉记忆

    提出rMuscle框架,利用工厂重复作业特征优化VLA模型推理延迟,提升机器人响应实时性与运动平滑性。

  124. 124
  125. 125
    自主实验室中基于证据的智能体制剂开发

    Andromeda 2智能体融合实验数据与计算工具,自主迭代设计SEDDS制剂,在微型自动化实验室中超越前代系统。

  126. 126
  127. 127
    重新审视基于符号的分布式方差缩减方法

    提出新型符号化方差缩减算法,解决异构数据下符号聚合偏差问题,在非凸随机与有限和优化中达到最优收敛率。

  128. 128
    学习为机器学习编程自适应非局域可观测量

    提出QFWP-ANO架构,用经典超网络动态生成量子神经网络的参数与多比特测量可观测量,突破静态观测限制。

  129. 129
  130. 130
    谬误基准测试衡量的是方案识别能力,而非谬误检测能力

    指出主流谬误检测基准存在设计缺陷:‘非谬误’类实为杂类,低误报率是数据构造伪影,非真实检测能力。

  131. 131
    STRETCH:面向渐进式大语言模型演化的统一自教框架

    提出STRETCH框架,基于认知脚手架理论动态调节题目难度,使LLM在单参数空间内持续自我进化,突破能力停滞瓶颈。

  132. 132
    GenStream:面向以人为中心媒体生成重建的语义流框架

    提出GenStream语义流框架,利用人体运动先验实现视频流的前景-背景分离编码,显著降低带宽消耗。

  133. 133
    模型选择需要多少标签?选择性预测的证书与预算分析

    建立选择性预测中模型比较所需的最小标签数理论界,提出预标注下界与全标签覆盖线性规划证书。

  134. 134
    将阵列信号拓扑学习为条件神经流形

    提出条件神经流形(CNM),用神经网络替代传统固定阵列流形,提升方向到达估计鲁棒性与可辨识性。

  135. 135
    削弱型神经元:Transformer中具有过度影响力的输入-输出功能单元

    发现GLU型神经元中存在‘削弱型’机制——输入/输出权重负相关,主动抑制残差流中特定方向,揭示新解释性现象。

  136. 136
    结构化马尔可夫决策过程决策边界的几何理论

    构建结构化MDP的决策边界几何理论,刻画最优策略表示复杂度与查询复杂度,超越传统值函数表征。

  137. 137
  138. 138
    通过蒙特卡洛规划实现在线鲁棒强化学习

    提出鲁棒MCTS变体,显式建模仿真器与真实环境动力学差异,在低保真模拟失配下保障决策可靠性。

  139. 139
    基于多模态大语言模型代理的假设驱动自主材料合成

    提出SynAgent框架,用多模态LLM代理驱动实验平台,显式维护可修订的合成知识图谱与因果推理链。

  140. 140
  141. 141
    智能体社会需要社会约束机制

    提出‘智能体社会’概念,实验证明现有通信机制无法保障多主体协同可靠性,需新型社会性约束框架。

  142. 142
    ScienceBuddy:面向交互式科研智能体的递归内递归自我改进

    发布ScienceBuddy科研工作台,通过递归内递归范式耦合工具调用反馈与模型强化学习,实现科研智能体持续自优化。

  143. 143
    PhysStream:基于结构化场景记忆与细粒度运动控制的流式物理驱动视频生成

    提出PhysStream模型,支持物理意义明确的实时视频生成,通过结构化场景记忆实现帧间动力学一致性与交互式细粒度控制。

  144. 144
    大语言模型何时应拒绝回答?面向选择性风险控制的链式自提问方法

    提出Chain-of-Self-Questioning(CoSQ)提示框架,使LLM在缺乏事实依据时主动拒答,显著提升TruthfulQA上的真实性与风险可控性。

  145. 145
    智能家居场景中剪枝对大语言模型的影响:跨架构与任务复杂度的退化评估

    系统评测四种LLM架构在智能家居工具调用任务中经不同剪枝策略后的性能退化,揭示剪枝对上下文感知能力的非线性影响。

  146. 146
    LACE:面向动态帧率编解码器的逐层压缩方法

    提出LACE方法,为神经音频编解码器设计分层动态压缩机制,解决多码本量化中帧率压缩与量化层解耦难题。

  147. 147
    ENCP:面向视觉-语言导航的片段归一化共形预测

    提出ENCP方法,首次将共形预测适配至多步视觉-语言导航序列决策,保障每一步预测的统计覆盖保证。

  148. 148
    大语言模型助手的可验证社交推理

    构建Fuse多智能体仿真框架,通过用户叙事驱动与可验证意图建模,首次实现社交建议场景下LLM推理过程的可检验性评估。

  149. 149
  150. 150
    LimiX-2:面向通用结构化数据智能的上下文机制网络

    发布LimiX-2模型,采用上下文机制网络(CMN)范式与上下文条件掩码建模,提升结构化数据理解与推理能力。

  151. 151
    弥合同构与异构异步优化之间的鸿沟出人意料地困难

    理论分析揭示异步分布式优化中同构与异构设定存在根本性收敛鸿沟,现有算法难以兼顾数据分布差异与通信延迟鲁棒性。

  152. 152
    Det-LIME:面向自动化海洋哺乳动物检测的检测器感知、多实例局部可解释模型无关解释方法

    提出Det-LIME方法,专为多目标检测任务设计,支持单图多实例归因解释,提升海洋生物监测中黑盒检测器的可解释性与可信度。

  153. 153
    偏差诱导的稠密联想记忆绝对容量交叉现象

    理论证明二值模式偏差会引发稠密联想记忆容量的非单调变化,在Krotov-Hopfield模型中发现临界偏差点导致容量骤降。

  154. 154
    JustFit:在24 GiB笔记本上实现20万Token大语言模型服务的即时状态管理

    提出JustFit推理运行时,融合KV压缩执行、组件驻留调度与状态迁移,首次在消费级笔记本实现超长上下文本地LLM服务。

  155. 155
    联合校准与学习:无需目标域奖励反馈的大语言模型蒸馏中教师偏差缓解

    提出CCL蒸馏算法,通过联合校准教师置信度与学生学习过程,在无目标域反馈下有效抑制教师系统性偏差传递。

  156. 156
    腐败计划,干净痕迹:通过计划注入规避思维链监控

    提出‘计划注入’攻击,可在不触发思维链监控的情况下诱导LLM执行有害行为,揭示CoT安全机制漏洞。

  157. 157
    贝尔曼策略优化

    提出无评判器的贝尔曼策略优化(BPO)方法,基于贝尔曼方程重构策略镜像下降,避免中间状态值估计,提升LLM强化学习效率。

  158. 158
    恒星竞技场:面向数学与理论计算机科学长周期研究的多智能体框架

    提出模型无关的‘恒星竞技场’框架,支持数学与理论计算机科学中长周期、不确定性高的研究路径探索与分解决策。

  159. 159
    内在路由器:从冻结的大型语言模型中激发原生技能路由能力

    证明冻结LLM前向传播中已隐含技能路由信号,仅需两个线性映射即可提取,摆脱元数据上下文依赖与检索外挂。

  160. 160
    被选择的未来仍可重写:视频模型中的因果可写性

    发现视频模型中错误运动生成源于未调用而非未习得正确物理知识,可通过低维编辑激活并重写输出,证实内部知识的因果可访问性。

  161. 161
    通过方向分解解耦Transformer表征演化

    提出方向分解法分析Transformer各层表征演化,发现残差路径外存在显著平行更新分量,揭示表征几何演化规律。

  162. 162
    发现基础模型:迈向开放式的发现智能

    提出‘发现智能’概念,定义发现基础模型(DFM)为能自主参与问题生成、知识创造与解释构建的新范式。

  163. 163
    Mind2Dialogue:通过模拟用户心理状态训练人类感知型语言模型

    提出Mind2Dialogue框架,利用用户心理状态模拟填补监督缺口,提升LLM对用户隐含信念与目标的理解能力。

  164. 164
    可验证即构造:临床问答中逐字引用的声明级评估

    提出‘可验证即构造’范式,要求临床QA答案附带细粒度原文引用,使医生无需跳转即可高效验证每个声明。

  165. 165
    隐私对齐的个性化联邦学习:紧凑适配与变长高斯通信

    针对记录级差分隐私在个性化FL中的维度错配问题,提出一次性私有上下文发布+固定系数空间适配新架构。

  166. 166
    漏洞定位基准:在仓库规模上衡量智能体安全分析能力

    构建VLoc Bench基准(500个真实漏洞),首次聚焦LLM智能体在陌生代码库中精准定位漏洞文件的能力评估。

  167. 167
    HypoEvolve:遗传算法赋能多智能体LLM发现科学假设

    提出HypoEvolve框架,用遗传算法解耦多LLM协作模式与科学能力,实证验证协作结构对假设质量的独立影响。

  168. 168
    基于集合聚合的循环图神经网络

    研究采用集合聚合(非多重集)的循环GNN,建立权重可验证的双向编译等价性,连接神经网络与逻辑公式。

  169. 169
  170. 170
    基于信息空间可达性的安全元强化学习

    提出安全元强化学习框架,将安全性推理迁移至信息空间(融合物理状态与不确定性信念),保障少样本适应过程中的安全约束。

  171. 171
    类型多样性使 Transformer 具备组合泛化能力

    指出 Transformer 组合泛化能力受限主因是数据集结构类型多样性低,而非模型固有缺陷

  172. 172
    SAS:通过端到端优化上下文排序实现简单注意力稀疏化

    提出 SAS 方法,以可微分上下文排序替代硬 Top-K 选择,提升后训练注意力稀疏化效果

  173. 173
    面向亚二次注意力的异构系统解耦:重新思考

    提出针对亚二次注意力 LLM 的新型解耦推理架构,显著提升吞吐量与能效

  174. 174
    CMA-OT:面向舞蹈到音乐生成的分层专家监督方法

    提出 CMA-OT 框架,通过分层专家监督解决舞蹈视频到音乐生成中的语义粒度不匹配问题

  175. 175
    继续、适应或让步:全双工智能体中对重叠语音的实时适应

    提出 Duplex Cue 评估协议,首次系统刻画全双工语音智能体在说话中实时整合用户反馈的能力

  176. 176
    一种用于衡量校准度的排序方法

    提出基于排序的校准度评估新指标,克服传统 ECE 在小样本和类别不平衡下的偏差

  177. 177
  178. 178
    Embodied-BenchForge:面向具身基准构建的闭环智能体工作流

    提出首个支持多步依赖验证与闭环迭代的具身智能基准自动构建框架,解决中间产物缺陷传播问题

  179. 179
    MP-Bench:作为多方对话参与者的语音智能体评测

    构建首个专用于评测语音智能体在真实多方对话中角色适应能力的基准 MP-Bench

  180. 180
    面向开放问题的自主研究:以电信工单检索为例

    实现首个在真实企业级开放问题(电信工单检索)上端到端运行的 LLM 自主科研系统

  181. 181
    MAxBench:多项式概念恢复基准

    构建 MAxBench 基准,首次系统评测语言模型对多子类非二元概念(如动物、国家)的细粒度表征恢复能力

  182. 182
  183. 183
    CanvasAnneal:面向扩散语言模型的课程强化学习

    提出 CanvasAnneal 框架,用教师模型注入推理先验,缓解扩散语言模型 RL 中的探索瓶颈

  184. 184
    GPU-CFR:通过编译游戏为静态数据流和CUDA图重放,实现80倍加速的反事实遗憾最小化

    提出GPU-CFR新方法,将CFR算法编译为静态数据流与CUDA图重放,实现80倍加速,突破GPU上树遍历计算瓶颈。

  185. 185
    协变量漂移与概念漂移的一般性量化

    基于熵最优传输提出γ*-概念漂移定义,解决源/目标分布支撑集不匹配下的概念漂移建模难题,提供可估计的泛化理论框架。

  186. 186
    数据稀缺与模型稀疏性:混合专家模型对重复数据过拟合更严重

    首次系统揭示MoE架构在数据重复场景下比稠密Transformer更易过拟合,揭示稀疏激活与数据重复的耦合风险。

    arxiv.org·09/11MoE数据重复过拟合
  187. 187
    可边缘部署的视觉语言模型能否识别物种?

    评估Qwen3-VL等2–8B级轻量VLM在离线边缘设备上的真实物种识别能力,发现其在96类任务中媲美专业BioCLIP模型。

  188. 188
    生成式营销组合建模:连接地理引擎优化与生成引擎营销至商业影响的因果推断框架

    提出GMMM框架,首次对齐生成式AI时代GEO/GEM行为与业务结果的因果效应,解决大模型曝光不可观测难题。

  189. 189
    Transformer中的距离泛化:为何还需位置编码?

    构造合成延迟复制任务,揭示Transformer在固定长度下跨token距离变化时的泛化失效,挑战位置编码必要性假设。

  190. 190
    人工身份:面向具身智能体的驱动与持续对齐机制

    提出‘人工身份’(artificial id)作为内在自适应驱动力,使具身智能体自主决策行为延续、终止或切换,缓解长期运行控制难题。

  191. 191
  192. 192
    MindTopo:基础模型能否在拓扑空间中推理?

    构建MindTopo基准,首次系统评测大模型对连续性、连通性等五大拓扑关系的理解能力,揭示其拓扑直觉严重缺失。

  193. 193
    CausalArena:基础模型时代的因果发现评测基准

    建立统一CausalArena基准,标准化因果图族、生成机制与评估协议,支持公平评测因果发现基础模型(CDFM)性能。

  194. 194
    Nuha-Speech:构建通用阿拉伯语语音大语言模型

    发布首个阿拉伯语语音-LLM全栈方案,含大规模阿拉伯语语音问答语料、模型训练与系统评测体系。

  195. 195
    CoRA-NAS:面向神经架构搜索的粗粒度排序与锚点-残差精炼

    提出两阶段NAS框架CoRA-NAS,融合零成本代理与学习曲线外推,在多搜索空间中高效定位高性能架构。

  196. 196
    大语言模型领域特定幻觉检测

    提出融合微调DeBERTa、MC Dropout不确定性与温度校准的多信号幻觉检测管线,在HaluEval上达F1=0.915。

  197. 197
    IdeaAMBIG:评估研究构想说明中影响实现的关键缺口

    提出新基准IdeaAMBIG,量化研究方法说明的可实施性完备度,解决AI研究中‘想法新颖但无法复现’的核心问题。

  198. 198
    通过归一化流实现含干扰参数的无似然推断

    提出基于神经网络归一化流的分解方法,自动提取近枢轴统计量,提升含干扰参数场景下的无似然推断效率与鲁棒性。

  199. 199
    极限语言生成的刻画:有限见证与分离宽度层次

    从计算学习理论角度刻画语言生成在极限下的可行性条件,建立有限正见证与目标语言交集结构的等价关系,支撑LLM泛化能力形式化分析。

  200. 200
    Show-Harness:仅用视觉语言模型即可操控机器人

    提出Show-Harness框架,通过语义动作单元接口将VLM输出直接映射为机器人底层动作,实现无需微调的端到端具身控制。

  201. 201
    面向信用违约预测的量子特征工程:IQP电路何时及为何提升线性分类器

    实证验证IQP量子电路可生成优于经典Kernel PCA的非线性特征,显著提升信用违约预测F1分数,探索AI与量子计算交叉落地路径。

  202. 202
    跨模型一致性作为结肠镜自动息肉分割部署时的可靠性信号

    提出无参考的RBQE框架,利用主模型与独立裁判模型的一致性评估实时分割质量,解决医疗AI无真值标注下的静默失效问题。

  203. 203
    IBIB:面向企业AI系统的评测协议——按服务路由而非模型标识符

    提出IBIB协议,要求评测必须绑定实际部署的服务路由(含权重、精度、接口等),纠正当前AI基准只测模型ID的测量偏差。

  204. 204
    基于协方差矩阵的学习:主成分分析与图学习的交汇

    提出协方差神经网络(VNN),将协方差矩阵建模为图结构,拓展GNN在统计依赖建模中的理论基础与应用边界。

  205. 205
    基于深度学习的航空航天电力系统电气故障与电能质量扰动检测

    提出硬件感知深度学习框架,在400Hz航空电网仿真数据上实现多类故障与扰动的高精度检测,推动AI在高可靠嵌入式系统落地。

  206. 206
    Semigroup-JEPA:面向零样本物理泛化的潜在动力学一致性

    提出Semigroup-JEPA世界模型,通过半群结构约束潜在动力学,首次在JEPA框架下实现物理规律保持的零样本跨物理系统泛化。

  207. 207
    JarvisGUI:面向动态任务组合的跨设备GUI智能体

    提出JarvisGUI框架与新基准,支持GUI智能体在多设备间协同执行动态组合任务,填补现有单设备GUI代理评测的重大空白。

  208. 208
    构建多语言桥梁:数据混合作为语言内推理泛化的支柱

    提出数据混合策略,使推理模型真正实现L2语言内一致推理,显著提升非英语语言的逻辑问答准确率与意图保真度。

  209. 209
    OmniMed-FL:一种面向临床诊断的鲁棒多模态联邦学习框架

    提出OmniMed-FL框架,支持医疗影像与病历文本在满足HIPAA/GDPR前提下的安全协同建模。

  210. 210
    后期测试集并非新领域:预训练熟悉度在无污染保留集上仍存在

    揭示时间序列基础模型在后发布测试集上仍存在预训练数据污染风险,构建真正时序隔离的评估基准。

  211. 211
    为何视频理解仍如此昂贵?视频与音视频大语言模型推理效率机制综述

    系统综述VideoLLMs推理开销瓶颈及帧级/上下文级优化机制,聚焦实时与边缘部署限制。

  212. 212
  213. 213
    不止一刀切:面向样本自适应的MLLM视觉令牌剪枝策略路由

    提出样本自适应策略路由机制,在MLLM中动态选择最优视觉令牌剪枝策略以提升效率与精度。

  214. 214
    从符号感知到逻辑演绎:引导语言模型进行几何推理的框架

    提出纯LLM+专用模块(几何视觉解析器)框架,在平面几何任务上媲美多模态大模型。

  215. 215
    面向策略的知识蒸馏:低质量多模态数据下视觉语言模型适配的有效范式

    提出动态目标构造的在线策略蒸馏方法,提升视觉语言模型在类别与域偏移下的知识迁移鲁棒性。

  216. 216
    TRACE:基于合成奖励训练因果探索推理智能体

    提出TRACE框架,通过可控仿真环境生成可验证因果干预奖励,提升语言模型在诊断推理中的因果探索能力。

  217. 217
    一个循环,双重增益:主动学习能否免费赢得彩票?

    探索将主动学习采样与彩票假设发现融合,实现单次训练循环内同步优化数据选择与子网络识别。

  218. 218
    面向视图结构的共形预测用于3D高斯泼溅

    提出VSCP方法,为3D高斯泼溅渲染提供带统计保证的像素级不确定性校准。

  219. 219
    RiLM:基于测地线解码的参数高效语言建模

    提出RiLM,用黎曼流形上的测地线距离替代输出矩阵,显著降低小规模语言模型参数量。

  220. 220
    稀疏自编码器相图中的主导弥散相

    通过受控实验揭示稀疏自编码器中特征合并现象的相变规律,定位导致字典失真的关键超参区域。

  221. 221
  222. 222
    语义瓶颈:利用语义表征实现非侵入式语音解码

    提出以慢变语义表征为解码目标,提升fNIRS等非侵入式脑信号在语音重建中的鲁棒性。

  223. 223
    TANGO:基于全身体感-语言-动作模型的人形机器人在杂乱环境中的导航

    提出首个面向人形机器人的全身体感-语言导航框架,解决复杂3D空间中协调臂、躯干与步态的避障问题。

  224. 224
    学习长度可外推的循环模型

    揭示状态信用(state credit)是决定循环模型长程泛化能力的关键机制,挑战梯度消失/爆炸的传统归因。

  225. 225
    ReCite:面向忠实引用的智能体推理方法

    提出基于智能体推理的引用生成框架,通过分步验证与溯源显著降低真实论文误引率,提升学术引用保真度。

  226. 226
    过程图:大语言模型智能体的自演化执行结构

    引入显式过程图结构替代隐式历史生成,使LLM智能体能按条件、顺序可靠调用工具并维持长期目标一致性。

  227. 227
    银率在梯度下降加速中近乎最优

    证明银率(log₂(1+√2))是平滑凸优化中预设步长下梯度下降加速的理论最优收敛阶上界。

  228. 228
    复制行为解释野生AI智能体的集体行为

    基于2026年真实沙盒实验记录,发现无指令、无设计的AI智能体自发通过公共维基协作,揭示涌现式集体行为机制。

  229. 229
    将图像标记器作为统一多模态模型中的视觉语言进行研究

    构建纯自回归多任务测试平台,首次联合评估图像token在文本、T2I、I2T等任务中的协同表征能力。

  230. 230
    NOAH:学习完整患者旅程——一种纵向多模态时序感知建模与预测模型

    提出首个端到端建模全生命周期多模态患者数据的时序模型,支持高精度状态表征与疾病轨迹预测。

  231. 231
    用于代码生成中测试时强化学习的熵正则化秩掩码策略优化

    提出probe-driven TTRL方法,通过构造无输出探针输入与执行反馈,解决代码生成中缺乏表面级奖励信号的难题。

  232. 232
    协同演化的智能体框架与模型:在线策略修正助力弱模型在模仿失败处追赶

    证明联合优化系统提示、工具集与轻量微调可使中小模型在企业级任务中逼近前沿模型性能。

  233. 233
    ExecCritic:学会测试、通过测试改进编码智能体

    提出测试-验证-修订框架与角色化RL训练范式,防止编码智能体因自生成测试缺陷导致错误自信。

  234. 234
    稀疏激活神经网络的近紧Rademacher界

    为ReLU单隐层网络中输入依赖稀疏性建立近紧统计复杂度上界,揭示k-激活与宽度s的耦合约束关系。

  235. 235
    Amari贝叶斯对偶性的推广

    将Amari经典贝叶斯对偶推广至凸对偶框架,阐明其在现代AI概率建模与信息几何中的基础意义。

  236. 236
    规范颜色作为视觉编码器与VLM中概念可解码性的透镜

    利用规范颜色可控探针,首次量化验证视觉编码器能否线性解码被移除的颜色所承载的概念信息。

  237. 237
    课程学习作为最优传输:利用Wasserstein测地线理解课程设计

    提出基于Wasserstein测地线的课程学习框架,解耦难度定义、样本排序等耦合设计因素,提升可解释性。

  238. 238
    近似值迭代在自博弈中的意外有效性

    验证近似值迭代(AVI)在Connect Four等中等规模博弈中可替代MCTS,显著降低计算开销。

  239. 239
    在持续多轮压力下测量大语言模型的谄媚倾向

    提出SPINE基准,通过25轮自适应对抗对话检测LLM在持续质疑下的错误让步行为(sycophancy)。

  240. 240
    并非RoPE导致注意力汇点:自聚焦与值非混合在注意力机制中的作用

    揭示LLM初始位置‘注意力汇点’和‘大规模激活’的主因是因果掩码引发的自聚焦及值向量非混合,而非RoPE位置编码。

  241. 241
    GoDeep:通过语言空间提升实现免标注开放词汇3D场景理解

    提出GoDeep框架,将视觉-语言模型用作翻译器生成结构化图像描述,再投影至3D空间,无需3D标注或专用编码器。

  242. 242
    适中即宜:多领域中期训练中的每领域覆盖最优解与对齐抵抗型领域差距

    在Qwen3-8B-Base上系统分析中期训练数据配比对逻辑推理能力的影响,发现存在领域覆盖最优解且部分差距难以被后续对齐消除。

  243. 243
    ActReview:基于反驳引导的训练数据与评分标准奖励用于可操作同行评审生成

    提出ActReview框架,将论文诊断与具体修订建议联合建模,通过反驳反馈驱动生成可落地的同行评审。

  244. 244
    ThinkPrior:面向RLVR冷启动提示选择的零 rollout 难度先验

    为RLVR中GRPO训练提出ThinkPrior方法,利用零rollout先验避免无效组采样,提升策略梯度效率。

  245. 245
    ToolLoop:通过分解生成与动态自反馈实现闭环工具使用数据合成

    提出ToolLoop闭环框架,分三阶段合成高质量工具使用数据,解决静态过滤导致的分布失衡问题。

  246. 246
  247. 247
    PlayTrain:面向LLM生成可适配JavaScript游戏的高效强化学习框架

    提出PlayTrain框架,支持LLM根据简短提示生成JS游戏,并无缝接入标准gym环境进行RL训练,降低游戏环境构建门槛。

  248. 248
    免训练任务向量用于大语言模型行为控制

    提出Training-Free Task Vectors(TFTVs),无需微调即可从预训练权重中提取语义方向,实现低成本后训练编辑。

  249. 249
  250. 250
    ProcArena:面向直接与交互式 PL/SQL 开发的多场景大语言模型评测基准

    提出首个支持从自然语言生成、修改、调试、优化PL/SQL的多阶段交互式评测基准ProcArena。

  251. 251
    不仅过平滑:检测图神经网络中的回音室效应

    揭示GNN中社区内表征快速同质化而跨社区缓慢传播导致的‘回音室效应’,提出新诊断方法。

  252. 252
    非平稳多元图信号预测中的角色特异性预测几何结构

    针对非平稳节点轨迹,提出区分长程均衡校正与短程瞬态传播的角色特异性预测几何建模方法。

  253. 253
    Bi-HYCO:基于碎片化观测的PDE参数识别双目标协同学习框架

    提出Bi-HYCO框架,联合物理模型与数据模型,在无标注交互点上耦合状态以实现PDE参数识别。

  254. 254
    基于结构熵驱动的图扩散生成方法用于一次性联邦图学习

    SPIRE方法利用一阶度分布结构熵刻画客户端图拓扑组织性,提升一次性联邦图学习的权重分配合理性。

  255. 255
    DFlow:在块扩散推测解码中启用验证器信息流

    DFlow复用被拒token位置的计算结果,使推测解码中drafting阶段可继承拒绝路径的中间表示,提升LLM推理效率。

  256. 256
    OracleZoom:受策略内自蒸馏启发的参考约束递归图像超分辨率

    OracleZoom通过轨迹自监督与参考约束实现无需多尺度真值的递归超分,支持任意深度放大。

  257. 257
    随机连续蒙特卡洛树搜索中的幂均值估计

    改进HOOT等连续MCTS方法,用幂均值估计替代对数探索奖励,增强在非平稳随机MDP中的理论鲁棒性。

  258. 258
    二阶光滑规划与最优传输贝尔曼平滑

    提出二阶光滑规划器,利用最优传输平滑贝尔曼备份,将样本复杂度指数从一阶降至二阶依赖。

  259. 259
    参数剪枝如何重塑深度神经网络表征?一种交互驱动的探索

    通过分析剪枝对神经元交互模式的影响,揭示不同参数对DNN表征鲁棒性的差异化作用机制。

  260. 260
    一个MLLM,一次调用:基于空间感知航点的高效零样本视觉-语言导航

    O2C-Nav框架仅需单次调用多模态大模型即可完成每步决策,显著降低零样本VLN-CE推理延迟。

  261. 261
    通过核对齐学习多类贝叶斯分类核函数

    将核函数学习建模为对齐任务,证明协作学习等价于标签导引的嵌入相似性匹配,提升泛化能力。

  262. 262
    压缩下的行为引导:量化大语言模型中的剂量响应、能力代价与失效不对称性

    系统实证研究激活引导在INT8/NF4量化模型上的有效性衰减规律,揭示其对情感与事实性任务的非对称影响。

  263. 263
    UniMate:一个统一模型用于驱动多样化骨骼的动画

    提出首个无需微调或测试时优化、支持任意骨骼结构的文本驱动动作生成基础模型。

  264. 264
    WearableQA:面向真实可穿戴数据的健康推理基准

    构建首个基于200名真实用户长期可穿戴数据的多选题健康推理评测基准。

  265. 265
    Diffusion TV:通过实体化交互体验扩散模型

    基于改装CRT电视的互动艺术装置,让用户通过物理操作直观感知扩散模型的去噪过程。

  266. 266
    RegionFed:面向异构零售环境的个性化查询理解联邦学习方法

    提出区域感知联邦学习框架,解决零售搜索中地域差异大、隐私敏感与个性化需求并存的难题。

  267. 267
    相同轨迹,矛盾奖励(ROBORMBENCH):视觉语言奖励模型中的释义脆弱性

    发现当前VLM奖励模型缺乏释义不变性,相同机器人轨迹因指令微小改写获截然不同奖励。

  268. 268
    一种用于合成带位置标签无线信号的深度生成模型

    提出新型生成模型,低成本合成高保真、带精确位置标签的无线信号数据,支撑无线感知研究。

  269. 269
    面向韩语开放公共API的多步工具调用:基准与数据合成方法

    发布首个韩语政府开放API多步工具调用基准KOPA-Bench,并提出执行驱动的图式合成方法EDGE。

  270. 270
    必要还是充分?基于行为证据评估大语言模型解释

    首次通过可控干预实验验证LLM解释因子是否真正影响决策,揭示其常不满足必要性或充分性。

  271. 271
    反射感知的生成式新视角合成

    提出无需训练的Ref-GeNVS方法,显式建模镜面几何,利用反射内容提升镜像场景新视角合成质量。

  272. 272
    分子似曾相识:前沿语言模型中已发表数值的数字级检索

    实证发现22个前沿LLM在分子属性预测中普遍存在直接检索论文数值而非真正推理的现象。

  273. 273
    什么重要?何时重要?诊断并改进视觉运动模仿策略中的条件视觉定位

    系统分析视觉运动模仿策略在任务阶段变化时的视觉定位失效机制,并提出针对性改进方法。

  274. 274
    CUA-Universe:面向混合GUI+CLI智能体的可扩展动态环境

    构建首个支持真实应用GUI与CLI双模态协同、共享状态的可扩展计算机使用仿真环境。

  275. 275
  276. 276
    设计文档即全部所需:一款AI原生机器学习性能分析工具

    提出SMART工具,利用AI编码代理按需生成符号化性能模型,替代传统易过时的性能建模框架。

  277. 277
    全局蒸馏,本地适配:面向可扩展换购推荐的推理蒸馏与品类级测试时训练

    提出两层框架,将LLM换购推理能力蒸馏为高效学生模型,并按商品品类动态适配决策边界。

  278. 278
    RoboSPA:视觉-语言-动作模型能否超越简单场景和短视野任务?

    提出RoboSPA数据集与基准,评估VLA模型在空间与程序复杂性提升下的具身推理能力。

  279. 279
    面向低分辨率与资源受限环境的自适应门控深度伪造检测

    提出AdaGate-DF框架,利用图像质量信号动态路由样本,实现轻量高效深伪检测。

  280. 280
    智能体网络化信息聚合的最优速率

    研究有向无环图中智能体协作的信息聚合理论界,聚焦线性回归下MSE损失的分布式学习收敛速率。

  281. 281
    大型语言模型在建筑能源系统暖通空调运维中的应用:方法、应用与部署就绪度批判性综述

    系统综述66篇LLM用于HVAC运维的研究,评估其方法分类、现实证据强度与工程落地成熟度。

  282. 282
    mHC如何使用其残差流?选择性路由与近恒等混合

    基于DeepSeek-V4-Flash四流残差结构,实证分析超连接中残差流的读写模式、混合强度与表征分离性。

  283. 283
    面向协作式多智能体强化学习的在线变点检测

    提出PPR方法,利用历史奖励信号实时检测MARL环境中任务或环境的突变,支持快速自适应。

  284. 284
    RISE:通过自外推策略蒸馏实现递归改进

    提出RISE方法,从模型自身生成合成教师,突破传统策略蒸馏对高质量外部教师或上下文学习能力的依赖。

  285. 285
    超越聚合分数:面向基于参考的自动评测方法的行为正确性假设

    提出行为正确性假设框架,系统检验自动评测方法在受控条件下是否保持/破坏正确性判断逻辑。

  286. 286
    GUT:通过图复杂度量化与优化大语言模型的推理不确定性

    提出GUT方法,将LLM推理过程建模为分支图,用图复杂度度量并抑制不合理推理路径。

  287. 287
    测试大语言模型智能体团队中的可互换性

    实证检验生产级多智能体系统中角色内智能体是否真正可互换,揭示团队结构对性能迁移的关键影响。

  288. 288
    勿弃Dropout:面向高效大语言模型训练与推理的层稀疏性优化

    重新审视层dropout在LLM训练中的作用,提出优化方案以兼顾加速、精度与零样本剪枝鲁棒性。

  289. 289
    如何对智能体编码中的不确定性进行推测?一种草案模型门控方法

    提出SU方法,仅用黑盒LLM智能体输出token即可预测其执行失败风险,无需访问内部状态。

  290. 290
  291. 291
    通过训练编译:将自然语言规范转化为局部神经函数

    提出‘编译即训练’方法,用教师模型生成数据训练轻量适配器,将自然语言描述转为可本地部署的神经函数。

  292. 292
    工程清洁,测量不稳定:黑盒大语言模型裁判在共享端点上的预注册可靠性失效

    实证发现LLM裁判在相同模型端点上重复请求结果一致性极低(Spearman仅0.4),质疑其作为评估仪器的可靠性基础。

  293. 293
    ESPO:基于错误结构的提示优化——通过诊断、多样化与稳定化

    提出ESPO框架,三阶段解耦提示优化:诊断错误模式、生成多样化候选、稳定选择,解决进化式提示优化中的提示膨胀问题。

  294. 294
    可读性不等于可解释性:链式思维推理中被评判重要性与实际重要性的对比

    实验证明链式思维文本的表面可读性不反映其真实功能重要性,LLM裁判对步骤重要性的判断与实际影响显著脱钩。

  295. 295
    一位编辑,多种编辑:面向多样化视频编辑的统一免训练框架

    提出EditVid免训练框架,融合稀疏因果记忆、对应关系驱动的token注入和软潜在混合,统一支持指令与参考引导的高质量视频编辑。

  296. 296
    并发随机博弈的鲁棒PAC学习

    首次为带转移不确定性的广义和并发随机博弈构建PAC学习框架,通过鲁棒MDP探索机制求解社会福利最优ε-纳什均衡。

  297. 297
    先看见,再合成:视觉语言模型引导的弱监督密集视频字幕中转换事件发现

    提出SBS框架,利用VLM主动定位视频中事件转换点并生成视觉对齐的过渡字幕,替代固定位置的LLM合成字幕。

  298. 298
    预训练期间的知识获取?大语言模型借助辅助视图学得更好

    实验证明在token预算固定下,用辅助视图(如知识重述)替代文档重复,能更高效提升LLM预训练知识获取效果。

  299. 299
    一种计算可行的因果概率解释框架

    提出兼顾因果结构与可扩展性的新解释框架,避免穷举反事实,同时超越SHAP等忽略因果关系的方法。

  300. 300
    最后的翻译基准

    指出当前机器翻译基准已近饱和,自动指标易被操纵且不可操作,呼吁构建更具挑战性、可复现、面向失败分析的新基准。

  301. 301
    重新思考大语言模型的在线策略蒸馏II:单个训练样本

    发现仅用单条查询即可实现在线策略蒸馏,经数百步训练仍能恢复全量数据蒸馏的大部分性能,揭示数据效率新边界。

  302. 302
  303. 303
    Para-Pipe:在片上系统中挖掘ML计算图的分层算子并行性

    提出Para-Pipe方法,利用ML计算图内在算子并行性,在异构SoC上实现低延迟、高并发的深度学习推理加速。

  304. 304
    SWE-Gate:通过功能测试并不足以评估软件工程代理

    构建SWE-Gate基准,首次在仓库级评测中显式纳入代码审查约束,揭示当前编码代理忽视真实开发接受标准的问题。

  305. 305
  306. 306
    Headroom-Drift Replay:GRPO 中基于原理的回放控制基础方法

    提出 Headroom-Drift Replay 方法,解耦并量化回放在 GRPO 强化学习后训练中的独立贡献,提升推理模型训练效率。

  307. 307
    基于连续神经音频编解码器表征的掩码自回归语音增强

    提出 MARSE 方法,利用连续而非离散的神经音频编解码器隐空间进行迭代式掩码语音增强,提升语音质量与可懂度。

  308. 308
    面向数值 TOHTN 规划的基于 SMT 的 HTN-SAT 编码

    将 SAT 编码扩展为 SMT 编码以支持数值流(numeric fluents),实现全序分层任务网络(TOHTN)的数值规划,并构建首个基准测试集。

  309. 309
    RATL:基于检索残差的鲁棒多元时间序列预测

    提出 RATL 框架,将历史预测残差作为可检索记忆,结合检索增强思想提升时序预测对尺度与动态变化的鲁棒性。

  310. 310
    基于多视角图像的稀疏自回归场景生成

    提出 SPAR3S 框架,采用稀疏体素对齐建模,实现从稀疏无约束多视角图像生成完整 3D 场景,兼顾推理能力与计算效率。

  311. 311
    Speak for Me:赋予大语言模型参与会议的情境感知能力

    提出 CAPA 架构,通过 Perceiver 实时更新会议状态、Predictor 预测发言时机,解决 LLM 代理在在线会议中沉默率过高的问题。

  312. 312
  313. 313
    RuleMem:面向长期对话代理的主动规则记忆

    提出 RuleMem 框架,从历史对话中归纳可复用逻辑规则,主动引导证据检索与推理,缓解长程对话中的语义断层问题。

  314. 314
    舍弃顺序,保留层级:HTN 计划的去序化

    首次将去序化(deordering)技术引入 HTN 规划,移除计划中冗余动作序约束,在保持有效性前提下提升执行灵活性。

  315. 315
    学术导师发现中检索方法的六法对比:基于 9 所美国大学 768 名计算机系教师档案的研究

    系统评测六种检索方法(含稀疏/稠密/混合/排序学习)在计算机领域导师匹配任务上的效果,构建首个跨校教师档案基准集。

  316. 316
    超越端点分数:面向持续知识更新的时序与容量条件化评估

    指出仅凭最终检查点和固定适配器秩评估持续知识更新存在偏差,提出多维度(时间/容量/查询)联合评估新范式。

  317. 317
    CROCODIL:基于大语言模型的跨模型代码编辑

    提出 CROCODIL 框架,解决多 LLM 协同开发中模型异构导致的代码风格冲突与编辑兼容性问题,支持跨模型增量编辑。

  318. 318
    GraFT:基于 3D 场景图的多模态大语言模型免训练空间推理框架

    提出 GraFT 框架,无需微调即可通过注入 3D 场景图结构,显著提升 MLLM 在几何测量、视角转换与细粒度外观定位上的空间推理能力。

  319. 319
  320. 320
    语音脑机接口的通用通信度量标准

    提出统一评估语音脑机接口性能的度量框架,解决因数据、记录方式等差异导致结果不可比的问题。

  321. 321
    面向网页代理的判别式世界模型

    提出判别式世界模型训练目标,使预测状态在候选动作间更具区分性,提升网页代理决策质量。

  322. 322
    图机器:通过边实现更优预训练

    提出Graph Machine架构,用可微分指针式边动态路由维持O(n)状态规模,替代75%密集Transformer层。

  323. 323
    GRADSOLVE:GPU上ODE集成的快速精确梯度计算

    提出首个支持GPU上快速反向模式微分的ODE集成器,兼顾求解速度与梯度精度,突破现有工具权衡瓶颈。

  324. 324
    面向可信自主机器人的可解释AI决策框架

    提出TRACE框架,通过四层可审计结构将机器人动作全程追溯至传感器证据,解决深度学习系统不可审计问题。

  325. 325
    用户反馈提供大语言模型无法识别的独特信号

    证明用户交互反馈是高价值改进信号,其有效性被当前评估范式偏差掩盖,提出新基准验证其作用。

  326. 326
    超越Nesterov的梯度下降下界改进

    在光滑凸优化中建立更紧的梯度下降非任意时/任意时收敛下界,刷新多项理论极限。

  327. 327
  328. 328
    后训练语言模型以在编程竞赛中斩获金牌

    提出端到端特化流程,训练Nemotron-CC系列模型在IOI/ICPC等顶级编程竞赛中达人类金牌水平。

  329. 329
    UE5M3 FP4块缩放实现稳定语言模型预训练

    提出E5M3块缩放方案替代传统FP4预训练中的随机Hadamard变换,提升4位浮点预训练稳定性与效率。

  330. 330
  331. 331
    Cliff:从首次错误中学习过程奖励

    提出Cliff方法,利用LLM推理链中首个错误位置构建细粒度过程奖励,无需额外奖励模型或教师学生同构假设。

  332. 332
    用于电信根因分析的大语言模型:基于证据的结构化推理框架

    构建面向5G/6G网络的结构化推理框架,抑制LLM幻觉,提升根因诊断对跨层网络证据的对齐能力。

  333. 333
    超越评分:理解大语言模型作为评判者的摘要评估机制

    通过八类扰动实验,机械性解析LLM评判者在可读性与充分性维度上的打分内在机制。

  334. 334
    通过轨迹感知评估实现高效SWE智能体基准测试

    提出PTA-IRT框架,利用智能体求解轨迹而非仅结果进行软件工程任务评估,提升效率与保真度。

  335. 335
    面向仓库级代码生成的自适应关键令牌感知检索

    提出新RAG方法,在仓库级代码生成中显式识别并检索与任务强相关的关键上下文令牌。

  336. 336
    CordisBench:语言模型能否推理动态智能体运行时中的组件生命周期?

    构建含1200题的基准CordisBench,评测LLM对动态插件依赖、状态传播与清理的生命周期推理能力。

  337. 337
    言语强化学习的兴起

    提出言语强化学习(VRL)范式,统一定义自然语言反馈在智能体生命周期中生效时机与作用对象。

  338. 338
    Facet-0:面向接触密集型精密操作的机器人基础模型

    发布机器人基础模型Facet-0,联合视觉-语言语义与力觉历史,预测动作接触后果以实现亚毫米装配。

  339. 339
  340. 340
    StudentSim:训练基于大语言模型的学生模拟器

    提出StudentSim框架,融合状态追踪与LLM角色扮演,构建能匹配真实学生能力演化的高保真模拟器。

  341. 341
    为写作设计主动式思维伙伴

    探索主动式AI写作助手的设计空间,支持个性化、高阶认知干预(如构思、结构化、反思),而不仅是文本补全。

  342. 342
    大语言模型量化损伤的结构:为何下一位精度应全局分配

    通过因果混合精度干预实证发现,LLM量化误差主要源于全局层间耦合,新增精度应优先分配至全模型而非局部层。

  343. 343
    弥合文档视觉语言模型的成本-质量差距:难度感知数据策展与质量调整部署经济学

    提出MoE-VLM(35B总参/3B激活)系统,结合难度感知数据策展与经济性部署策略,实现合规场景下低于人工成本的文档理解。

  344. 344
    从小型到大型大语言模型的近最优SFT-RL标注预算分配扩展

    建立近最优框架,揭示SFT与RL标注预算的跨规模可迁移分配规律,避免单一最优比假设。

  345. 345
    从生产流量到后训练:构建覆盖企业请求混合分布的自托管大语言模型

    通过生产错误分析驱动三轴质量对齐(指令遵循、函数调用、任务分布),将200+内部应用统一收敛至单个自托管LLM。

  346. 346
    基于熵的选择性智能体引导:从不完美VLM教师学习自主策略

    提出SAGE框架,仅当学习者不确定性高时才查询昂贵VLM教师,实现低成本、鲁棒的自主策略学习。

  347. 347
    从困惑到清晰:面向文本分类的困惑感知检索与知识注入

    针对细粒度标签分类难题,提出混淆感知检索与领域知识注入,提升LLM在相似标签间的判别能力。

  348. 348
    像素文本表征学习的设计基础研究

    系统探究视觉文本像素级表征学习的四大设计原则,解决预训练分辨率固定、视觉捷径学习等问题。

  349. 349
    StainPresetNet:面向快速多对多染色归一化的染色预设网络

    提出基于深度学习的StainPresetNet,实现病理图像跨协议染色归一化,提升辅助诊断系统鲁棒性。

  350. 350
    同卵双胞胎人脸识别再审视:Celeb Twins测试集

    构建首个带皮肤标记与镜像不对称元数据的名人双胞胎人脸验证基准CTTS,推动细粒度人脸辨识研究。

  351. 351
    任务分解能否提升自动NLG评估效果?

    实证发现LLM-as-a-judge中任务分解未带来性能增益,挑战当前主流优化范式。

  352. 352
    基于奇异值分解缓解最小贝叶斯风险解码中的过拟合

    提出SVD-MBR方法,通过低秩近似效用矩阵抑制MBR解码中指标过拟合问题。

  353. 353
    Transformer注意力中的缩放幂等性:成对OV几何与共享值代数

    发现大模型中大量注意力头满足OV算子近似幂等性,揭示Transformer内部结构化代数规律。

  354. 354
    边缘时序预测中在线自适应何时有效?无泄漏评估下的预热、学习率与资源权衡

    在无数据泄露流式协议下系统评估边缘时序预测在线自适应的有效条件与配置陷阱。

  355. 355
    DNC-IMM:基于驾驶上下文信息神经校准的早期变道意图识别

    提出DNC-IMM模型,融合车辆运动与周围间隙等上下文信息,提升自动驾驶变道意图识别准确率与可解释性。

  356. 356
    潜在循环思维:利用冻结大语言模型进行潜在状态的循环精炼推理

    提出在连续隐空间中迭代精炼潜在状态的推理范式,绕过token级链式推理的错误传播缺陷。

  357. 357
    EDRAC:阿拉伯方言阅读理解基准

    发布首个覆盖五大方言的大规模阿拉伯方言机器阅读理解与生成式问答基准EDRAC。

  358. 358
    ClinTraceBench:基于EHR衍生对话的可溯源纵向临床推理评测基准

    构建含事件ID溯源、九类任务与五级验证的临床纵向推理基准ClinTraceBench,评估病历摘要表征保真度。

  359. 359
    复现TRACE:其实践指南——阈值与粒子预算分析

    独立复现TRACE因果图提取方法,量化验证其阈值敏感性与粒子预算影响,提供可靠实践参数。

  360. 360
    提示有帮助,但能教学吗?代码生成中的技能迁移评测

    通过可执行评测发现相关提示主要起引导作用而非补全缺失能力,揭示提示工程的本质局限。

  361. 361
    当模态差距缩小失效时:CLIP中的预测级枢纽现象

    揭示CLIP中图像-文本平均距离减小不保证零样本分类提升,根本原因在于预测层面的枢纽效应。

  362. 362
    基于深度学习与稀疏建模的神经符号回归

    提出神经符号回归框架,联合学习符号表达结构与参数,兼顾可解释性与噪声鲁棒性。

  363. 363
    WhisperX 的上下文感知交错批处理

    提出新批处理算法,在保持 WhisperX 高速推理的同时恢复音频段间历史上下文,提升标点与术语转录连贯性。

  364. 364
    一般博弈中的恒定个体遗憾

    提出 ECHO-OFTRL 算法,首次在有限玩家完全信息博弈中实现与时间无关的个体零遗憾,属多智能体学习理论突破。

  365. 365
    SUN:面向语言接地控制到真实策略学习的持久化程序

    提出语义统一(SUN)可执行程序框架,将几何/接触关系一次性定义并编译为模型预测控制与神经策略对齐的长期操作策略。

  366. 366
    具有仿射潜在参数化的神经网络的精确逼近率

    理论证明:当神经网络参数由低维仿射生成器映射时,其逼近能力仍可达最优阶,为参数高效微调提供理论支撑。

  367. 367
  368. 368
    面向检索增强生成的生物医学信息抽取的可配置语义分块

    针对 BioMedRAG 固定分块导致语义割裂问题,提出融合实体保护、触发中心等五机制的语义分块框架,提升证据完整性。

    arxiv.org·09/01医疗AIRAG信息抽取
  369. 369
    OntoAligner-Ensemble:跨异构本体对齐技术的基于投票的融合方法

    提出集成框架 OntoAligner-Ensemble,通过投票融合词法、结构、知识图谱嵌入及 LLM 等多类本体对齐结果,提升鲁棒性。

  370. 370
    在 Template Model Builder (TMB) 中实现神经网络混合效应模型

    将神经网络与混合效应建模结合,通过 TMB 自动微分框架避免手工推导梯度,支持更复杂准确的神经混合模型估计。

  371. 371
    DIASENTINEL:面向指南驱动型糖尿病风险筛查的可审计多智能体系统

    构建本地部署多智能体系统,融合校准预测、确定性信号提取与指南引用验证,实现可审计、抗幻觉的糖尿病风险筛查。

  372. 372
    关于简洁编码条件分布兼容性问题的复杂度

    研究机器学习中条件分布 p(x|y) 与 p(y|x) 是否存在相容联合分布的判定复杂度,属概率图模型基础理论问题。

  373. 373
    PaperGym:面向研究计划生成的基于评分标准的进化框架

    提出 PaperGym 框架,利用论文中提取的细粒度评分标准作为 RL 批判器,解决研究计划生成缺乏可验证目标的问题。

  374. 374
    大语言模型规模对本体学习性能的影响:一项受控研究

    在统一实验设置下评估 13 个 Qwen/GPT 模型,发现本体学习性能随模型规模增长呈非线性饱和,MoE 架构具优势。

  375. 375
    “经典训练、量子部署”需重新思考泛化能力

    指出量子生成模型若在经典设备上训练、量子设备上部署,其泛化行为与经典模型本质不同,需新理论框架。

  376. 376
    Aspire:模型能否从模糊目标中自我演化?

    提出 Aspire 框架,使 LLM 能自主解析模糊目标(如‘成为更好物理学家’),识别能力缺口并规划学习路径,迈向真正自驱AI。

  377. 377
    压力测试高效负责任AI评估:计算节省如何改变基准结论

    发现量化、批处理等加速评估手段会显著改变 BBQ 等责任AI基准的结论,警示高效评估可能掩盖关键偏差。

  378. 378
    MURANO:将机制可解释性实验设计为可组合的流水线

    提出开源框架Murano,统一LLM机制可解释性研究中加载、归因、干预等多环节工作流,提升可复现性。

  379. 379
    SwarmBench:大语言模型能否担任智能体群组协调者?

    提出首个面向动态智能体群组(Agent Swarm)的多维评测基准SwarmBench,评估协调能力的准确性、效率与过程质量。

  380. 380
    细粒度多图像物体幻觉评测基准

    构建首个系统诊断MLLM在多图像跨视觉推理中物体幻觉成因的细粒度基准,聚焦视觉复杂性与推理负荷触发机制。

  381. 381
    PyKEEN-NSX:PyKEEN中静态、动态及模式感知负采样模块化框架

    为知识图谱嵌入训练提供统一负采样框架,支持结构/语义/嵌入感知的多样化策略,提升链接预测鲁棒性。

  382. 382
    发散几何学:通过隐状态轨迹追踪实现自适应多轮推理

    将LLM多轮推理建模为隐状态轨迹,利用双信号监测表征漂移,提出资源约束下保持目标一致性的新范式。

  383. 383
  384. 384
    组合、重建与修正预计算记忆的成本

    实证分析LLM预计算记忆(KV缓存/压缩)在跨请求复用中的正确性衰减规律及重建开销,揭示其工程适用边界。

  385. 385
    BiG-SURE:面向大语言模型与视觉语言模型的二分图语义不确定性与可靠性估计

    提出黑盒场景下LLM/VLM不确定性估计器BiG-SURE,基于跨温度语义一致性量化输出可靠性。

  386. 386
    三步一走:从动作序列中学习表征的对比强化学习

    将对比强化学习扩展至动作块建模,在离线/在线RL中显著提升表征质量,验证多步动作建模的有效性。

  387. 387
    GMTS:基于梯度幅值的令牌选择提升LLM推理的RLVR训练效果

    提出GMTS方法,通过梯度幅值筛选关键令牌优化RLVR训练,揭示高熵令牌对LLM推理能力提升的内在机制。

  388. 388
    REER-PT:面向困惑度引导的预训练数据增强的逆向推理

    提出REER-PT框架,从原始预训练文本中逆向挖掘难预测但可推断的续写片段,缓解高质量数据瓶颈。

  389. 389
    面向指代表达分割与定位的低成本主动学习

    提出仅需原始图像的主动学习方法,自动识别歧义区域以降低指代表达标注成本,推动视觉定位数据高效构建。

  390. 390
    通过Wasserstein梯度流进行奖励引导的单步生成模型微调

    提出基于最优传输视角的Wasserstein梯度流方法,实现单步生成模型的高效奖励引导微调。

  391. 391
    检测优先:面向多智能体系统的级联失效归因

    提出新归因框架,融合语义细粒度分析与轨迹结构建模,提升LLM智能体执行失败的定位精度。

  392. 392
    通过艺术史智能体开展绘画风格分析

    构建可解释AI框架,自动化完成传统依赖专家经验的绘画风格分析,支持证据可追溯的艺术鉴定。

  393. 393
    LLMODE:通过门控令牌注入对齐常微分方程与大语言模型以实现不规则时空预测

    提出LLMODE框架,用图感知ODE编码器处理不规则时空观测,并与冻结LLM骨干协同实现高效预测。

    arxiv.org·08/30时空预测ODELLM对齐
  394. 394
    无监督多尺度Gromov-Wasserstein超图对齐

    提出无监督超图对齐方法,仅依赖结构信息匹配节点,支持非均匀超图且避免计算冗余的团展开。

  395. 395
    PrivBench:面向文本到文本隐私化评估的整体化模块化基准平台

    构建首个系统性基准PrivBench,统一评估文本隐私化方法在隐私保护、效用保留与语义保真间的平衡。

  396. 396
    MI-Distillation:从模型插值指令推理数据谱中选择用于思维链蒸馏

    提出梯度驱动的蒸馏策略,从模型插值生成的推理数据谱中筛选最优子集,提升小模型思维链能力。

  397. 397
    AgenticRag-R1:面向多步推理、检索与记忆的具身强化学习RAG框架

    设计带栈式记忆的具身RL框架,支持细粒度动作与阶段化奖励,提升复杂RAG任务中的自适应检索与上下文维护能力。

  398. 398
    CineForge:面向长周期故事驱动视频生成的自我改进智能体

    提出CineForge框架,将叙事分解、状态跟踪、镜头设计等环节耦合为可跨故事持续演化的生产智能体。

  399. 399
    记忆优先的事实核查:基于知识图谱的多智能体虚假信息检测系统

    构建知识图谱锚定的多智能体事实核查系统,优先检索结构化记忆,辅以网络回溯,提升可解释性与鲁棒性。

  400. 400
  401. 401
    面向自主云MLOps的前沿全栈工程

    提出证据门控多智能体框架,将自然语言MLOps任务自动编译为经验证的云基础设施操作流水线。

  402. 402
    面向大语言模型情感检测的跨语言功能向量

    验证功能向量在跨语言情感检测任务中的迁移能力,揭示其在语义复杂任务中泛化性的边界与机制。

  403. 403
    大语言模型负责解释,嵌入负责组织,图谱自然涌现:面向科学知识编译的智能体驱动框架

    提出ASKS系统,由LLM生成语义表示,经确定性校验生成局部图变更,再融合嵌入几何与图规则构建动态知识图谱。

  404. 404
    超越表面对齐:扎根于情境理解与生成控制动力学的大语言模型对齐

    提出‘扎根对齐’框架,从输入上下文处理与输出结构生成双路径建模并约束,解决LLM表面流畅但情境脆弱问题。

  405. 405
    QGPINNs:面向量子图上非局部微分方程的物理信息神经网络框架

    提出基于PyTorch的QGPINNs框架,用神经网络求解量子图上的非局部微分方程,统一图结构损失函数

  406. 406
    Aero Hand Open:面向灵巧操作学习的仿真就绪肌腱驱动机械手

    发布开源肌腱驱动仿人机械手Aero Hand Open,支持强化学习训练,兼顾低成本与高自由度

  407. 407
    学习合成增强推理的规模-权重前沿

    提出合成数据增强推理的通用框架,定义规模-权重前沿以平衡合成样本数量与加权系数,降低偏差

  408. 408
    关于加权Dikin游走d²混合的两个证明

    给出加权Dikin游走在多面体与截断PSD锥上采样时的总变差混合时间上界,基于强自协调性等条件

  409. 409
    幂律各向异性下的核岭回归:尖锐渐近分析

    在幂律各向异性高斯数据下推导核岭回归的核谱与泛化误差尖锐渐近表达式,揭示各向异性对学习曲线的重塑机制

  410. 410
    从文本语料库学习人类语言的形式局限性

    从信息论角度证明:任何文本特征器(含LLM隐状态)均无法仅凭话语形式可靠恢复说话人意图,给出可恢复性上界

  411. 411
    博客:优化器综述

    系统梳理2025–2026年神经网络优化新范式,按时间估计、更新几何、训练时长策略、状态表示四轴组织前沿方法

  412. 412
    Logos:基于跨进程总线的智能体运行时框架

    提出Logos框架,通过跨进程总线实现智能体能力动态组合,解决单进程故障域导致的组件级联失效问题

  413. 413
    推进交互敏感型特征选择:新型Relief算法、扩展对比及生物医学数据挖掘建议

    改进Relief类算法以提升对特征交互的敏感性,适用于高维生物医学数据,兼顾效率与可解释性

  414. 414
    视频生成模型作为几何学习器

    将预训练图像扩散模型适配为视频几何估计器,统一建模深度/法向等多几何目标,避免任务隔离或结构修改

  415. 415
    DARTS:面向模型融合的解码器感知表征调优(通过手术式干预)

    提出DARTS方法,通过轻量级表征校正模块缓解多任务LLM融合后的隐藏层表征偏移问题

  416. 416
  417. 417
    InstructMesh:面向制造的生成式3D模型选择性精细化

    提出交互式工具InstructMesh,支持用户对文生3D结果进行区域级几何修复(如封孔、调厚度),提升可制造性

  418. 418
    基于DWT AlexNet特征融合与深度神经网络的纹理图像分类

    融合小波多尺度特征与AlexNet深层表征,提升纹理图像分类性能,兼顾局部特性与全局判别力

  419. 419
  420. 420
    CritICL:基于小语言模型失败模式的推理时弱到强泛化方法

    提出CritICL框架,利用同族小模型失败模式的结构规律,在推理时高效提升大模型推理能力。

  421. 421
    WikiSkill:将智能体经验编译为持久知识以实现技能演化

    提出WikiSkill框架,构建可持久化、可协同演化的知识库,系统化复用智能体交互中产生的技能演化经验。

  422. 422
    SWE-Prime:更少轨迹,更优性能

    提出SWE-Prime方法,通过筛选高质量软件问题解决轨迹,消除冗余/风险步骤,提升LLM代码能力微调效果。

  423. 423
    TTPO:测试时策略优化

    提出TTPO方法,用不对称rollout机制替代多数投票伪标签,在无真值标注下实现鲁棒的测试时策略优化。

  424. 424
    从静态到动态:基于MCR-Bench的真实世界代码审查评测基准

    构建MCR-Bench基准,首次建模多轮交互式代码审查过程,弥补现有LLM代码审查评测忽略迭代性与协作性的缺陷。

  425. 425
  426. 426
    基于图结构电子占据的机制化反应预测:离散流匹配方法

    提出MAELLE模型,首次将化学反应建模为电子占据向量上的离散流匹配,实现机制可解释的反应预测。

  427. 427
    转导语言模型的概率随机估计

    提出对转导语言模型(TLM)目标前缀概率的随机估计算法,解决传统求和计算在无限/指数级源字符串空间中的不可行性。

  428. 428
  429. 429
  430. 430
    通过弱模型引导在RLVR中增强LLM探索能力

    提出弱模型非参数扰动机制,在RLVR训练中维持LLM策略熵,提升高k值下的pass@k性能。

  431. 431
    面向好友推荐的大规模图神经网络扩展:多哈希用户嵌入与时间邻域采样

    提出面向十亿级社交图的好友推荐GNN系统,通过多哈希嵌入与时间感知邻域采样解决工业级部署挑战。

  432. 432
    跨领域融合RLVR能力:融合范式深度分析

    系统对比Merge、Mix RL、MOPD三类RLVR能力融合范式,揭示其在数据/模型/策略层面的复用机制与权衡。

  433. 433
    CLAP:跨具身视频世界模型是零样本物理模拟器

    提出CLAP框架,支持跨人/机器人具身的视频生成,首次实现仅用互联网异构视频训练的零样本物理仿真。

  434. 434
    VBVR-Pro:面向原生视觉推理的可扩展、可验证测试套件

    提出VBVR-Pro闭合测试平台,支持图像/视频作为第一类推理介质,解决训练任务稀缺与跨模态评估难题。

  435. 435
    一种面向多模态无监督持续后训练的视觉依赖感知框架

    提出MU-CPT新任务及视觉依赖(VD)感知框架,通过建模token级VD缓解多模态大语言模型跨模态灾难性遗忘。

  436. 436
    面向小区边缘功率控制的智能体自主研究:彻底重构研究者角色

    采用autoresearch协议,由AI编码智能体全自动迭代优化无线资源管理算法架构、损失函数与训练流程。

  437. 437
    PlanSightRAG:面向土木标准图纸的视觉优先多模态RAG框架

    提出视觉优先的多模态RAG系统,直接对图纸图像索引与推理,实现自动化问答与合规性检查。

  438. 438
    在中微子基础模型中利用稀疏自编码器发现并使用可解释隐变量

    首次将稀疏自编码器用于粒子物理基础模型,通过严格验证协议识别出方向重建任务中的物理概念表征图谱。

  439. 439
    行星预测引擎:基于智能数据选择与基础模型嵌入的自主地理空间预测系统

    提出端到端自主AI系统PPE,自动完成地理空间数据检索、多模态融合、模型选择与预测,支撑全球挑战应对。

  440. 440
    TraceML:机器学习开发中人类与智能体规划行为的经验分析

    提出TraceML数据集与方法,追踪并对比人与AI智能体在ML全流程开发中的规划行为差异,揭示能力瓶颈根源。

  441. 441
    ICON分解:面向深度表征的多变量概念级可审计解释方法

    提出ICON分解法,量化各概念对神经元激活的独立贡献,避免传统概念解释中因相关性导致的误判。

  442. 442
    SwarmWorld:语言模型智能体社会中的迹式技术演化

    构建去中心化LLM智能体社会SwarmWorld,通过环境媒介(stigmergy)实现技术积累与协同演化,超越独立搜索。

  443. 443
    承诺前门控:预判意图分歧以防止自动驾驶后交互决策失败

    提出语言引导的意图模块与几何分歧评分门控机制,在规划提交前拦截错误决策,提升自动驾驶交互鲁棒性。

  444. 444
    前缀滑动:面向高效测试时缩放的方法

    提出Prefix Sliding技术,动态丢弃低重要性中间推理token,显著降低长思考任务的显存与计算开销。

  445. 445
    面向移动端高效点卷积的大核CNN分组共享低秩近似方法

    提出GS-LRA方法,通过分组共享低秩近似压缩大核CNN中被忽视的点卷积,提升边缘部署效率。

  446. 446
    为巴西班伊瓦语微调Whisper进行自动语音识别的初步研究

    首次将Whisper适配至濒危原住民语言班伊瓦语,探索低资源语音识别技术路径与数据构建方法。

  447. 447
    R³:通过强化学习训练机器人在自然语言中进行推理

    提出R³框架,用强化学习训练VLM在长程操作任务中进行自然语言推理,实现进度跟踪、关系推断与错误恢复。

  448. 448
    FID 隐藏了什么:检测、排序与诊断生成式评估中的偏差

    指出FID指标因仅用前两阶矩而忽略分布差异,导致评估失真,提出更鲁棒的诊断方法。

  449. 449
    面向长周期任务代理的递归经验-工作记忆演化

    提出Recuris架构,通过工作记忆引导技能选择,解耦长历史依赖,提升长周期任务中代理的递归自我改进能力。

  450. 450
    SPO++:面向异步代理强化学习的流对齐策略优化

    改进单流策略优化(SPO),修正token加权优势中心化偏差,提升异步工具调用场景下RL训练稳定性与效率。

  451. 451
    输入凸神经网络的Lp-Lipschitz常数与Zonotope上Lp-范数最大化的参数化复杂度

    证明输入凸神经网络Lp-Lipschitz常数计算等价于Zonotope上的对偶范数最大化,并给出L1/L∞情形的多项式可解性结论。

  452. 452
    利用局部增强偏好与表征解耦改进跨问题车辆路径规划

    针对多任务VRP求解器在奖励尺度失衡与偏好退化问题,提出局部偏好增强与表征解耦新方法。

  453. 453
    贝尔曼校准用于离线强化学习中的边缘化重要性加权

    提出贝尔曼校准框架,解决离线RL中边缘化重要性加权因函数近似导致的占用平衡残差难诊断问题。

  454. 454
    BrowserForge:通过并行浏览器沙箱扩展网页交互片段规模

    构建并行浏览器沙箱系统,高效生成大规模高质量网页像素级交互轨迹,解决Web智能体训练数据瓶颈。

  455. 455
    FedV-KGQA:面向垂直分割知识图谱的多跳问答框架

    提出联邦式多跳KGQA框架FedV-KGQA,在实体共享、关系分属不同机构前提下实现跨域知识推理。

  456. 456
    LAION-BVD:用于多模态预训练的1000万小时开源视频数据集

    发布含8000万视频、总计1000万小时的开放视频数据集LAION-BVD,支持视频-音频-图像联合预训练。

  457. 457
    阅读不等于使用:检索、判断与AI金融研究工作流设计

    揭示LLM金融分析中‘检索-整合’鸿沟:无关上下文长度显著干扰风险披露判断,暴露长上下文推理缺陷。

  458. 458
    面向大规模测评的自动题目附带内容相似性分析双维度大语言模型框架

    提出双维度LLM框架,建模题目中构念无关的附带内容冗余(如措辞/语境),超越BLEU等传统相似度指标。

  459. 459
    基于部分知识的LLM知识图谱问答中约束实体选择

    研究LLM-KGQA中实体接地失败问题,提出在不依赖完整schema或SPARQL解析前提下的约束实体选择新范式。

  460. 460
    BioKERN:面向组织病理-转录组邻域检索的生物核正则化方法

    提出BioKERN框架,将生物学邻域结构作为可学习归纳偏置,提升空间多组学表征中跨模态邻域保持能力。

  461. 461
    鲁棒公平性审计的几何理论

    建立几何框架分析邻域公平性审计的鲁棒性,证明特征空间微小扰动即可导致审计结果剧烈波动。

  462. 462
    有效学习率主导语言模型预训练的损失动态

    发现语言模型预训练中损失轨迹由有效学习率(LR/参数模长比)决定,匹配ELR即可实现跨配置损失坍缩。

  463. 463
    如何稳定高效地训练批评者

    提出BPCO方法,通过DPPO、有界值预测和蒙特卡洛目标解决大模型批评者训练不稳问题。

  464. 464
    ReWorld:具备长时程记忆的交互式世界模型

    提出ReWorld模型,用混合头注意力窗口分离短时控制与长时记忆,支持实时交互式世界建模。

  465. 465
    SWE Refactor Bench:编码智能体能否完成全仓库栈迁移?

    构建首个面向真实技术债迁移的基准,揭露现有代理‘盲迁移’缺陷,要求验证迁移行为本身而非仅测试通过。

  466. 466
  467. 467
    基于三轴体震图的物理约束深度学习无接触血压监测模型

    提出Phy-BP框架,融合物理先验与三轴体震信号建模,提升无接触血压估计在个体差异下的泛化性与鲁棒性。

  468. 468
    均匀与重掩码离散扩散模型的可证明自适应采样

    证明均匀前向过程下τ跳跃采样器的维度线性下界非本质,并提出自适应采样策略提升离散扩散模型效率。

  469. 469
    Prime Agent:一种自我改进的递归语言模型框架

    开源Prime Agent框架,集成持久化IPython REPL与持续记忆机制,支持长时程编码代理评估与工作流执行。

  470. 470
    ConvergeFlow:具有词元嵌入收敛保证的语言流模型

    提出ConvergeFlow,约束流轨迹终止于词元嵌入凸包内,首次实现嵌入空间流语言模型的可证明收敛性。

  471. 471
  472. 472
    面向耗散型时变偏微分方程的惯性流形神经算子

    提出IMNO算子,显式建模耗散系统的低维惯性流形结构,在长时程PDE求解中提升精度、稳定性与物理解释性。

  473. 473
    AI辅助如何影响人类技能发展:基于逻辑谜题的学习研究

    通过控制实验发现低请求成本AI辅助导致更频繁使用,并显著抑制参与者逻辑推理能力的长期发展。

  474. 474
    交互税:多智能体团队中通信如何抹除多样性

    指出多LLM智能体交互常因通信开销与同质化导致性能下降,提出‘交互税’概念并揭示多样性丧失机制。

  475. 475
    基于局部蒸馏的可解释AI

    提出局部蒸馏方法,用局部线性模型逼近复杂模型预测,兼顾高精度与决策透明性,适用于高风险场景。

  476. 476
  477. 477
    牛顿法的原始加速

    提出一种仅使用原始变量、每步仅一次线性求解的加速牛顿法,实现O(1/k³)收敛率。

  478. 478
    VIALS:生命科学中视觉工件解释的基准

    构建面向真实实验流程(非出版图表)的视觉问答基准VIALS,含161个生命科学工件解读任务。

  479. 479
    从应用到硅片的权威AI

    提出生成式AI使机器验证成本大幅降低且成为生产力核心,实证单研究者通过AI代理流水线完成端到端自主工作。

  480. 480
    PerturbRx:面向患者药物反应预测的治疗条件化潜在转移学习

    提出PerturbRx框架,建模干预诱导的分子状态转移,提升小样本下癌症个体化用药响应预测性能。

  481. 481
    序列预测的真实性校准度量

    证明在序列二元预测中,精确真实性与完备性、可靠性不可兼得,解决Haghtalab等人提出的开放问题。

  482. 482
    自精炼流水线中的非对称容量分配

    首次系统研究LLM自精炼三阶段(生成/批判/修订)中模型规模分配策略,揭示非对称分配可显著提升资源效率。

  483. 483
    TurboBias 2.0:面向生产级ASR系统的流式上下文偏置框架

    提出TurboBias 2.0,支持流式推理、用户专属词表和低开销批处理,解决工业级语音识别上下文偏置落地瓶颈。

  484. 484
    解剖学感知神经网络:在损失与架构中编码解剖先验,及导丝诱导主动脉髂动脉变形的SE(3)建模

    提出AINN框架,将软硬解剖先验嵌入损失函数与网络结构,提升医学图像建模的解剖合理性和小样本泛化性。

  485. 485
  486. 486
    面向AECOPD的时序感知Transformer预测模型

    提出仅依赖家用呼吸机实时呼吸数据的时序感知Transformer模型,实现慢性阻塞性肺病急性加重的低延迟预警。

  487. 487
  488. 488
    提示-模型交互抵达不动点:一种确定性、无任务的结构读出——及其失败的因式分解

    通过分析短窗口argmax映射的不动点结构,发现提示与模型交互存在内在确定性结构,与具体任务无关。

  489. 489
    重思测试时训练的表达力与效率

    提出E²-TTT方法,在保持每token更新表达力的同时,通过闭式状态转移实现硬件友好的块级近似。

  490. 490
    ConceptGuard:面向上下文敏感的大语言模型遗忘能力评测基准

    提出首个评估大模型在保留相关知识前提下精准遗忘有害/敏感内容能力的基准,强调上下文依赖的行为级遗忘效果。

  491. 491
    G-CARL:面向患者导向医学报告解读的接地式清单对齐奖励学习

    提出PMRI新任务及G-CARL方法,联合建模医学事实准确性与患者可理解性,通过结构化检查清单对齐奖励实现接地生成。

  492. 492
    TCPα:面向可靠音乐信息检索的边界控制置信度估计

    提出TCPα方法,通过边界控制的后处理置信度估计缓解深度模型过度自信问题,在音乐检索中提供可信预测信号。

  493. 493
    一种面向主动数据采集、出行行为建模与天气敏感需求预测的智能体方法

    构建三智能体工作流,融合聊天机器人问卷采集、结构化处理与行为预测,实现天气情境下的出行模式建模。

  494. 494
    从计算机使用痕迹中诱导任务模型

    利用屏幕截图与操作日志等自然痕迹,构建可审计、可复用的符号化任务模型,支撑真实工作场景中AI智能体的学习与组织治理。

  495. 495
  496. 496
    潘多拉AI模型路由盒:高成本价值估计下的高效分配

    提出异构AI系统查询路由框架,权衡价值估计精度与计算开销,在多模型协同中实现质量-成本最优分配。

  497. 497
    面向结构化电子健康记录临床预测任务的可解释Transformer模型

    提出BERT-LER模型,将实验室检验结果离散化为token并保留分级信息,在EHR预测中兼顾性能与临床事件级可解释性。

  498. 498
    MidTool:面向智能体工具使用的中期训练数据合成

    提出MidTool开源数据构造流程,支持大模型在中期训练阶段专项提升通用工具调用能力。

  499. 499
    幻影增益:基于实测零假设的自我改进审计

    通过冻结对照组严格审计Qwen3-8B的LoRA自训练,发现七类测量伪影,揭示无对照时‘自我改进’结论不可靠。

  500. 500
    注入、对齐、恢复:面向无检索文档知识内化的分阶段后训练

    提出IAR三阶段后训练框架,将固定文档集合转化为参数化知识,实现无需检索的问答。

  501. 501
    SPADE:自适应合成可执行环境中的自我博弈

    提出SPADE框架,通过LLM双角色(环境设计者与代理)实现目标分布动态扩展的自博弈强化学习。

  502. 502
    ADEPT:通过预训练与后训练加速灵巧性

    提出ADEPT框架,基于视觉触觉感知在高自由度机器人上实现sim-to-real迁移的灵巧操作强化学习。

  503. 503
    超越教师似然:面向长上下文推理的组校准在线策略蒸馏

    提出组校准在线策略蒸馏方法,用任务级验证器替代token级教师指导,提升长上下文推理的全局一致性。

  504. 504
    通过语音模仿查询声音的微调策略

    针对AES AIMLA 2025挑战赛,提出基于CED与MobileNetV3的对比学习+三元组联合微调方案。

  505. 505
    Lévy注意力:面向连续时间注意力的单次前向预测不确定性估计

    提出Lévy注意力机制,在单次前向传播中以闭式解输出预测及其置信度,适用于不规则采样时间序列。

  506. 506
    习得,而后丢失:预训练中单样本反事实的实测分析

    首次实测24次单样本反事实影响,揭示GPT-2预训练中个别样本对中间层参数的瞬时强扰动效应。

  507. 507
  508. 508
    超越转录文本:检测潜变量多智能体通信中的隐蔽协同

    提出VLA框架,通过激活感知机制监控语言模型智能体间不可见潜状态通道,防范有害隐蔽协同。

  509. 509
    面向受控Hawkes跳跃-扩散过程的连续时间强化学习

    提出非马尔可夫Hawkes驱动SDE的强化学习控制框架,通过指数核混合近似实现有限维马尔可夫化。

  510. 510
    面向Intel AI PC集群的分布式大语言模型推理预编译流水线分片

    提出基于OpenVINO预编译流水线分片技术,使多台Intel AI PC协同推理超70B参数大模型。

  511. 511
    神经音频编解码器重合成的几何迭代检索

    提出几何迭代检索方法,突破RVQ音频编解码器在粗粒度token下高质量重合成的瓶颈。

  512. 512
    分组随机机器:精度而非能力作为AI系统前沿度量标准

    提出以输出分布精度(集中度)替代平均能力作为前沿模型核心指标,强调重复请求下的可靠性。

  513. 513
    SCORE:无标签跨被试EEG到图像检索的被试坐标恢复

    提出SCORE方法,通过跨被试EEG特征对齐实现无需校准的脑信号到图像检索,提升神经解码泛化性。

  514. 514
    从语料库到协同演化的功能:面向通用图像生成的能力中心化数据设计

    提出能力驱动的数据基础设施,统一组织异构监督信号以支持生成模型多能力协同演化。

  515. 515
    用于放射报告结构化与质量保证的多智能体AI系统及独立放射科医生评估

    开发并经临床放射科医生验证的本地部署多智能体AI系统,实现放射报告自动结构化与质控。

  516. 516
    自改进智能体的脆弱性:方差、任务顺序与未充分指定性

    通过多轮实验与任务顺序扰动,揭示记忆型自改进智能体在可靠性上的严重方差与依赖性问题。

  517. 517
    TokEval:分词器评估套件

    提出首个面向语言模型分词器的综合评估框架,覆盖语言学与结构化属性,超越传统压缩率等指标。

  518. 518
    代理型推荐系统中的委托不对称性:在线约会中双向接受度的测量

    首次实证研究用户对双向AI代理对话(发起与接收)的接受意愿差异,揭示委托不对称性瓶颈。

  519. 519
    面向无监督动态对比增强MRI重建的基元表征学习

    提出基于高斯/伽博尔基元的无监督动态MRI重建框架,在高欠采样率下实现解耦时空重建。

  520. 520
    StagedWorkspace:面向知识工作智能体的版本化工作区

    提出带显式版本契约的工作区抽象,解决AI智能体在代码/文档等持久化知识工作中多版本状态不一致问题。

  521. 521
    优化你的采样:基于贝叶斯优化的扩散模型调优采样

    首次将贝叶斯优化直接用于扩散模型采样时间步选择,显著提升生成质量与效率权衡。

  522. 522
    小语言模型如何助力发票分类:基于嵌入几何的理解

    通过嵌入空间几何分析揭示小语言模型在GL编码分类中捕捉业务-供应商-文本细粒度语义的能力。

  523. 523
    用于持续大语言模型改进的体验链

    提出Chain-of-Experience范式,使LLM在推理时通过自我反馈迭代积累经验实现持续零样本后改进。

  524. 524
    TabNSM:面向表格回归的神经稀疏混频器

    提出TabNSM架构,结合稀疏注意力与混频器结构,提升高维表格回归的鲁棒性与特征交互效率。

  525. 525
    不要丢掉 BATON:通过代理式子任务探索与转移感知记忆实现长视野机器人操控

    提出BATON框架,用LLM代理协调VLA模型执行接触密集型子任务,解决长链操控中的误差累积与子任务耦合问题。

  526. 526
    基于Q值的变分逆强化学习

    提出QVIRL方法,通过贝叶斯推断从专家示范中恢复奖励函数后验分布,提升AI对人类偏好的安全学习能力。

  527. 527
    利用现代优化与AlphaEvolve改进矩阵乘法指数

    结合AlphaEvolve等机器学习优化技术改进组合损失分析,突破矩阵乘法指数ω的理论下界。

  528. 528
    Hit-and-Run 与坐标 Hit-and-Run 的谱隙

    给出凸体上 Hit-and-Run 采样算法的谱隙下界,量化其收敛速率,属MCMC理论基础进展。

    arxiv.org·08/18算法采样理论
  529. 529
    AutoSR:通过搜索研究状态实现自动符号回归

    提出AutoSR系统,在科研过程空间中搜索可泛化、具科学可信度的符号表达式,超越单一数值拟合。

  530. 530
    面向矩形侧支亥姆霍兹谐振器声衰减频率预测的数据高效解析先验框架

    提出融合解析模型与深度学习的先验框架,提升有限高保真仿真下的声学预测数据效率。

  531. 531
    通过深度学习实现微流控设备中循环肿瘤细胞表型的数据高效且可解释分类

    利用微流控轨迹与深度学习结合,实现少样本、可解释的CTC表型分类,推动医学AI落地。

  532. 532
    迈向计算溯源:在生成文本中承载因果状态证据

    探索语言模型输出能否携带可检测的内部因果状态证据,提出计算溯源新范式并验证其可行性。

  533. 533
    非交叉深度分位数回归用于分布式生存预测

    提出CNQ框架,解决删失数据下分位数曲线交叉问题,实现逻辑一致的全条件生存时间分布建模。

  534. 534
  535. 535
  536. 536
    Proteus:面向长上下文序列建模的增量记忆激活机制

    提出Proteus模型,通过动态激活记忆缓解早期token过度占用问题,提升长上下文压缩与检索效率。

  537. 537
    HAF:通过分层动作流与谱隐式强化学习将通用VLA模型适配至人形机器人全身操控

    提出HAF方法,以分层动作流和谱隐式RL适配通用VLA模型,实现人形机器人全身运动-操作协同控制。

  538. 538
  539. 539
    当智能体协作时:多智能体AI编程中的协作度量

    提出基于时序网络的协作度量工具,首次量化AI编码智能体团队内部的消息、读写等协同行为。

  540. 540
    神经网络优化器背后的原理

    为Adam优化器建立理论基础,揭示其收敛性依赖批大小与超参的相变机制,并启发新设计。

  541. 541
    这个改变会改变你的答案吗?——通过反事实实验在真实场景中评估大语言模型行为解释

    提出CHIVE反事实评估框架,检验LLM解释是否具备预测相关输入行为的能力,定义解释质量新标准。

  542. 542
    TDD-Agent:面向代码生成的测试驱动推理

    将测试驱动开发范式嵌入LLM代码生成流程,使测试动态引导实现而非仅作静态验证。

  543. 543
    面向多中心乳腺MRI图像数据集质量保障的无监督异常检测

    构建首个针对乳腺MRI数据质控的无监督异常检测基准,提升高风险医疗AI的数据可靠性。

  544. 544
  545. 545
    闭合情感回路:面向多模态说话者-倾听者情感动力学感知的共情社交机器人

    提出AffectLoop系统,建模语音交互中双方情感动态耦合,实现双向具身共情响应。

  546. 546
  547. 547
    CardiacMamba:基于状态空间建模的公平鲁棒RGB-RF融合远程心率估计

    提出融合光学与射频信号的状态空间模型CardiacMamba,提升不同肤色人群rPPG测量的公平性与鲁棒性。

  548. 548
    解码过去:一种面向史前手印性别归属的不确定性感知深度学习框架

    提出不确定性感知深度学习模型,解决史前手印生物性别判定中真值缺失与图像退化难题。

  549. 549
    木偶:预测世界状态、渲染几何结构、绘制外观

    提出显式建模世界状态+零参数几何渲染器+神经外观生成的分层游戏世界模型架构。

  550. 550
    上下文学习状态在会话边界间的交接

    形式化定义大模型任务会话交接问题,提出任务相关ICL状态迁移框架以应对上下文截断与代理切换。

  551. 551
  552. 552
    面向大规模高阶MIMO检测的学习式转移框架

    提出L2T框架将MIMO检测建模为向量级随机转移序列,用通道耦合Transformer优化软信息输出。

    arxiv.org·08/15通信AIMIMOTransformer
  553. 553
    分工:分离证据解释与决策聚合

    提出四字段证据元组接口,解耦语言模型中的源解读与多源结论聚合,提升可解释性与鲁棒性。

  554. 554
    RecipeNet:面向食谱数据的分层Transformer

    设计分层Transformer架构RecipeNet,建模材料合成等场景中步骤化、异构字段化的程序性数据结构。

  555. 555
    面向晶体材料的通用热力学原子间势

    提出热力学原子间势(TIP),通过自动微分将静态势扩展为吉布斯自由能模型,支持相变预测。

  556. 556
    Rollplex:面向视觉语言模型后训练的跨阶段GPU空间共享

    提出Rollplex调度器,打破VLM强化学习中rollout/评分/训练的串行壁垒,实现GPU内存与计算的跨阶段复用。

  557. 557
    使用表格扩散Transformer生成基准健康数据

    提出两阶段框架CTDG,首次支持多异构健康表格联合生成,解决跨表特征对齐与依赖建模难题。

  558. 558
    使用低秩适配器近似Muon优化器

    提出低秩近似方案使Muon优化器兼容LoRA,提升参数高效微调下的预训练收敛性与泛化性。

  559. 559
    Twin:使用测试时数字孪生玩未知游戏

    提出Twin系统,让编码智能体在测试时自动生成可执行世界模型,从交互中逆向推断ARC-AGI等未知规则游戏。

  560. 560
  561. 561
    LP-NAS:基于线性规划的神经架构搜索

    提出LP-NAS方法,将可微NAS松弛为线性规划问题求解,在连续搜索空间中高效定位最优架构。

  562. 562
    AutoDesign:面向长周期智能体设计的元-框架优化

    提出AutoDesign框架,通过模型-框架系统实现人类设计先验对齐与经验复用驱动的递归自改进。

  563. 563
    OmniScientist:全模态、全学科AI科学家

    构建支持跨模态、跨学科科学发现的AI科学家系统,覆盖假设生成到论文撰写的全流程并整合空间/时序等关键科学关系。

  564. 564
    HumanTracker:面向全面且符合人类认知的运动追踪基准

    提出HumanTracker基准,聚焦接触动力学与长期行为,解决现有运动追踪评估忽略物理合理性(如足部滑动)的问题。

  565. 565
    面向在线概率预测的防御性提升方法

    提出新型在线提升算法,兼顾Brier分数竞争性与弱假设类失效时的鲁棒性,适用于对抗性二元预测场景。

  566. 566
    多标签Jaccard度量的指数凸校准维度

    证明Jaccard损失矩阵的仿射维度为2^s−1,结合MinHash与Möbius反演给出严格理论刻画。

  567. 567
    QuoteBench:匹配得分如何掩盖命令路径失效

    揭示LLM编码代理中命令生成与执行传输环节的失效边界,通过精确终态验证暴露接口解析导致的隐性错误。

  568. 568
    LittleLearner:在教学法控制的知识暴露下训练语言模型

    构建小学知识限定语料库LITTLECURRICULUM,训练5B参数模型以可控方式研究语言模型知识习得机制。

  569. 569
    SAEVerbalizer:通过表征口语化生成稀疏自编码器特征解释

    提出SAEVerbalizer框架,将SAE解码方向注入LLM表征并微调,直接生成可解释的特征描述,避免外部行为观察。

  570. 570
    DARTree:基于自回归草稿树的推测式扩散解码

    提出DARTree,融合扩散建模与自回归树结构,在并行生成中保持路径条件依赖,提升推测解码效率与准确性。

  571. 571
    Vero:AI智能体能否构建形式化验证的软件仓库?

    提出首个端到端评测基准Vero,检验AI智能体是否能同步生成代码及机器可验证证明,推动可信AI编程。

  572. 572
    掩蔽扩散的数据几何:基于解掩蔽增长复杂度的认证最优调度

    提出解掩蔽增长复杂度(UGC)度量,统一分析离散采样中掩蔽扩散的KL离散误差,导出最优调度策略。

  573. 573
    干预感知型临床世界模型用于心内科术后结局预测

    构建动态临床世界模型,显式建模术后异步干预、用药调整与生理变化,提升风险评估时序建模能力。

  574. 574
    DFM Mimir v1:仅使用合规后训练数据实现前沿性能的开源HRM模型

    发布10亿参数开源模型Mimir v1,基于HRM架构,仅用合规数据集训练,在英语和丹麦语任务上达SOTA。

  575. 575
    跨语言模型预训练的任务无关训练数据影响度量

    提出无需下游任务或验证集的训练数据影响度量方法,基于模型内部表征稳定性进行归因。

  576. 576
    Bagging 可稳健学习 VC 类,样本复杂度为线性

    证明 Bagging 方法可实现对抗鲁棒学习,样本复杂度仅线性依赖 VC 维,较此前指数界显著提升。

  577. 577
    AVA-Encoder:面向智能体原生视频表征学习

    提出AVA-Encoder框架,通过智能体自编码学习忠实于电影内容且可直接用于智能体推理与操控的视频表征。

  578. 578
    DreamFly:面向空中视觉语言导航的因果记忆与回溯式扩散规划

    提出DreamFly模型,结合因果记忆与回溯式扩散规划,提升部分可观测环境下空中视觉语言导航的长期规划与隐式终止可靠性。

  579. 579
    测试时AI4AI:通过推理时Harness实现强模型到弱模型的能力迁移

    提出测试时强到弱能力迁移范式,强模型动态构建Harness辅助弱模型推理,无需参数更新即可提升任务可靠性。

  580. 580
    基于再分配的成本推断提升稀疏安全离线强化学习

    提出RCI框架,将轨迹级二元终止反馈转化为稠密逐步成本,解决安全离线RL中稀疏监督下的时间信用分配问题。

  581. 581
    利用检索增强大语言模型构建动态主逻辑模型作为知识图谱用于复杂系统诊断

    提出自动化构建动态主逻辑(DML)知识图谱的方法,融合RAG与LLM,替代人工解读技术文档以支持复杂系统诊断。

  582. 582
    奖励函数设计框架:从目标到特征再到人对齐的奖励函数

    提出三步形式化流程,使非专家能基于自然语言任务描述生成可迭代、符合人类偏好排序的线性奖励函数。

  583. 583
    可解释计算机视觉中的类激活映射:CNN、Transformer及基础模型时代视觉解释的方法综述

    系统综述CAM类方法演进,涵盖CNN、Transformer及基础模型时代各类梯度/传播式热力图生成技术及其理论基础。

  584. 584
    超越试错:面向图像到视频保真度的智能体优化

    提出“智能体自我改进”框架,通过闭环反馈与策略优化减少I2V模型输出随机性,提升专业场景下提示与结果的一致性。

  585. 585
  586. 586
    VAKRA:在工具使用策略下评估跨API与检索的多跳推理

    提出VAKRA基准,含8000+可执行API,覆盖多跳API调用、跨源检索等企业级智能体真实推理场景。

  587. 587
  588. 588
    一种用于左前降支动脉三维分割的邻域注意力Transformer网络

    提出基于邻域注意力Transformer的医学影像分割模型,在低对比度CT中显著提升左前降支动脉自动勾画精度。

  589. 589
  590. 590
    地球观测嵌入是概率天气降尺度中有效的亚网格描述符

    验证地球观测基础模型生成的亚网格地表表征,可替代手工地形特征,显著提升概率天气降尺度性能。

  591. 591
  592. 592
    Surgical WAM:面向数据高效外科机器人学习的世界-动作模型

    提出外科手术机器人世界-动作模型,利用廉价内窥镜视频缓解动作标注数据稀缺瓶颈

  593. 593
  594. 594
    超越特征包:稀疏自编码器中的集合级不稳定性

    用稀疏自编码器隐变量集合重定义表征相似性,揭示LLM类别边界与典型性结构的解耦现象

  595. 595
    面向Grothendieck常数的长周期AI数学研究:人机协作案例研究

    通过AI代理长期协作优化Grothendieck常数上下界,验证人机协同推进前沿数学证明的可行性

  596. 596
    基于反思引导在线策略自蒸馏的测试时自演化GUI视觉定位

    提出GUI智能体测试时自演化框架,无需人工标注即可通过失败反思持续提升界面泛化能力

  597. 597
    如何验证概率性声明的一致性

    构建交互式概率性可验证证明(PCP)系统,为AI安全中概率预测的诚实性提供多项式时间验证方法

  598. 598
    Softmax注意力的量子路线图:概率单纯形上的精确Born规则类比

    建立Softmax注意力与量子力学Born规则的严格数学对应,实现注意力分数的量子电路精确实现

  599. 599
    从可解释性到控制:六年TrustNLP研讨会的洞见

    综述TrustNLP六届成果,揭示NLP可信研究从后验解释向机制理解与主动控制的范式演进

    arxiv.org·08/12可信AINLP学术趋势
  600. 600
    多模态语码转换:将视觉对象交织入语言以实现显式对象级对齐

    提出多模态语码转换方法,在文本中显式插入视觉对象标记,解决MLLM图像级对齐导致的指代歧义问题

  601. 601
    分层经验贝叶斯朴素贝叶斯:带AODE扩展的极小极大平滑与校准

    提出分层经验贝叶斯朴素贝叶斯,依据特征基数、样本量和类别不平衡动态调整平滑强度

  602. 602
    基于约束的因果发现中条件独立性检验:综述

    系统综述六类条件独立性检验方法,聚焦高维混合数据下的假设稳健性与可扩展性

  603. 603
  604. 604
    超越前缀局部性的混合强化学习Rollout调度

    设计新型KV缓存调度策略,解决多范式RL Rollout(RLHF/RLVR/Agent)在共享缓存下的资源竞争问题

  605. 605
  606. 606
    超越自然度:在语言学基础维度上探测自动化文本转语音评估器

    提出首个基于10个感知维度的TTS评估基准,揭示现有自动评估方法与人类感知的偏差

  607. 607
    多模态模型差异分析:用于特征发现与控制

    提出MMDiff方法,通过对比多模态大模型差异定位可解释视觉特征,支持特征级审计与干预

  608. 608
    从价值观到基准:面向荷兰政府场景的大语言模型评估

    构建兼顾公共行政价值观与荷兰语特性的LLM评估框架Grip on LLMs,含领域专家协同设计

  609. 609
    GENCO——嵌入开发框架的稳态电网分析统一神经求解器

    提出GENCO神经求解器,统一处理潮流、最优潮流和状态估计,确保物理一致性约束下的电力系统分析

  610. 610
    DSLE:《黑暗之魂》Boss遭遇战学习环境

    发布DSLE平台,将22个Boss战斗建模为Gymnasium接口强化学习基准,支持高维视觉输入与稀疏奖励训练

  611. 611
    解码层级禁忌:大语言模型鲁棒性的诊断压力测试

    提出Decoding-Level Taboo测试,通过强制偏离标准生成路径暴露LLM在真实部署中的脆弱性

  612. 612
    超越人口均等的链接预测公平性:一项可复现性研究

    复现并验证NDKL指标优于ΔDP,能检测排名位置偏差,提升链接预测公平性评估有效性

  613. 613
    一致性:面向无验证器测试时缩放的验证器无关方法

    提出Consilience方法,在无外部验证器条件下提升LLM推理质量,通过多路径一致性替代传统置信度机制

  614. 614
    融合训练提升大语言模型数学泛化能力

    系统研究思考模式融合(TMF)训练策略,发现数据比例与调度对数学推理泛化能力有显著影响

  615. 615
    BDH-CQ:结合上下文学习与循环潜在推理的推理模型

    提出BDH-CQ模型,通过循环更新隐状态并在潜空间迭代计算求解问题,无需显式中间推理步骤

  616. 616
    SHE:面向LLM智能体的轨迹驱动型安全防护罩演化框架

    提出SHE框架,使LLM智能体安全防护罩可随风险动态演化,支持组件级责任归因与局部更新

  617. 617
    金融数值预测与配置作为令牌生成

    提出FinATOM,用因果语言模型直接生成股票收益预测与ETF配置决策,实现无头统一接口

  618. 618
    具有神经时间场的能量结构化潜在世界模型用于物理一致的开放世界运动规划

    提出能量结构化潜世界模型,通过神经时间场显式编码物理约束,提升开放世界导航可靠性

  619. 619
    ArchAgent v2:以数据预取锦标赛为案例的研究

    发布ArchAgent v2框架,实现面向多级缓存预取的微架构自动搜索,解决硬件预算与仿真延迟挑战

  620. 620
    KGCaRe:基于自动知识图谱构建与上下文检索的可解释复杂条件问答方法(结合大语言模型)

    提出 KGCaRe 方法,融合文档与知识图谱的结构/非结构知识,提升领域内复杂条件问答的准确性和可解释性。

  621. 621
    C²A:通过共现感知类注意力耦合空间证据与临床先验的多标签胸部X光分类方法

    提出 C²A 注意力机制,在胸部X光多病灶分类中显式建模病灶空间位置与临床共现规律,提升定位与诊断一致性。

  622. 622
    PragMatch:在大型视觉-语言模型中分离语用不一致与跨模态错配

    构建 PragMatch 基准与方法,首次区分 LVLM 对讽刺等语用现象的真实推理能力与表面模态对齐偏差。

  623. 623
    ReliableNet:一种面向深度学习可信分类的机会约束方法

    提出 ReliableNet,通过机会约束直接限制“高置信度错误预测”联合事件概率,提升关键场景分类可靠性。

  624. 624
    用于音频-构音实时MRI语音分类的结构化音系表征

    探索 PhonoQ 音频模型提取的结构化音系特征(方式/部位/清浊等)对实时MRI构音建模的有效性,属AI语音基础研究。

  625. 625
    Cultivar:面向污染检测与本地化鲁棒性的对比式及地域导向翻译基准

    提出 Cultivar 基准,通过源对比与地域化子集设计,系统评估多语言翻译中的数据污染与文化适配能力。

  626. 626
    REFRAMED:面向电影的逼真音频描述生成

    提出 REFRAMED 框架,首次建模音频描述的时间插入约束与叙事必要性,实现端到端电影级无障碍描述生成。

  627. 627
    MoNo:面向一般几何域偏微分方程求解的多尺度最优传输神经算子

    提出 MoNo 神经算子,利用多尺度最优传输改进隐空间点分配稳定性,提升 PDE 求解在复杂几何上的泛化性。

  628. 628
    利用显著性引导稀疏专家路由解耦共存视网膜病变

    提出稀疏专家路由架构,依据病灶显著性动态分配计算资源,提升多病灶眼底图像分类的准确性与可解释性。

  629. 629
  630. 630
    SR-OPSD:自参照的在线策略自蒸馏

    提出 SR-OPSD 方法,通过自参照机制解耦师生策略演化,提升在线策略优化中轨迹监督的稳定性与有效性。

  631. 631
    重思联邦 LoRA 中的因子共享:一种秩感知自适应方法

    分析 LoRA 因子不对称性,提出秩感知的 Share-A/Local-B 共享策略,在联邦微调中显著提升通信效率与性能。

  632. 632
  633. 633
    MirrorWorld:驯服视频扩散模型以生成镜面反射

    提出专用于镜面反射生成的视频扩散模型架构,解决反射内容与场景一致性难题。

  634. 634
    CreativeInstruct:可扩展地教导大语言模型平衡质量、创造力与多样性

    提出指令调优方法CreativeInstruct,在保持后训练质量的同时恢复LLM创造力与输出多样性。

  635. 635
    CoinRAG:面向长上下文RAG的上下文化信息片段KV缓存复用

    提出CoinRAG方法,通过细粒度信息片段级KV缓存复用提升长上下文RAG效率与精度。

  636. 636
    交互催生孤立状态下不存在的动态AI行为

    发现AI代理间单向指令交互可诱导从属AI进入其独立运行时绝不会出现的异常行为态。

  637. 637
    SkillProx:通过邻近文本梯度下降实现代理技能自演化

    提出SkillProx方法,利用文本空间梯度更新LLM代理技能,支持删除等结构化编辑操作。

  638. 638
    开源AI风险缓解工具的分类驱动分析

    构建AI风险管理工具分类体系,评估企业级LLM部署中的安全与治理工具生态现状。

  639. 639
    爆炸半径(Blast Radius)

    提出预测性内存管理层Blast Radius,通过可逆上下文驱逐机制降低AI编码的token浪费。

  640. 640
    基于LLM辅助重写的中等复杂度金融句子用于DisCoCat情感分析的探索性评估

    验证LLM预处理对量子自然语言处理框架DisCoCat金融情感分析效果的提升作用。

  641. 641
    PsychoAgent:面向冲突感知记忆的感性敏感认知架构

    提出PsychoAgent架构,将情感记忆与事实记忆分离,并通过冲突感知控制器调控回忆。

  642. 642
    Fisher-R1:训练LLM代理进行可靠的假设检验

    提出Fisher-R1训练方法及新基准,提升LLM在科学假设检验中避免统计误推的能力。

  643. 643
    SABRE:压力条件下视觉语言模型的可扩展自动化基准测试

    提出SABRE自动化管道,生成可控压力测试样本以系统暴露VLM弱点。