今日要闻
26 条- 01完成一个并非出自自己、而是由 AI 提出的想法,是如此困难
探讨人类在采纳AI生成创意后面临的执行阻力与认知不适,揭示人机协作中的心理与实践断层
- 02WebMCP:教你网站如何与 AI 代理通信
介绍 WebMCP 框架如何使传统 Web 应用支持与 AI 代理的结构化交互,提升自动化集成能力。
- 03GLM-5.3-Flash 智能、性能与价格分析
分析智谱新发布的 GLM-5.3-Flash 模型在推理能力、响应速度和单位成本上的实测表现。
- 04展示 HN:Hacker News 中有多少内容与 AI 相关
统计分析 Hacker News 近期帖子中 AI 相关话题占比,反映社区技术关注趋势。
- 05GLM-5.3-Flash
智谱AI发布轻量级大模型GLM-5.3-Flash,面向端侧与低资源场景优化推理效率。
- 06
- 07Qwen3.8-Flash-Next:一种新架构,迈向极致成本效益
通义千问团队发布Qwen3.8-Flash-Next新架构,聚焦推理成本优化与效率提升。
- 08
- 09
- 10Debian对其开发者就人工智能使用发起投票:允许还是禁止?
开源社区Debian就是否在项目中允许使用AI工具(如代码生成、文档撰写)进行正式政策投票,反映AI对基础软件生态的影响
- 11AI视频应用井喷,美图打开新的增长空间
美图依托AI视频工具实现商业化突破,验证AIGC视频应用的变现潜力
- 12小宇宙推出《AI趋势报告》:AI创作、AI办公、协作型AI等成讨论新趋势
小宇宙基于播客数据发布AI趋势报告,揭示AI创作与办公场景用户关注度激增
- 13硅谷今日最热具身模型!不用后训练,看一遍就学会
新型具身智能模型实现单次视觉演示即泛化执行新任务,迈向少样本具身学习突破
- 14Z.ai 确认 Ox Alpha 是一款新型 GLM 系列模型,将开源其权重
Z.ai 官方确认 Ox Alpha 为 GLM 系列新模型,并宣布将发布模型权重,属重要开源进展
- 15达卯科技与福建智算方舟达成合作,全栈式算电协同服务在闽落子
达卯科技联合福建智算方舟,在长乐机场综保区智算中心部署算力与电力协同优化服务。
- 16顶级视频AI模型Agnes Video 2.5 Flash免费发布
Agnes Video 2.5 Flash开源免费,支持高质量视频生成,降低创作门槛
- 17宇树与智元共用同一AI大模型,神秘Demo实现10分钟一镜到底生成
宇树科技与智元联合演示基于统一大模型的长时序、高一致性具身智能视频生成能力
- 18Falcon TST 2.0获世界权威测评第一名,推动时间序列基础模型从通用预测走向金融应用
蚂蚁国际发布自研时序AI大模型Falcon TST 2.0,聚焦金融场景,在权威测评中排名第一。
- 19学生在双盲测试中更偏好 Gemini 而非 ChatGPT 和 Claude 来撰写 AI 论文
Hacker News 报道教育场景下主流大模型在论文写作任务中的用户偏好对比结果
- 20WRC乒乓球局爆火!这家中国具身创业公司,砸出了一套全栈新解法
中国具身智能创业公司发布面向乒乓球场景的全栈机器人系统,实现高实时性运动控制与现场演示
- 21深度实测「豆包工作」+飞书:目前最接近企业Agent终局的答案
实测字节跳动豆包工作平台与飞书集成的企业级AI Agent应用方案,聚焦任务自动化与工作流闭环
- 22
- 23OpenAI 数据中心负责人已离职
OpenAI 高管人事变动,影响其算力基础设施建设与战略执行,属关键产业动态。
- 24
- 25Anthropic 预计潜在收入超 30 万亿美元
Anthropic 估算其 AI 技术在全球企业级应用中的长期市场总潜在收入规模达 30 万亿美元以上。
- 26在 Windows 沙箱中运行 Minecraft 以支持计算机使用智能体
探索将游戏环境作为具身智能体训练沙箱的技术路径,属 AI 智能体研究基础设施创新。
前沿论文
15 条- 01FID 隐藏了什么:检测、排序与诊断生成式评估中的偏差
指出FID指标因仅用前两阶矩而忽略分布差异,导致评估失真,提出更鲁棒的诊断方法。
- 02面向长周期任务代理的递归经验-工作记忆演化
提出Recuris架构,通过工作记忆引导技能选择,解耦长历史依赖,提升长周期任务中代理的递归自我改进能力。
- 03SPO++:面向异步代理强化学习的流对齐策略优化
改进单流策略优化(SPO),修正token加权优势中心化偏差,提升异步工具调用场景下RL训练稳定性与效率。
- 04输入凸神经网络的Lp-Lipschitz常数与Zonotope上Lp-范数最大化的参数化复杂度
证明输入凸神经网络Lp-Lipschitz常数计算等价于Zonotope上的对偶范数最大化,并给出L1/L∞情形的多项式可解性结论。
- 05利用局部增强偏好与表征解耦改进跨问题车辆路径规划
针对多任务VRP求解器在奖励尺度失衡与偏好退化问题,提出局部偏好增强与表征解耦新方法。
- 06贝尔曼校准用于离线强化学习中的边缘化重要性加权
提出贝尔曼校准框架,解决离线RL中边缘化重要性加权因函数近似导致的占用平衡残差难诊断问题。
- 07BrowserForge:通过并行浏览器沙箱扩展网页交互片段规模
构建并行浏览器沙箱系统,高效生成大规模高质量网页像素级交互轨迹,解决Web智能体训练数据瓶颈。
- 08FedV-KGQA:面向垂直分割知识图谱的多跳问答框架
提出联邦式多跳KGQA框架FedV-KGQA,在实体共享、关系分属不同机构前提下实现跨域知识推理。
- 09LAION-BVD:用于多模态预训练的1000万小时开源视频数据集
发布含8000万视频、总计1000万小时的开放视频数据集LAION-BVD,支持视频-音频-图像联合预训练。
- 10阅读不等于使用:检索、判断与AI金融研究工作流设计
揭示LLM金融分析中‘检索-整合’鸿沟:无关上下文长度显著干扰风险披露判断,暴露长上下文推理缺陷。
- 11面向大规模测评的自动题目附带内容相似性分析双维度大语言模型框架
提出双维度LLM框架,建模题目中构念无关的附带内容冗余(如措辞/语境),超越BLEU等传统相似度指标。
- 12基于部分知识的LLM知识图谱问答中约束实体选择
研究LLM-KGQA中实体接地失败问题,提出在不依赖完整schema或SPARQL解析前提下的约束实体选择新范式。
- 13BioKERN:面向组织病理-转录组邻域检索的生物核正则化方法
提出BioKERN框架,将生物学邻域结构作为可学习归纳偏置,提升空间多组学表征中跨模态邻域保持能力。
- 14鲁棒公平性审计的几何理论
建立几何框架分析邻域公平性审计的鲁棒性,证明特征空间微小扰动即可导致审计结果剧烈波动。
- 15有效学习率主导语言模型预训练的损失动态
发现语言模型预训练中损失轨迹由有效学习率(LR/参数模长比)决定,匹配ELR即可实现跨配置损失坍缩。
官方发布
9 条- 01将ChatGPT教师版推广至更多美国学区
OpenAI将ChatGPT for Teachers扩展至55个美国学区,覆盖超10万教育工作者,提供安全AI工具与培训
- 02学习永不停止:AI如何让学习持续化
OpenAI新报告揭示ChatGPT如何支持师生实现课堂外持续学习,强化个性化与延展性学习体验
- 03loveholidays 如何借助 Codex 让每个人都成为构建者
loveholidays 利用 OpenAI Codex 实现低门槛软件开发,加速业务创意落地。
- 04Hugging Face 安全事件及后续路径
OpenAI披露Hugging Face安全事件调查结果,并公布强化AI模型安全、监控与对齐的措施。
- 05Anthropic 经济指数连接器发布
Anthropic 为 Claude 推出经济指数连接器,支持用户直接探索经济数据。
- 06Anthropic 经济指数:Claude 3.7 Sonnet 的洞察
基于 Claude 3.7 Sonnet 对 Anthropic 经济指数的第二轮分析与发现。
- 07在英国和欧洲启动 Anthropic 经济未来计划
Anthropic 在英欧推出经济研究支持计划,聚焦 AI 与宏观经济交叉议题。
- 08推出 Anthropic 经济指数
发布全新经济指数,首次系统性呈现 AI 在各职业中的实际应用数据。
- 09资助对AI影响人类福祉的更好评估
Anthropic启动500万美元资助计划,支持独立研究AI对用户心理与社会福祉的实际影响。