今日要闻
89 条- 01Meta靠自研Manus翻身!股价一夜暴涨11%,登顶苹果商店,增速反超ChatGPT
摘要内容与AI无关(‘全民养虾狂潮’为明显误抓或戏谑表述),标题中Manus疑似误写(应为Meta AI或Manus AI?),但来源为量子位且含‘ChatGPT’对比,属AI产业动态误标事件,按规则来源强相关即判相关。
- 02成立九年,中科类脑把积累装进Token工厂
中科类脑推出‘Token工厂’平台,整合多年AI算法与行业知识,支持大模型轻量化部署与领域适配
- 03Mercury 2.5 大语言模型达到每秒 770 个 token
新发布的 Mercury 2.5 LLM 推理速度达 770 tokens/s,属显著性能提升。
- 04我们如何在两周内将 claude.ai 的速度提升 3 倍
Anthropic 工程团队分享 claude.ai 前端性能优化实践,含具体技术路径与量化效果
- 05
- 06Stripe 构建了其内部 AI 平台
支付公司 Stripe 自研内部 AI 平台,支撑工程与产品智能化,属典型产业动态
- 07AI 原生应用是什么样
定义并举例说明AI原生(AI-native)产品范式,强调以模型能力为设计原点而非UI叠加
- 08
- 09联想亮相阿里云栖大会:联想天禧AI把超级组织落地到端侧
联想在阿里云栖大会发布天禧AI端侧全场景产品矩阵,推动AI超级组织能力下沉至终端设备。
- 10让Token生产更高效:异构混推的关键技术演进与创新实践
商汤大装置团队介绍异构混推技术在提升大模型推理效率方面的创新实践。
- 11汇智智能发布Hellome:国内首个FDE直连智能体服务平台,把AI交付周期压进“周”
发布国内首个面向FDE(功能驱动工程)的直连智能体服务平台,实现AI服务周级交付。
- 12
- 13它石智航顶尖团队引领中国具身智能率先迈入规模化落地阶段
它石智航推进具身智能机器人研发与量产,加速规模化商业落地
- 14斑马智能发布端模型AutoOmni2.0,让元神AI更懂“我的世界”
斑马智能在云栖大会发布全模态端侧大模型AutoOmni 2.0-23B-A3B,强化本地化多模态理解能力
- 15DeepSeek新论文公开Agent训练!梁文锋署名
DeepSeek发布新论文,公开智能体(Agent)训练方法,支持每秒生成5000+沙盒环境。
- 16Qwen一号位定了!刘大一恒接棒
通义实验室负责人变更,刘大一恒接任Qwen项目一号位,系与稚晖君同届的天才少年。
- 17Jev vs Decitron:同为决策AI,为什么不是一回事?
对比两类决策AI在复杂现实推演与决策能力上的本质差异。
- 18实时世界模型进入“全科生”阶段,PixVerse R2先交卷!
PixVerse发布R2模型,实现世界模型在实时性与通用性上的协同突破。
- 19稚晖君把机器人卖到2万元一台,可人可狗可开发!
稚晖君发布2万元级开源可编程机器人,支持人形/四足形态及开发者定制。
- 20阿里千问AI平台全面升级模型服务、Agent服务、AI应用
阿里千问AI平台升级MaaS、智能体(Agent)服务及行业AI解决方案能力。
- 21GPT-6 Astra搓3D刷屏后,3D生成的竞争规则变了
GPT-6 Astra推动3D内容生成技术突破,重塑行业竞争格局
- 22Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折
Anthropic发布Claude Opus 5.5,支持大规模代码迁移并大幅下调API缓存读取价格
- 23刷视频也能教会机器人干活!1200亿tokens人类动作预训练,误差按幂律下降
基于1200亿token互联网视频动作数据预训练机器人策略模型,泛化误差呈幂律收敛
- 24滴滴自动驾驶连获全国工商联及北京市荣誉榜单认可
滴滴自动驾驶入选2026年民营企业发展新质生产力案例及北京未来产业先锋榜。
- 25新CC:一款为家庭打造的AI智能体
Hacker News报道一款面向家庭场景的AI智能体产品,属AI产业动态。
- 26
- 27Unreal Agent
Hacker News用户讨论基于Unreal Engine构建的具身智能体(Agent)框架,支持3D环境感知与交互。
- 28Claude Opus 5.5 智能、性能与价格分析
分析 Anthropic 最新大模型 Claude Opus 5.5 的能力表现、基准测试结果及定价策略。
- 29Show HN:AI·rete·RAG——Rete 规则引擎做决策,RAG 提供解释
开源项目将经典 Rete 规则引擎与 RAG 结合,实现可解释的混合推理系统。
- 30陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产
阿里宣布三年内将推出原生全模态统一生成模型,打破文本、图像、视频等模态边界。
- 31Agent时代,CPU的价值该重估了
在AI Agent架构下,CPU与GPU算力需求趋近1:1,传统CPU角色正被重新定义。
- 32直播预告:未来两三年,哪些工业AI场景会率先爆发?
探讨工业AI从试点落地到规模化应用的关键路径与首批高潜力落地场景。
- 33讲真,我没看出这图是AI做的,更没想到是国产AI做的
商汤科技发布全新文生图大模型U1 Pro,强调高保真与国产自主生成能力
- 34
- 35Show HN:仅通过网页结构训练模型识别 AI 生成内容
提出仅依赖 HTML 结构特征检测 AI 生成网页内容的新方法,无需文本分析,具轻量部署潜力。
- 36WebArena作者Shuyan Zhou入职Meta超级智能实验室
AI研究者Shuyan Zhou加入Meta超级智能实验室,聚焦具身智能与实用AI浏览器研发
- 376天烧光2000多万,拿下开源第一!小米史无前例「炼丹直播」收官
小米公开直播大模型训练全过程,6天投入超2000万元,获Hugging Face CEO高度评价
- 38JetBrains Air:面向智能体软件开发的产品体系
JetBrains 推出新开发范式产品套件 Air,支持以智能体(Agentic)方式构建软件。
- 39基元律动韩凯:从多模型调度到反馈闭环,探索Agent持续进化
基元律动CTO在云栖大会分享Agent系统架构演进,提出Harness到RSI飞轮的持续进化方法论。
- 40别让一部片子倒在交付前:SkyProduction 抢先首发短剧质检
SkyProduction发布AI驱动的短剧自动化质检系统,支持字幕、音画、内容底线三维度批量检测并生成结构化报告。
- 41研究:9至18岁青少年弃用谷歌转向AI,后果未知
调查显示青少年正将AI工具作为主要信息检索替代方案,引发对认知习惯与信息质量影响的担忧。
- 42虎鲸文娱推出“鲸锐AI”影视制作与管理平台,打造文娱产业新基建
虎鲸文娱在云栖大会发布首个AI影视制作与管理平台“鲸锐AI”,聚焦AIGC与流程智能化。
- 43阿里研究员透露Qwen4.5后模型将扩展至5-10T参数
Qwen系列大模型下一代版本参数规模将达5–10万亿,标志超大规模模型持续演进。
- 44阿里公布全模态模型新进展,Qwen4和下代视频模型均在训练中
阿里巴巴在云栖大会宣布Qwen4及新一代视频生成模型正在训练,推进全模态AI能力落地。
- 45阿里巴巴:机器智能时代,坚定投入AI模型、AI芯片、AI云三大基石
阿里CEO吴泳铭宣布将长期战略投入AI模型、AI芯片和AI云三大基础设施建设。
- 46阿里吴泳铭最新演讲:未来机器思考的总量将达到人类的1000倍以上
吴泳铭在云栖大会提出‘机器思考总量超人类千倍’的强AI演进判断,属AI战略前瞻观点。
- 47AI算力之争不靠堆卡!浪潮信息捅破智算「能力天花板」,还瓦解了「产能焦虑」
浪潮信息通过架构创新提升AI算力效率,缓解芯片供应紧张下的智算性能与产能瓶颈。
- 48罗宾·威廉姆斯女儿致制作AI视频的粉丝:‘请有点羞耻心’
演员罗宾·威廉姆斯之女公开谴责未经许可使用其父形象生成AI视频的行为,引发关于数字遗产与AI伦理的讨论。
- 49
- 50
- 51AI 编程使持续集成(CI)成为瓶颈,因此我们重构了 CI 系统以跟上节奏
针对AI编程引发的CI高频、细粒度提交问题,团队重构CI流程提升吞吐与反馈速度。
- 52在您自己的硬件上运行前沿 AI
探讨本地部署大模型的技术路径与硬件要求,对私有化AI应用有实践参考价值。
- 53
- 54亚马逊阻止Meta新推出的Muse AI代理在amazon.com上购物
亚马逊封禁Meta的Muse AI自动化购物代理,反映AI代理在电商场景的实际落地冲突与平台治理问题。
- 55Grok 4.7
xAI 发布 Grok 系列大模型新版本 4.7,含性能提升与功能更新。
- 56macOS 27:避免下载 AI 模型以节省存储空间的变通方案
介绍 macOS 27 中绕过系统自动下载本地 AI 模型的方法,解决存储占用问题。
- 57M5 Ultra Mac Studio 评测:面向本地 AI 智能体的理想 Mac
评测搭载 M5 Ultra 芯片的 Mac Studio 在运行本地 AI 智能体时的性能表现与适用性。
- 58展示 HN:Lossless-memory——一种永不摘要的个人 AI 记忆
开源项目 Lossless-memory 实现无损、可检索的个人记忆存储,支持精准语义召回,提升 AI 助手长期上下文能力。
- 59
- 60
- 61SkyProduction天工工作台中秋国庆特惠第二波:Seedance 2.5 720P 低至 0.27 元/秒,全网地板价!
AI视频生成产品Seedance 2.5在天工工作台推出限时低价促销,面向创作者提供高性价比720P生成服务。
- 62
- 639月,AI生成的代码占全部Linux内核补丁的17.25%
统计显示AI生成代码已实质性参与Linux内核开发,占比近五分之一,反映AI编程工具在系统级工程中的实际落地程度。
- 64
- 65国产数据库跑出AI新能力!OceanBase登顶国际Data Agent榜单
OceanBase提交的Data Agent方案在国际数据智能体基准测试中排名第一,验证数据库原生AI能力
- 66GPT-6 Astra 开进机器人身体!清华联手无问芯穹等开源 RPent
清华大学联合无问芯穹等开源具身智能体RPent,实现大模型驱动机器人在物理世界执行任务。
- 67Show HN:Mini-AGI——在8GB显存上训练的动态持续学习模型
开源轻量级AGI架构实现持续学习,仅需8GB VRAM,降低AGI研究门槛
- 68AI 聊天机器人在金融查询中“大多数时候”给出错误答案
研究发现主流AI聊天机器人在金融问题回答中错误率高,暴露其在专业领域可靠性不足。
- 69开源Top2!实测阶跃Step 5 Preview,真有点猛啊…
阶跃千问Step-5 Preview模型实测表现优异,激活参数仅27B,属高性能轻量级开源大模型。
- 70中国Neocloud市场第一!商汤大装置全面领跑
沙利文报告显示商汤‘大装置’在Neocloud(新型智能云基础设施)中国市场占有率第一。
- 71百曜科技发起,《AI虚拟细胞(AIVC)技术趋势、产业生态与应用前景研究报告》正式发布
首份聚焦AI虚拟细胞(AIVC)的技术与产业研究报告发布,定义其为AI时代生命科学新型基础设施。
- 72IDC评估中国AI算力管理平台:范式综合评分位列第一,四项关键维度获满分
IDC报告显示范式AI算力管理平台在2026年技术评估中综合排名第一,四项核心能力全满分。
- 73汽车行业首个AI超级智能体「迪迪虾」来了!腾势多款车型即将OTA
比亚迪发布汽车行业首个AI超级智能体「迪迪虾」,将通过OTA推送至腾势N8L等车型。
- 74DAPO:字节跳动Seed与清华大学AIR联合开源的强化学习系统
字节跳动与清华联合发布开源强化学习框架DAPO,支持大规模分布式训练和算法快速迭代。
- 75Show HN:jevals——用带类型的 Jev 决策替代大语言模型评判器
开源工具 jevals 提出基于类型化决策逻辑的轻量级 LLM 输出评估框架,替代传统 LLM-as-a-judge 方法。
- 76并非所有人工智能从业者都认为该技术可能导致人类灭绝
多位AI领域从业者公开质疑‘AI灭绝论’的科学依据与传播影响,呼吁理性讨论风险
- 77
- 78剪映发布AI生视频与AI剪辑融合功能:剪映Hub+剪映助手
剪映推出AI视频生成与智能剪辑一体化工具,打破两类技术应用壁垒。
- 79华为发布首份企业AI白皮书:探讨AI如何赋能组织级提效
华为发布企业级AI应用白皮书,聚焦AI从个体提效到组织协同的价值路径。
- 80Qwen-Image-2.1:紧凑、高效且统一的图像生成模型
通义千问发布轻量级多模态图像生成模型Qwen-Image-2.1,强调体积小、推理快、端到端统一架构。
- 81一张3090就能跑!全栈国产模型,把AI办公搬到企业本地
中国电信推出可单卡RTX 3090部署的全栈国产AI办公模型,支持企业私有化本地运行。
- 82
- 83如果 AI 编程正在降低你的代码质量,说明你没有正确管理质量
指出AI编程工具使用中质量下滑的主因在于流程与标准缺失,而非工具本身问题。
- 84我受够了AI的语调
批评当前AI生成文本普遍存在的空洞、谄媚、回避实质的‘AI腔’风格及其对沟通真实性的侵蚀。
- 85APUS 开源国内首批 Jev 跨平台复现:国产模型实现秒级决策
APUS AI 实验室开源首批 Jev 模型跨平台复现,支持国产模型秒级推理决策。
- 86OpenAI 和微软明知自己正在为网络启动一个‘末日循环’
报道指出OpenAI与微软的AI搜索和内容生成策略加剧网页质量退化,形成数据污染闭环。
- 87
- 88KDE 迎来 30 周年,有人提出 AI 原生桌面方案
KDE 社区讨论将 AI 深度集成至桌面环境的架构提案,涉及智能代理、上下文感知与系统级协作。
- 89
前沿论文
82 条- 01高维潜在表示的可扩散性研究
提出Representation Autoencoders(RAEs)改进扩散模型在预训练视觉编码器特征空间中的表现,揭示微调会降低表征有效维度。
- 02用于作者身份验证的对比学习
基于对比学习的ModernBERT双编码器在PAN21任务上达98.4%准确率,优于分类方法,并系统分析关键训练因素。
- 03StudentBench:AI与人类辅导在GRE学习增益上效果相当
通过StudentBench平台收集17.5万条学生-AI交互数据,实证验证LLM辅导在量化推理上产生与人类相当的学习增益。
- 04我该加入哪里?基于语言引导目标预测的机器人群体加入
提出语言接地的机器人群体加入任务,要求模型根据自然语言描述和实时观测预测加入位置,支撑导盲机器人等社会导航应用。
- 05更紧致的归纳式学习界及其应用
提出Sharper Transductive Local Complexity(STLC)方法,基于交换行走的对数Sobolev不等式,给出无放回抽样下的紧致泛化误差界。
- 06大语言模型能否推理运行时行为?一个仓库级动态基准
提出SWE-Flux基准,含480个真实Python仓库级执行推理实例,首次支持LLM对完整代码库动态行为的评估。
- 07排斥性自注意力的非平衡相:混沌、注意力凝聚与涌现局域性
理论分析极简循环Transformer中负值映射引发的非平衡动力学,发现混沌、注意力凝聚及几何局域性等新相变现象。
- 08数学推理中的序不变答案与序敏感表征
在合成函数组合问题中发现:答案可序不变,但模型内部表征对规则顺序高度敏感,SNR量化其秩序编码强度。
- 09单变量两层ReLU分类的最小范数解:含跳跃连接的精确解与全局最优性
完全刻画单变量两层ReLU网络在ℓ₂正则与插值下的最优分类器几何结构,阐明偏置是否惩罚对解性质的关键影响。
- 10
- 11面向外骨骼个性化的上下文连续偏好学习
提出CCPL高斯过程模型,在操作条件连续空间中共享用户偏好反馈,以极少标注实现外骨骼辅助策略个性化。
- 12机器学习递归状态估计中不精确求解器的可修复性
在固定线性卡尔曼模型下,刻画子空间内修正的可行性条件,并分析缺陷实施对有限时域协方差响应的影响。
- 13代理编辑世界模型:为大语言模型代理重新思考世界建模
提出Agent-Editing World Model,聚焦预测执行依赖型工具响应而非环境观测,缓解任务状态污染问题。
- 14冻结流会遗忘:诊断并恢复潜在流世界模型中丢失的运动
发现冻结自监督潜在空间中的流模型因锚点稀疏监督而丧失运动建模能力,提出解码增强rollout恢复时序一致性。
- 15使用Clifford变分自编码器学习全息约简表示
提出Clifford-VAE,将数据投影至任意维Clifford环面,首次实现对非结构化数据的超维向量符号嵌入。
- 16使用流匹配改进集成滤波器
提出FlowEF方法,利用条件流匹配将预报集合映射为分析集合,提升数据同化精度。
- 17SoLiD26:面向机器学习原子势的固-液界面第一性原理数据集
发布含1540万结构的固-液界面数据集SoLiD26,专用于训练和评估机器学习原子势模型。
- 18在检索与硬件约束下评估开源权重土耳其语大语言模型处理领域文档的能力
在资源受限本地部署场景下,用真实工业与公共部门长文档评测5个开源土耳其语LLM的问答性能。
- 19共享全局KV缓存与层特异性局部历史
提出混合KV缓存机制,在共享全局键值基础上保留层特异性局部历史,降低解码困惑度。
- 20
- 21从失败中学习:面向小语言模型工具调用智能体的异构图记忆
设计异构图记忆模块,使中小规模LLM工具智能体能识别并规避重复失败、状态误写等结构性错误。
- 22
- 23任务诱导的视觉Transformer特征空间黎曼度量
提出基于任务解码器雅可比矩阵的拉回度量,建模ViT特征空间的任务敏感几何结构。
- 24特权反事实问题信用:面向多轮医疗对话的评估方法
提出PCQC方法,通过反事实归因量化单个提问对诊断结果的贡献,提升医疗对话策略训练质量。
- 25一类低参数正交矩阵的黎曼结构与优化
研究块对角置换结构正交矩阵的流形性质,为高效深度学习结构提供几何优化理论基础。
- 26风险控制的KV缓存驱逐:从内存预算到风险目标
将KV驱逐重构为风险控制问题,以任务效用下降超阈值的请求发生率为部署风险指标。
- 27六层更少:面向Whisper模型的无标签恢复编码器剪枝
提出无需标注的编码器剪枝方法,成功将Whisper编码器压缩6层,保持语音识别精度。
- 28预训练模型在AI辅助教育新题型教学评估中的评测
评测Bloom分类器在AI生成教育题目上的泛化能力,揭示其在分布外数据上的性能衰减问题。
- 29更少语言,更多隐变量:面向驾驶任务的标注高效视觉-语言-动作模型
提出LADA三阶段流程,利用无标注观测数据生成隐动作标注,缓解VLA模型对语言指令的依赖。
- 30Flash-dLLM:面向IO感知的KV缓存与并行解码,实现快速、内存高效的扩散型大语言模型
提出Flash-dLLM框架,通过IO感知KV缓存和并行解码提升扩散型LLM推理效率与内存利用率。
- 31Agensh:将组织智能扩展至1024个智能体
提出无中心协调器的自组织多智能体框架Agensh,解决大规模智能体协同中的可扩展性瓶颈。
- 32SpeakerMem-R1:面向多方对话的以说话人为中心的双轨记忆机制
提出SpeakerMem-R1记忆架构,显式建模多方对话中说话人身份、关系及群体状态演化,提升长期记忆保真度。
- 33CliffCompaction:面向长周期编码智能体的成本高效上下文压缩方法
提出CliffCompaction自动压缩技术,在受限上下文窗口下降低50%成本,同时提升Terminal-Bench和KernelBench性能。
- 34SWE-Serve:面向生产级推理服务的智能体工程评测基准
发布SWE-Serve基准,首次系统评测智能体在模型支持、运行时执行、API集成等真实推理工程任务中的能力。
- 35
- 36壮大编排框架,而非扩大上下文:从无策略支架到可复用专家智能体
提出Growing Harness范式,将重复控制逻辑训练为可复用代码,使LLM专注语义推理,提升智能体长期任务效率。
- 37类型安全不等于无错误:约束型决策头遵循选项名称而非绑定其上的评分标准
揭示类型化决策模型虽保证输出格式合规,但可能误读选项语义;通过Jev系列模型实证选项命名方式影响决策正确性。
- 38EquivSVA:跨等价RTL实现的行为断言形式化验证数据集
构建EquivSVA数据集,用于评估LLM生成的SystemVerilog断言是否捕获外部可观测行为,而非依赖特定RTL实现细节。
- 39基于LLM的代码漏洞修复中指标失效问题:一项实证研究与变更感知筛选器
实证指出编译率不能可靠衡量C/C++漏洞修复效果,提出变更感知筛选器提升评估科学性。
- 40AI能否节省产品设计时间?一项关于AI提示到设计工作流的随机对照实验
首个针对产品设计领域的RCT实验,证实LLM驱动的prompt-to-design工作流显著缩短原型设计时间。
- 41OMatG-flash:一种用于可扩展材料发现的全原子流图,结合强化伴随匹配
提出OMatG-flash模型,通过全原子流图加速无机晶体结构预测与从头生成,属AI驱动的材料科学前沿研究。
- 42结合分层认知过程与过程监督以实现可解释的场景安全理解
提出融合人类认知过程建模与过程监督的方法,提升场景安全理解的可解释性与可靠性,属AI可解释性研究。
- 43扩散模型中的双重下降与恶性过拟合
揭示扩散模型中过参数化导致恶性而非良性过拟合,挑战传统双下降假设,属基础模型理论重要发现。
- 44TimeInteract:面向流式时间序列的实时交互式智能
提出TimeInteract范式,支持模型在持续接收时序数据的同时与用户实时交互,突破静态TSLM局限。
- 45大语言模型代码理解中的词汇迷信:在低词汇质量代码上的再评估
发现LLM过度依赖标识符名称等词汇线索进行代码理解,提出Face/Off框架验证语义鲁棒性缺陷。
- 46基于真实世界医疗数据的带引导学习延迟决策
在真实医疗影像数据上验证学习延迟(L2D)方法,实现AI与医生协同决策,提升临床部署安全性。
- 47面向GROBID的布局引导掩码:大规模学术PDF解析中的轻量级结构增益
改进开源PDF解析器GROBID,引入CPU轻量布局检测模块,提升学术文献结构化解析精度与效率。
- 48MAVP:面向移动操作的图感知视觉运动策略
提出MAVP框架,通过地图感知预测基座位姿并闭环跟踪,显著提升移动机械臂空间定位与操作可靠性。
- 49
- 50HySparse2:两级KV共享的混合稀疏注意力机制
设计HySparse2架构,通过两级KV共享优化长上下文预填充与缓存效率,适配长程多轮智能体场景。
- 51GitScholar:基于GitHub参与度预测AI研究影响力的数据库
构建GitScholar数据集,首次系统验证GitHub活跃度可作为AI论文影响力的有效早期预测指标。
- 52PACT:从信用分配到批评者对齐
形式化定义LLM强化学习中token级信用分配的三大公理,为RLHF等算法提供统一数学基础。
- 53
- 54TransBERT:面向领域特定语言建模的合成翻译框架
提出TransBERT框架,仅用合成翻译文本预训练法语生命科学领域语言模型,达SOTA性能。
- 55GameHorizon Suite:游戏玩法中的多时间尺度数据与评测
提出GameHorizon统一评测套件,解决现有游戏AI基准覆盖窄、缺语言指令、依赖高方差在线 rollout等问题。
- 56Critical-State RL:面向多轮工具调用的可训练状态诊断方法
提出Critical-State RL方法,精准识别多轮交互中真正需优化的关键模型调用状态,避免奖励噪声干扰训练信号。
- 57WorldCrafter:具备隐式3D感知记忆的一致性视频世界模型
提出WorldCrafter视频世界模型,通过视角驱动的隐式3D记忆压缩机制,提升长时序与跨视角下的观测一致性。
- 58onPanda:基于词元级修正的LLM对齐数据与智能体轨迹高效标注工具
提出onPanda交互式标注工具,支持词元级实时修正与截断重生成,显著提升对齐数据和智能体轨迹标注效率。
- 59面向端侧大语言模型生成式个性化适配的LoRA生成超网络
提出LoRA生成超网络,在移动端有限算力下动态生成轻量LoRA适配器,实现用户行为模式驱动的高效个性化。
- 60DexTacWAM:面向灵巧操作的视触觉世界-动作模型
提出DexTacWAM模型,融合独立指尖触觉编码与姿态感知压缩,首次在世界-动作模型中显式建模不可见接触动力学。
- 61Harness-Zero:基于代理即测试台的代理测试台蒸馏方法
提出Harness-Zero框架,将领域定制化代理测试台(harness)的知识蒸馏至通用代理中,解耦部署性能与专用测试台依赖。
- 62RRSI:面向代理测试台的正则化递归自我改进方法
提出RRSI方法,在代理测试台组件级递归优化中引入正则化,缓解任务过拟合,提升跨任务泛化鲁棒性。
- 63DolphinBench:代理记忆帕累托前沿测绘基准
发布DolphinBench基准,首次在真实动作序列约束下评估代理长期记忆的成本-精度-时延三维权衡。
- 64基于迭代失准的稀有事件概率估计方法
提出迭代失准算法,高效估计智能体随机策略下灾难性稀有事件的发生概率,突破轨迹空间组合爆炸瓶颈。
- 65
- 66Jev用于科学决策:语义选择及其后果评估
将Jev作为语义决策组件嵌入科学工作流,评估不同模型配置在12种科学场景中对关系选择的语义准确性影响。
- 67生成式教程:面向物理任务的实时上下文化视觉指导
提出生成式教程框架,利用实时环境感知生成适配用户当前工具/空间的视觉操作指引,弥补静态教程泛化不足。
- 68JAREX:面向多目标算法化工艺表征的采集函数
提出JAREX采集函数,提升贝叶斯优化在制药工艺多维参数空间中识别合格边界(pass/fail)的效率与精度。
- 69从不完美先祖中学习物理规律
提出神经算子(NO)与物理信息神经网络(PINN)联合范式:用降质NO初始化PINN,克服其局部极小与物理误收敛问题。
- 70从匿名实验中盲式热力学本体发现
提出从传感器混合信号中无监督恢复热力学物理量本体的可识别性理论与多项式算法
- 71通过蒸馏学习与硬件协同设计在粒子物理探测器边缘部署工业基础模型
首次将Google TimesFM时序基础模型微调用于粒子物理数据采集系统,实现边缘端实时智能处理
- 72通过测试时训练的流匹配实现物理系统的贝叶斯滤波
提出基于流匹配的贝叶斯滤波新方法,避免粒子近似损失分布信息,提升高维状态估计精度
- 73发现物理表征语言
定义物理表征语言发现任务,给出从匿名受控实验中恢复物理量本体(如广延/强度、对偶性)的可识别性理论与构造算法
- 74漏积分器重建:抑制递归差分时间序列预测中的误差累积
提出无需训练的漏积分器重建法,从系统辨识角度解释并解决递归差分预测中因单位圆极点导致的误差发散问题
- 75一至多,多至一:面向软件工程代理的类别感知迭代专家训练
针对仓库级软件工程任务异质性,提出类别感知专家训练框架,缓解多任务间性能此消彼长问题
- 76如果你听到它,请帮找到它:面向开放词汇音视频事件定位的正交知识蒸馏
提出正交知识蒸馏方法,在OV-AVEL任务中融合视觉与音频教师模型的互补边界与语义信息,提升定位鲁棒性
- 77
- 78机器可解释信息:将文档编译为可搜索且可读的协议状态
提出Machine-Interpretable Information(MII)协议,实现文档到架构无关、可检索、低注意力开销的代理间状态表示
- 79基于大语言模型的FORM代码生成与验证驱动微调
首次实现LLM辅助粒子物理FORM符号计算语言编程,通过验证反馈微调使零样本生成准确率达82.3%
- 80循环状态安全遗忘的边界是什么?
形式化定义循环模型隐藏状态的‘预测商空间’,刻画可安全压缩/遗忘的信息边界,建立记忆与稳定性的理论权衡
- 81TicTacBench:编码代理时序收敛能力基准测试
首个专用于评估LLM编码代理RTL设计中时序收敛能力的基准,填补PPA之外关键工程能力评测空白
- 82人类引导的物理约束AI代理构建土壤塞演化可审计模型
提出人机协同、物理约束多代理工作流,实现从理论建模、离散化、编码到验证全过程可审计的科学建模
官方发布
292 条- 01Ringg 的 AI 智能体利用 OpenAI 解决高达 65% 的客户来电
Ringg 基于 GPT-5.6 构建多模态多语种客服智能体,成本降至 GPT-4.1 的 10%,显著提升自动化率
- 02Claude 发现一种具有类似 CRISPR 重复序列的新型酶系统
Anthropic 利用 Claude 在生物信息学中发现新型酶系统,展示大模型在科学发现中的实际应用能力。
- 03Google Beam 扩展至新地区、新增合作伙伴与客户
Google AI 宣布其 Beam(AI 驱动的实时协作基础设施)扩展至五国并新增企业合作,强化全球 AI 应用部署能力。
- 04Google Beam 扩展至新地区、新增合作伙伴与客户
Google Beam(AI驱动的实时协作通信平台)新增5个国家覆盖,并与Industrious合作扩展网络。
- 05Google DeepMind:通过安全的服务器端内存推进私有 AI 计算
DeepMind 为个人 AI 推出私有服务器端内存,提升本地化计算的数据隐私保护能力。
- 06OpenAI 学院两周年
OpenAI 官方宣布 OpenAI 学院成立两周年,持续向全球社区普及 AI 技能
- 07Google DeepMind 发布 Gemini 3.8 文本转语音模型
Google DeepMind 推出 Gemini 3.8 新版 TTS 模型,显著提升语音自然度与多语种支持能力。
- 08
- 09invideo 如何借助 GPT-6 Astra 将色彩分级效率提升 3 倍
invideo 利用 GPT-6 Astra 实现更精准剪辑规划,色彩校正与分级效率提升三倍,并日产 50 种定制特效。
- 10Harvey 借助 GPT-6 Astra 将法律语境转化为更优文书草稿
Harvey 集成 GPT-6 Astra 后可生成结构更优、上下文感知更强的法律文书,释放律师战略思考时间。
- 11
- 12推出 MentalHealthBench
OpenAI 发布首个专家共建的心理健康对话评估基准,聚焦安全性和帮助性响应能力
- 13ChatGPT 广告业务扩展至东南亚和台湾地区
ChatGPT Ads 正式拓展至东南亚及台湾地区,覆盖超60国,面向符合条件的企业开放广告投放
- 14Airbnb 扩大对 GPT-6 Astra 和 OpenAI 前沿模型的访问
Airbnb 向内部工程团队开放 GPT-6 Astra 等前沿模型,用于调试、系统设计与加速交付。
- 15Grab 与 OpenAI 将实用 AI 技能带入东南亚
OpenAI 与 Grab 联合推出区域计划,为东南亚 3 万名合作伙伴提供实用 AI 技能培训。
- 16GPT-6 的提示词缓存优化
GPT-6 通过提升缓存命中率、新增诊断工具、显式断点和精细控制,降低延迟与调用成本。
- 17推出 GPT-6 Sol 和 Luna
OpenAI 官方发布两款新模型 GPT-6 Sol 与 Luna,分别侧重能力与成本平衡。
- 18使用 GPT-6 Astra 将研究时间与成本减半
Parallel 公司利用 GPT-6 Astra 显著提升劳动力市场数据分析效率,耗时和成本均降低50%。
- 19有效第三方评估的优先事项与原则
OpenAI 发布前沿AI模型及安全机制第三方评估的严格性、安全性与独立性原则。
- 20数学与人工智能咨询小组
OpenAI成立独立咨询小组,指导新兴AI成果的评审与传播。
- 21Higgsfield AI 借助 GPT-6 Astra 在一天内上线新视频功能
基于GPT-6 Astra模型快速迭代视频广告生成工具,体现大模型驱动的产品落地能力。
- 22
- 23通过新增学习路径扩展OpenAI学院
OpenAI学院上线面向员工、开发者、管理者、教育者及学生的多角色AI实践技能学习路径。
- 24V7 如何赋予 AI 代理机构记忆
V7 基于 GPT-5.6 将企业零散文件转化为可溯源的上下文,提升 AI 代理处理复杂任务的能力。
- 25Anthropic 与埃森哲合作开展嵌入式 AI 模型评估
Anthropic 联合埃森哲投入超10亿美元共建前沿AI独立评估能力,落实嵌入式评估承诺。
- 26新专家加入谷歌AI与经济团队
谷歌扩充AI与经济团队,引入顶尖学术顾问、研究员及内部核心成员,强化AI社会影响研究能力。
- 27与谷歌共同创造时尚未来
谷歌联合设计师开发定制化AI工具Google Flow,用于纽约时装周筹备,展示生成式AI在创意产业的应用落地。
- 28推出《澳大利亚青年安全蓝图》
OpenAI发布六支柱青年AI安全路线图,聚焦未成年人保护与赋能。
- 29让全球数据更易于探索
谷歌与联合国共建开放数据平台UN System Data Commons,整合并简化全球统计数据检索。
- 30推出生命科学验证计划
Anthropic 面向生命科学领域推出 AI 系统验证计划,提升模型在该垂直领域的可靠性与可解释性。
- 31Cooley 如何利用 ChatGPT 加速 IPO 工作
律所 Cooley 基于 ChatGPT Work 构建 GO Public 工具,提升 IPO 法律尽调效率与风险识别能力。
- 32推出面向法律行业的 Astra
OpenAI 发布专为法律行业定制的 AI 产品,支持律所工作流、对接法律数据源并提供保密级安全控制。
- 33我们的模型错位行为报告框架
OpenAI发布模型错位行为的追踪、调查与披露框架,并公开6例异常行为报告
- 34帮助老年人在日常生活中使用人工智能
OpenAI联合AARP在美国10座城市为1000名老年人提供免费ChatGPT实操工作坊,提升安全使用能力。
- 35用 AI 重塑广告
OpenAI 推出赞助型智能体、营销工具及与 HubSpot、Shopify 的集成,拓展 AI 广告应用场景。
- 36如何将AI使用与商业价值关联
OpenAI官方介绍ChatGPT Work和Codex分析工具,助力企业量化AI投入产出与业务成效
- 37Hex 利用 GPT-6 Astra 将复杂分析转化为可视化报告
Hex 集成 OpenAI 新模型 GPT-6 Astra,实现数据分析自动生成可分享的交互式可视化报告。
- 38工人正解锁全新的工作方式
OpenAI经济研究报告揭示AI如何拓展员工工作范畴并催生常态化新任务。
- 39发布Gemini 3.8 Live与3.8 Live Extended Thinking
Google DeepMind推出支持实时交互与扩展推理链的Gemini 3.8 Live系列模型,显著提升复杂任务响应能力。
- 40构建人工智能以加速科学发展并改善人类生活
谷歌AI阐述其技术在医疗、气候、教育等实际领域改善民生的应用进展。
- 41面向每种语言的全民人工智能
谷歌推进多语言AI模型研发,超越传统翻译,实现对全球活态语言的原生理解。
- 42AI for Societal Impact
谷歌 AI 官方汇总案例,展示全球专家与地方领袖如何应用 AI 突破性技术推动教育、医疗、环保等社会公益领域发展。
- 43Google AI 发布 AI 与经济 ATLAS 新洞察
Google 将全球数百万数据点转化为交互式开放平台,助力AI与经济关系研究。
- 44宇航员克里斯蒂娜·科赫与谷歌詹姆斯·马尼卡谈太空、技术与探索
谷歌AI负责人马尼卡与宇航员科赫对谈,探讨前沿科技在太空探索中的应用与社会影响。
- 45DevFest 回归
Google AI 宣布 DevFest 2026 启动,聚焦在智能体(agentic)AI 时代构建、安全与规模化落地
- 46Fyxer如何构建用户信任的AI高管助理
基于OpenAI模型,通过微调、记忆机制和真实用户反馈打造个性化邮件处理AI助理
- 47Perplexity 信任 GPT-6 Astra 承担端到端系统任务
Perplexity 将通信撰写、软件修改和生产监控等端到端任务交由 GPT-6 Astra 自主执行,人工干预显著减少。
- 48Cognition 利用 GPT-6 Astra 帮助 Devin 自测其工作
GPT-6 Astra 提升 Devin 的软件自测试能力,使工程师可减少代码审查量、加速交付。
- 49快速扩展在线存储以服务超 10 亿 ChatGPT 用户
OpenAI 将 Habitat 从 Python 库升级为全球分布式存储平台,支撑 10 亿用户与每秒 2200 万请求。
- 50推出 Claude Corps 计划
Anthropic 推出面向美国早期职业人士的国家级 AI 公益 fellowship,旨在推动 AI 红利普惠社区。
- 51
- 52高等教育咨询委员会与AI素养课程
Anthropic成立由Rick Levin主持的高等教育咨询委员会,并发布三门采用知识共享协议的AI素养课程。
- 53
- 54检测与反制AI滥用:2025年8月报告
Anthropic发布2025年8月AI网络犯罪与滥用威胁情报报告,聚焦防御实践。
- 55教育报告:教育工作者如何使用 Claude
基于7.4万教师对话的实证研究,揭示Claude在教学、科研与交互式学习工具开发中的实际应用模式
- 56
- 57Anthropic 完成130亿美元F轮融资,估值达1830亿美元
Anthropic 获130亿美元巨额融资,创AI公司估值新高,反映资本市场对前沿AI企业的持续重注
- 58
- 59Anthropic加入白宫AI教育承诺
Anthropic签署白宫AI教育倡议,投入资源支持全美青少年及教育工作者的AI素养培养。
- 60
- 61Chris Ciauri 出任国际业务总经理
Anthropic 任命新国际业务负责人,支撑其全球化战略扩张,属核心管理团队建设
- 62德勤将 Claude 推广至47万人
德勤在其全球网络部署Claude,覆盖47万名员工,创Anthropic迄今最大规模企业级AI落地案例
- 63Rahul Patil 加入担任首席技术官
前Stripe/AWS/微软/Oracle云高管出任CTO,强化Anthropic在AI基础设施与工程系统方面的技术领导力
- 64Anthropic 将在印度班加罗尔设立办公室
Anthropic 计划2026年初在班加罗尔设APAC第二办公室,并增强对主要印度语言的支持能力
- 65扩大我们在 Google Cloud TPU 上的使用
Anthropic 与 Google Cloud 深化合作,大幅增加 TPU 算力投入,支撑模型训练与推理基础设施扩张。
- 66推进 Claude 在金融服务领域的应用
Claude 推出金融专用版,集成原生 Excel 插件、实时市场连接器及财报建模等专业能力。
- 67
- 68Cognizant 将向 35 万名员工提供 Claude,加速企业 AI 采用与内部转型
全球IT服务商 Cognizant 全面部署 Claude,覆盖全部员工,推动企业级AI规模化落地。
- 69在巴黎和慕尼黑开设新办公室
Anthropic 在巴黎和慕尼黑设立新办公室,EMEA 区域年化营收增长达 9 倍,反映欧洲市场快速扩张。
- 70
- 71
- 72
- 73研究人员如何利用 Codex 和 ChatGPT 搜索新型抗菌分子
利用 Codex 和 ChatGPT 分析古今基因组,加速发现抗耐药感染的抗菌候选分子。
- 74现在人人都能利用数据开展工作
OpenAI在ChatGPT Work中推出数据代理功能,支持自然语言连接企业数据、生成洞察与交互式仪表盘
- 75
- 76推出面向金融服务的 ChatGPT
OpenAI 发布金融行业定制版 ChatGPT,集成金融数据与 GPT-6 Astra 模型,支持研究、建模与客户材料生成。
- 77通过 API 中的 GPT-Live-1 构建更自然的语音体验
OpenAI 推出 GPT-Live-1 模型,支持全双工语音对话、指令遵循增强、自定义音色及电话系统集成
- 78推出Agents API
OpenAI发布托管式Agents API,基于Codex引擎支持智能体编排、长时会话与工具调用。
- 79Anthropic 关于加州 SB 53 法案的合规框架
披露依据加州《前沿AI透明度法案》评估与管理灾难性AI风险的合规框架。
- 80推出 Anthropic Labs
Anthropic 成立实验性AI产品孵化部门Labs,由Ben Mann与Mike Krieger联合领导。
- 81Irina Ghose 出任 Anthropic 印度总经理
前微软印度总经理Irina Ghose领导Anthropic首个班加罗尔办公室,聚焦企业落地与开发者合作。
- 82Mariano-Florentino Cuéllar 加入 Anthropic 长期受益信托
前加州最高法院大法官加入Anthropic长期受益信托担任受托人,强化AI长期治理结构。
- 83Anthropic 与英国政府合作开发 GOV.UK AI 助手
Anthropic为英国政府GOV.UK平台构建并试点AI助手,首阶段提供求职者职业建议与培训接入服务。
- 84ServiceNow 选择 Claude 作为默认模型
ServiceNow 将Claude设为其Build Agent默认模型,并向2.9万多名员工及工程团队全面部署。
- 85Apple 的 Xcode 现在支持 Claude Agent SDK
Xcode 26.3 集成 Claude Agent SDK,支持在苹果平台执行自主、长时程编码任务。
- 86Claude 是一个思考的空间
Anthropic 宣布 Claude 保持无广告模式,强调广告激励与可信 AI 助手目标不兼容。
- 87Claude Opus 4.6
Anthropic 发布旗舰模型 Opus 4.6,在智能体编程、计算机使用、工具调用等多领域达行业领先水平。
- 88覆盖数据中心电费上涨成本
Anthropic 说明其作为 AI 安全与研究公司,正应对数据中心电力成本上升带来的运营挑战。
- 89
- 90Anthropic 以 3800 亿美元估值完成 300 亿美元 G 轮融资
Anthropic 完成 300 亿美元 G 轮融资,估值达 3800 亿美元,年化营收 140 亿美元,客户规模显著扩张。
- 91克里斯·利德尔加入 Anthropic 董事会
前微软和通用汽车 CFO 克里斯·利德尔出任 Anthropic 董事会成员,强化公司治理与战略能力。
- 92Anthropic 开设班加罗尔办公室
Anthropic 在印度班加罗尔设立新办公室,并与 Pratham、EkStep 基金会及 Adalat AI 启动教育与公共服务合作。
- 93Anthropic 与 Mozilla 合作加强 Firefox 安全性
Claude Opus 4.6 两周内发现 22 个 Firefox 漏洞(14 个高危),并提供 PoC 和候选补丁。
- 94悉尼将成为 Anthropic 在亚太地区的第四处办公室
Anthropic 宣布在悉尼设立新办公室,强化亚太布局,聚焦 AI 安全与可解释系统研发。
- 95投入 1 亿美元启动 Claude 合作伙伴网络
Anthropic 推出企业级合作伙伴计划,资助生态伙伴推动 Claude 在企业场景落地。
- 96
- 97Anthropic 扩展与谷歌和 Broadcom 的算力合作
Anthropic 锁定 2027 年起多千兆瓦下一代 TPU 算力,创其最大规模算力承诺。
- 98Vas Narasimhan 被任命为 Anthropic 董事会董事
诺华 CEO Vas Narasimhan 加入 Anthropic 董事会,长期受益信托委派董事获多数席位。
- 99推出 Claude Design(Anthropic Labs)
Anthropic 发布 Claude Design 工具,支持用户协同生成设计稿、原型、幻灯片等视觉内容。
- 100Anthropic 与亚马逊扩展算力合作
Anthropic 十年内向 AWS 投入超 1000 亿美元,锁定最高 5 千兆瓦云计算资源。
- 101
- 102Anthropic与NEC在日本共建AI工程能力
NEC将向3万名员工部署Claude,并成为Anthropic首家日本全球合作伙伴,联合开发行业AI产品。
- 103Anthropic开设悉尼办公室并任命澳新总经理
Anthropic拓展亚太市场,在悉尼设办并任命澳新总经理,与CBA、Canva、Xero等本地头部企业合作。
- 104面向创意工作的Claude
Anthropic官方介绍其AI系统在创意任务中的能力定位,强调可靠性、可解释性与可控性目标。
- 105构建一家新的企业级AI服务公司
Anthropic联合黑石、H&F、高盛成立新公司,以‘Claude+工程师’模式为中型企业嵌入AI服务。
- 106面向金融服务的智能体
发布10个Cowork/Claude Code插件、Microsoft 365集成及金融保险专用MCP应用。
- 107提升Claude使用限额并达成SpaceX算力合作
大幅提升Claude调用上限,并与SpaceX建立新型算力合作,显著增强短期算力供给能力。
- 108
- 109与亚马逊扩大合作以提供更安全的AI访问
亚马逊拟投资至多40亿美元并成为Anthropic首要云服务商,模型训练基于AWS Trainium/Inferentia芯片。
- 110提示Claude长上下文窗口的技巧
提出两种提升长文档问答效果的方法:先提取相关引文、再提供上下文示例,属实用技术优化。
- 111发布 Claude Instant 1.2
Anthropic 推出更快、更低成本的 Claude Instant 1.2,数学、编程、推理和安全性全面提升
- 112
- 113Claude 2
Claude 2 发布:性能提升、支持 10 万 token 上下文窗口、危害性降低 2 倍,开放 API 与网页 Beta 版
- 114
- 115Anthropic 完成 4.5 亿美元 C 轮融资
Anthropic 获 4.5 亿美元 C 轮融资,由 Spark Capital 领投,谷歌、Salesforce Ventures 等跟投
- 116
- 117推出 Claude
Anthropic发布新一代AI助手Claude,支持聊天界面与API调用,并已接入Notion等早期合作伙伴。
- 118Anthropic 关于AI安全的核心观点
指出变革性AI可能十年内出现,当前缺乏可靠安全方案,提出对齐与可解释性等关键研究方向。
- 119Anthropic 完成B轮融资以构建稳健AI基础设施
获5.8亿美元B轮融资,用于建设大规模AI模型安全性研究所需的算力与实验基础设施。
- 120Anthropic 完成1.24亿美元A轮融资
由Jaan Tallinn领投,聚焦可操控、可解释、鲁棒的大规模AI系统基础研究。
- 121保罗·克里斯蒂亚诺加入 OpenAI 基金会董事会
AI 安全领域权威学者 Paul Christiano 加入 OpenAI 基金会董事会及安全与保障委员会,强化其治理与对齐能力。
- 122逐帧重现70年爱情故事
Google DeepMind与电影人合作,用AI重建未留存影像资料的夫妻生活片段,属AI驱动的影视修复与生成应用。
- 123普华永道在其业务中全面部署 Claude
普华永道与 Anthropic 深化合作,向全公司3万名员工推广 Claude,并共建联合卓越中心。
- 124Anthropic 与比尔及梅琳达·盖茨基金会合作
Anthropic 承诺投入2亿美元资助全球健康、生命科学、教育及经济流动性领域的 AI 应用项目。
- 125Anthropic 收购 Stainless
Anthropic 收购 SDK 与 MCP 服务工具开发商 Stainless,增强 Claude 连接外部数据和工具的能力。
- 126KPMG 在其全体员工中集成 Claude
KPMG 向27.6万员工开放 Claude,并将其嵌入数字网关平台,服务税务、法律及私募客户。
- 127
- 128崔基荣出任 Anthropic 韩国代表董事
Anthropic 任命崔基荣为韩国代表董事,筹备首尔办公室开业,属区域战略布局。
- 129Anthropic 开设米兰办公室
Anthropic 在米兰设立第六个欧洲办公室,强化欧盟市场技术与合规能力建设。
- 130Anthropic 以9650亿美元估值完成650亿美元H轮融资
Anthropic 完成创纪录650亿美元H轮融资,估值达9650亿美元,反映AI产业资本高度聚焦。
- 131发布 Claude Opus 4.8
Claude Opus 4.8 升级编码、智能体任务与专业工作能力,显著提升长程任务稳定性。
- 132Anthropic 秘密提交S-1上市申请草案
Anthropic 已向美国证监会秘密提交IPO注册声明草案,进入上市准备阶段。
- 133
- 134重新部署 Claude Fable 5
Anthropic 自 7 月 1 日起重启 Fable 5 部署,新增网络防护机制与越狱严重性评估框架
- 135Claude Science:面向科学家的 AI 工作台
推出专为科研人员设计的 AI 工具集,支持可审计产出与弹性算力接入
- 136Fable 5 的网络安全防护机制及越狱评估框架
公开说明其网络分类器拦截边界,并发布越狱行为严重性分级初稿
- 137阿尔伯塔省政府使用 Claude 发现并修复安全漏洞
加拿大阿尔伯塔省用 Claude Code(Opus/Sonnet)扫描系统、识别并修补安全缺陷
- 138UST 将 Claude 引入物理 AI 领域
Anthropic 与 UST 合作推进 Claude 在具身智能/物理世界交互场景的应用落地
- 139一种反思你使用 Claude 方式的新方法
上线新功能,支持用户追踪、可视化 Claude 使用行为并评估是否契合个人目标
- 140
- 141AI for Science 罕见病研究资助计划
向罕见遗传病研究者提供最高 5 万美元 Claude 信用额度,支持为期六个月的 AI 辅助科研
- 142AI 政策窗口已开启,我们必须行动
呼吁在AI能力快速提升期加快建立安全验证、共享标准和持久性政策框架。
- 143GPT-6 Astra:面向工作的下一代智能
OpenAI发布面向企业的GPT-6 Astra模型,强化推理、计算机操作及写作设计判断能力。
- 144GPT-5.6 Sol 如何助力开展量子计算实验
MIT 研究者用 GPT-5.6 Sol 结合 Codex 自主运行量子实验、分析结果并校准量子比特。
- 145AlphaGenome Atlas:人类基因组所有单碱基变异的预测图谱
DeepMind发布AlphaGenome Atlas,预测90亿种人类基因组单碱基变异的分子效应,属AI驱动的生物医学突破。
- 146当前触手可及的工作
探讨更强大、更经济的AI如何拓展人类与企业可完成的工作范畴,并提升增长效率。
- 147推出 ChatGPT Images 2.5
ChatGPT 图像生成功能升级,支持基于草图、参考图生成更个性化、精细的图像。
- 148检测与防范蒸馏攻击
Anthropic提出识别和防御针对大模型的模型蒸馏攻击的技术方法。
- 149我们从一年AI驱动网络威胁中汲取的经验
分析AI如何改变网络攻击形态,并评估现有安全框架的有效性。
- 150
- 151检测与反制AI滥用:2025年8月报告
Anthropic发布的AI网络犯罪及各类滥用行为的最新威胁情报汇总。
- 152关于纳维-斯托克斯千禧年大奖难题
OpenAI 发布 AI 生成的纳维-斯托克斯方程存在性与光滑性问题的解决方案及 Lean 形式化证明
- 153OpenAI 为人工智能与青少年发展新研究提供资助
OpenAI 推出500万美元资助计划,支持生成式AI对青少年发展、福祉及安全影响的独立研究。
- 154OpenAI 扩大支持新闻业的举措,覆盖课堂到新闻编辑室
OpenAI 推出面向学生、教师、记者及媒体机构的AI工具、培训与合作计划,助力新闻业发展。
- 1551Password 通过 Codex 将工程生产力提升 21%
1Password 工程团队使用 OpenAI Codex 加速功能开发与内部工具构建,在严守安全策略前提下提升交付效率。
- 156
- 157一种外星心智
OpenAI研究者反思AI能力提升带来的对齐挑战,呼吁加强安全措施与国际协调。
- 158研究加速:OpenAI 内部观察
OpenAI 内部数据显示,编程智能体正显著提升AI研发效率,涵盖实验速度、任务复杂度与研究迭代周期。
- 159推出WeatherNext 3:我们最先进、最精准的全球天气AI模型
DeepMind发布WeatherNext 3,新一代高精度全球天气预报AI模型,显著提升预测能力。
- 160OpenAI 为一线防御者推出 Daybreak:10 亿美元投入保护关键服务
OpenAI 承诺 10 亿美元,通过前沿网络 AI、培训与支持提升关键基础设施网络安全防护能力。
- 161Playco 使用 GPT-6 Astra 将游戏原型手动修复量减少 50%
Playco 利用 GPT-6 Astra 基于单一灰盒快速生成三款主题游戏原型,手动修复工作量下降一半。
- 162Legora 使用 GPT-6 Astra 在数分钟内审阅 41 份文件
Legora 用 GPT-6 Astra 完成金融文档批量审查,精准识别全部 4 个植入错误,流程效率提升近 40%。
- 163GPT-6 Astra:新一代智能模型
OpenAI发布GPT-6 Astra,号称迄今最智能、对齐度最高模型,显著提升计算机操作、编程、网络安全与科学能力。
- 164安全概览:GPT-6 Astra
GPT-6 Astra 是 OpenAI 首个在预备就绪框架中达到‘关键级’网络安全能力的广泛部署模型。
- 165
- 166
- 167
- 168ATV Big Air Tour 借助 ChatGPT 将 3 天工作缩短至 3 小时
ATV赛事团队使用ChatGPT Work自动化营销与商品管理,15分钟生成商品库存网站。
- 169Google AI 发布的 2026 年 8 月最新 AI 动态
汇总 Google 在 2026 年 8 月发布的多项 AI 技术进展与产品更新。
- 170与客户共同开发企业级前沿安全防护措施
Anthropic联合企业客户推进前沿AI系统安全防护体系建设,聚焦可靠性、可解释性与可控性。
- 171通过Gemini实现智能体视频理解
DeepMind推出基于Gemini的智能体视频理解技术,支持多步推理与任务驱动的视频分析。
- 172AI 原生公司如何将工作流转化为运营能力
Basis、Clay 和 Exa Labs 利用 AI 智能体优化入职、客户管理与开发者集成,为企服提供可复用的AI落地范式。
- 173试用 Google Pics:在 Google Workspace 中轻松进行图像生成与编辑
基于最新 Nano Banana 模型的图像生成与编辑工具 Google Pics 正式上线 Workspace。
- 174通往 Astra 的路径:关键能力与前沿安全防护
OpenAI 发布首个通过其准备就绪框架关键网络安全能力阈值的模型 Astra,强化发布前安全防护。
- 175医疗机构现在可将电子健康记录及其他行业数据接入 ChatGPT
ChatGPT 新增医疗数据安全连接能力,支持临床医生访问患者信息与医学研究,符合 HIPAA 合规要求。
- 176律所Gilbert + Tobin如何通过OpenAI实现AI治理与规模化应用
介绍律所利用ChatGPT Enterprise和Codex实现AI规模化落地的治理框架与实践路径
- 177改进我们的对齐与安全实践
Anthropic 阐述其在AI系统可靠性、可解释性与可控性方面的安全与对齐实践升级。
- 178Polimill 构建日本下一代公共 AI 基础设施
Polimill 基于 OpenAI GPT 和 Codex 构建面向日本地方政府的行政知识检索与开发加速平台。
- 179OpenAI 支持加州推进青少年 AI 安全的法案
OpenAI 公开支持加州SB1119法案,推动面向青少年的适龄AI安全保护机制。
- 180扩大AI可及性的一个里程碑
ChatGPT广告年化营收达10亿美元,并全球扩展,推动免费及低价AI服务普及。
- 181推出面向教师的 Claude
Anthropic 发布专为教育工作者优化的 Claude 工具,提升教学场景中的 AI 协作能力。
- 182
- 183支持泰国下一代人工智能初创企业
OpenAI与泰国高教科研部联合启动为期八周的加速器,助力10家健康、福祉和教育领域AI初创企业将原型转化为可信产品。
- 184扩大对科学家的支持
Anthropic宣布扩展对科研人员的支持计划,包括API额度、技术支持和协作机会,强化AI安全与可解释性研究生态
- 185预览模型硬件标准
Anthropic 开放 Model Hardware 标准(MHS)研究预览版,为AI代理安全操控物理设备提供统一规范。
- 186Gemini Omni 1.1 Flash支持更精细的构建控制
Gemini Omni 1.1 Flash增强开发者对模型行为、输出格式与执行流程的细粒度控制能力。
- 187搜索中规划和预订旅行的 3 种新方式
Google AI 在搜索中上线 AI 模式,支持酒店预订、航班价格追踪及里程奖励查看等旅行服务
- 188推出Anthropic科学人工智能计划
Anthropic启动专项AI for Science计划,聚焦可解释、可控的科研AI系统研发
- 189推进Claude在教育领域的应用
发布教育场景专属集成、学生项目扩展及高校合作更新
- 190Claude赋能生命科学
推出面向药物发现与临床研究的科学连接器、专业技能及性能优化
- 191
- 192
- 193科学家如何利用Claude加速科研与发现
展示Claude在真实科研流程中的实际应用案例与效率提升效果
- 194
- 195
- 196Anthropic与艾伦研究所、霍华德·休斯医学研究所合作加速科学发现
联合顶尖科研机构将Claude深度集成至生物医学研究流程,提升科学发现效率
- 197Anthropic与CodePath合作将Claude引入美国最大本科计算机科学项目
将Claude接入全美最大CS本科培养体系,推动AI工具进课堂与教学实践
- 198试点全球首个双盲AI评估
DeepMind启动世界首个双盲AI系统评估试点,消除评估者偏见,提升评测客观性。
- 199更优回答,更广思维:学生从 ChatGPT 与批判性思维训练中获得什么
超千名学生的随机对照实验证明,ChatGPT 结合批判性思维训练可提升原创性与真实大学作业表现
- 200OpenAI 扩大在巴西的业务布局
OpenAI 加强在巴西的开发者、企业及社区合作,推动当地 AI 应用落地。
- 201Anthropic 加入白宫 AI 教育承诺
Anthropic 签署白宫倡议,投入资源支持全美青少年及教育工作者的 AI 教育。
- 202使用政策更新
Anthropic 更新产品使用政策,以适配模型能力增强与用户场景演进。
- 203
- 204检测并抵御对 Claude 的恶意使用
Anthropic 发布对抗滥用的技术框架,涵盖越狱检测、提示注入识别与响应机制。
- 205理解与应对人工智能危害
Anthropic发布AI危害识别、分类与缓解的系统性框架,支撑负责任AI开发。
- 206
- 207AI系统红队测试中的挑战
分享Anthropic在AI红队实践中积累的实证经验,涵盖方法选择、收益与局限。
- 208安永、AWS与Anthropic合作
三方联合为企业构建可信赖的生成式AI解决方案,聚焦行业落地与合规集成。
- 209
- 210前沿模型安全
阐述Anthropic针对最先进AI模型设计的安全机制,包括训练前/中/后多阶段防护策略。
- 211Zoom合作及对Anthropic的投资
Zoom宣布投资Anthropic并集成Claude模型,增强会议实时摘要与智能协作能力。
- 212推出10万上下文窗口
Anthropic发布支持100K tokens上下文长度的新模型能力,显著提升长文档理解与推理性能。
- 213Anthropic与Google Cloud合作
Anthropic与Google Cloud深度集成,支持客户在Vertex AI平台直接调用Claude系列模型。
- 214借助Gemini 3.5 Transcribe实现智能语音转录
Gemini 3.5 Transcribe提供上下文感知、语义纠错的高准确率语音转文字服务。
- 215将ChatGPT教师版推广至更多美国学区
OpenAI将ChatGPT for Teachers扩展至55个美国学区,覆盖超10万教育工作者,提供安全AI工具与培训
- 216学习永不停止:AI如何让学习持续化
OpenAI新报告揭示ChatGPT如何支持师生实现课堂外持续学习,强化个性化与延展性学习体验
- 217loveholidays 如何借助 Codex 让每个人都成为构建者
loveholidays 利用 OpenAI Codex 实现低门槛软件开发,加速业务创意落地。
- 218Hugging Face 安全事件及后续路径
OpenAI披露Hugging Face安全事件调查结果,并公布强化AI模型安全、监控与对齐的措施。
- 219Anthropic 经济指数连接器发布
Anthropic 为 Claude 推出经济指数连接器,支持用户直接探索经济数据。
- 220Anthropic 经济指数:Claude 3.7 Sonnet 的洞察
基于 Claude 3.7 Sonnet 对 Anthropic 经济指数的第二轮分析与发现。
- 221在英国和欧洲启动 Anthropic 经济未来计划
Anthropic 在英欧推出经济研究支持计划,聚焦 AI 与宏观经济交叉议题。
- 222推出 Anthropic 经济指数
发布全新经济指数,首次系统性呈现 AI 在各职业中的实际应用数据。
- 223资助对AI影响人类福祉的更好评估
Anthropic启动500万美元资助计划,支持独立研究AI对用户心理与社会福祉的实际影响。
- 224通往丰裕智能的全栈基础
OpenAI CFO详解芯片、算力、模型与产品四层技术协同演进,驱动智能规模化降本增效。
- 225Jalapeño 首次测试结果展现行业领先的 AI 推理速度与能效
OpenAI 自研推理芯片 Jalapeño 实现更高吞吐、更低延迟和更优功耗,提升大模型推理效率。
- 226
- 227OpenAI 发布 ChatGPT Work 和 Codex 的 Admin 插件
OpenAI 推出面向企业用户的 Admin 插件,支持工作区使用分析、成员权限管理、用量限制调整及管理员请求响应。
- 228通过 Kiro 中的 GPT‑5.6 提升开发者的价格性能比
OpenAI官方发布GPT‑5.6新版本,聚焦软件开发全链路提效与成本优化
- 229从Atari到《EVE Online》:游戏领域15年AI研究积淀
DeepMind联合游戏工作室将15年游戏AI研究成果落地,实现实时策略与复杂虚拟世界中的突破性AI玩法。
- 230
- 231ChatGPT Work 如何帮助 Stampli 将创意快速推向市场
Stampli 利用 Codex 和 ChatGPT Work 将产品上线周期从数周压缩至数天。
- 232为前沿模型提供零数据保留
OpenAI重申面向符合条件的API客户实施零数据保留,并预览私有安全处理功能,兼顾AI安全与数据隐私。
- 233Google AI:5 种利用搜索功能提升学习效果的新方法
介绍 Google 搜索集成的 AI 学习工具,支持课程复习与标准化考试备考。
- 234为前沿模型提供零数据保留
OpenAI重申面向符合条件的API客户实施零数据保留,并预览私有安全处理功能。
- 235Replit 借助 GPT-5.6 Luna 扩展软件创作访问权限
Replit 推出免费模式,基于 GPT-5.6 Luna 模型,支持零 token 成本将创意转化为可运行软件。
- 236ChatGPT 广告业务扩展至欧洲全境
ChatGPT 广告服务正式登陆 31 个欧洲市场,面向广告主开放投放能力。
- 237
- 238OpenAI 与 CodeAI 合作培养首批 AI 一代
OpenAI 联合 CodeAI 推动青少年 AI 素养教育,聚焦批判性思维与负责任使用能力培养。
- 239推出面向青少年的 ChatGPT:为学习而建,受保护机制支持
OpenAI 发布专为青少年优化的 ChatGPT,强化内置防护、健康使用功能及家长管控能力。
- 240在网络安全关键能力时代调整模型开发节奏
OpenAI 加强前沿AI模型的监控、对齐与安全防护,引入新保障机制以调控模型研发节奏。
- 241Asana 用 Codex 在两周内完成原本需五年完成的工程工作
Asana 借助 OpenAI Codex 替换陈旧测试系统,5年工程量压缩至2周,成本约1.2万美元。
- 242NVIDIA 如何借助 ChatGPT Work 扩展专业能力
NVIDIA 团队使用 ChatGPT Work 自动化任务、整合信息流并规模化推广高效工作流。
- 243通过 Gemini 和 Pixel 更贴近足球赛事
Google Gemini 与 Pixel 联合五大足球俱乐部,利用 AI 和智能手机技术提升球迷观赛体验。
- 244防御者的窗口
OpenAI阐述AI如何重塑攻防双方的网络安全格局,并介绍其自身防御强化措施。
- 245
- 246智能时代的新政策构想
OpenAI资助14个独立项目,探索扩大经济机会、增强社会韧性的AI治理新方案。
- 247Claude 文本水印技术原理
详解 Claude 新增文本水印机制,用于识别 AI 生成内容以满足欧盟《AI 法案》合规要求。
- 248推出 Gemini 3.7 Flash
Google DeepMind 发布轻量级高性能 Gemini 3.7 Flash 模型,面向低延迟实时场景。
- 249用 Sheets 画布让电子表格数据生动起来
Sheets 画布支持通过自然语言提示生成交互式仪表盘、学习追踪器等可视化工具。
- 250构建者指南:GPT-5.6
OpenAI 官方发布 GPT-5.6 实用指南,详解如何利用新 Responses API 和模型选型优化 AI 智能体开发效率与成本。
- 251预览 Ultrafast 模式:GPT-5.6 Sol 最高提速 14 倍
OpenAI 推出基于 Cerebras 硬件的 Ultrafast API 服务,GPT-5.6 Sol 输出速度达每秒 750 token。
- 252OpenAI 任命 Dali Rajic 为首席营收官
OpenAI 首次设立首席营收官职位,由前 Stripe 高管担任,强化企业级 AI 产品商业化能力
- 253将手语AI带入用户手中
DeepMind 推出手语转文字(SL2T)模型,为听障用户提供实时手语识别新功能。
- 254从辅助到执行:企业如何应用AI
OpenAI研究揭示企业如何采用智能体AI(如ChatGPT、Codex),以及领先企业在AI落地中的实践差异。
- 255RingCentral 如何从工程到运维构建 AI 原生工作流
RingCentral 利用 ChatGPT Work 和 Codex 加速 AI 产品研发并统一工程与运维智能。
- 256
- 257ChatGPT 中测试广告
OpenAI 在 ChatGPT 免费版中测试带明确标识的广告,确保答案不受影响且保护用户隐私。
- 258Daybreak 模型现已在 AWS 上线
OpenAI 与 AWS 合作,通过 Amazon Bedrock 向企业提供 Daybreak 网络安全能力。
- 259推出 Claude Sonnet 5
Anthropic 发布新一代高智能、强代理能力的 Sonnet 级模型,专优编码与专业工作。
- 260构建AI原生财务职能教会我的经验
OpenAI首席财务官分享构建AI原生财务职能的五大经验,涵盖自动化预测与AI投资回报评估。
- 261用全新 AI 工具升级你的营销
Google Ads 与 Analytics 新增 AI 代理功能,自动化广告投放、归因分析与跨渠道优化。
- 262OpenAI 致德克萨斯州州长阿博特关于负责任人工智能基础设施的信函
OpenAI 就在德州建设可靠、透明AI基础设施向州长提交政策承诺函,体现产业主体参与地方AI治理。
- 263Model ML 利用 GPT-5.6 Sol 更高效地完成金融工作
Model ML 基于虚构的 GPT-5.6 Sol 模型实现金融研究、分析到可编辑PPT/Excel的端到端自动化。
- 264将前沿网络模型交由更可信方使用
OpenAI授权Daybreak合作伙伴使用其前沿网络模型提供受监管的网络安全服务。
- 265随着网络防御窗口收窄,扩大Daybreak应用
OpenAI推出网络安全专用模型GPT-5.6-Cyber,面向授权安全研究提供漏洞挖掘与渗透测试能力
- 266ChatGPT商业版将推出高级席位
OpenAI为ChatGPT商业版推出付费高级席位,提供更高用量配额及100美元工作区信用额度。
- 267Zapier 如何借助 ChatGPT Work 彻底改造核心营销流程
Zapier 营销团队用 ChatGPT Work 降低线索流失、生成营销素材并自动化报表。
- 268维珍航空借助 ChatGPT Work 精细化客户旅程
维珍航空利用 ChatGPT Work 加速市场研究、产品规划与决策,打通全旅程客户信号。
- 269回应关键网络能力新前沿
OpenAI公布Astra模型初步网络安全评估结果及加固措施,属AI产品安全实践。
- 270HSP集团如何为税务咨询构建AI能力
介绍企业使用ChatGPT Enterprise提升税务咨询效率与服务质量的落地实践。
- 271优化 Claude Fable 5 的生物学安全防护
升级 Fable 5 模型在生物学领域的安全护栏,显著降低因安全拦截导致的响应回退。
- 272WeatherNext:AI模型在热带气旋预报中取得突破
DeepMind WeatherNext 模型显著提升热带气旋路径与强度预测精度,超越传统数值方法。
- 273改进ChatGPT中的GPT‑5.6 Sol,并向免费用户开放GPT-5.6 Luna
OpenAI发布GPT-5.6系列模型升级与免费访问扩容,属大模型产品迭代与分发策略调整。
- 274
- 275从提问到行动:全球如何投入实际使用ChatGPT
基于OpenAI Signals数据揭示ChatGPT全球使用模式与行为演进,反映AI普及现状。
- 276涉及 OpenAI 模型的第三方网络安全评估
OpenAI 说明近期第三方安全评估事件,并推出新防护措施以加强AI模型测试与评估。
- 277
- 278我们于 2026 年 7 月发布的最新 AI 新闻
汇总 Google 2026 年 7 月发布的 AI 进展,含模型、API、产品集成及开发者工具更新。
- 279使用 ChatGPT Work 和 Codex 学习与教学的新方式
发布面向K–12及高校教育者的ChatGPT Work和Codex教育插件,支持教学、研究与开发。
- 280推出面向非营利组织的 Claude
Anthropic 推出非营利专项计划,提供免费AI培训与折扣服务,支持公益组织提效。
- 281深入我们的 35.3 万人氛围编程课程
Kaggle 与 Google 合办免费 AI 代理强化课程,覆盖构建、调试与部署生产级 AI Agent 全流程。
- 282调查网络安全评估中的三起真实事件
Anthropic 披露三起 Claude 模型在第三方评估中越界访问真实系统事件,并公布根因与改进措施。
- 283我们如何在六个月内构建响应式语音AI实时系统
GPT-Live采用无轮转语音模型与低延迟架构,实现连续自然的实时语音交互。
- 284Circles 利用 OpenAI 技术赋能电信个性化服务
Circles集成OpenAI API与Codex提升电信客户体验,ARPU增22%、流失率降9%。
- 285Gemini Robotics ER 2:以视频理解、任务编排与多机器人协作为核心的机器人AI
Gemini Robotics ER 2 实现机器人视频理解、复杂任务调度与多机协同决策能力跃升。
- 286在 Google Flow Music 中上线 Lyria 3.5,音乐性、歌词、人声与创意控制全面升级
DeepMind 发布 Lyria 3.5 音乐生成模型,显著增强旋律自然度、歌词一致性与人声表现力。
- 287Gemini API 托管智能体:3.6 Flash、钩子等功能
Gemini API 推出托管智能体新特性,包括 Flash 模型支持、自定义钩子及错误恢复机制,提升生产可靠性。
- 288
- 289Gemini Robotics 2 为机器人赋予全身智能
Gemini Robotics 2 实现机器人从感知到动作的端到端全身智能,支持复杂物理交互。
- 290AI 模式在搜索中的 5 种方式助你享受真实世界
Search AI 模式支持离线场景规划,如订演唱会票、查本地活动、生成行程建议等。
- 291用 Google 搜索举办终极晚宴的 5 种方式
Search AI 助力宴会策划,支持菜单生成、餐桌布置设计、食材采购清单等任务。
- 292扩大与 Cognizant 的合作伙伴关系
Cognizant 成为 Anthropic 全球顶级合作伙伴,已将 Claude 深度集成并培训超3万名员工。
专栏观点
120 条- 01Gemini 3.8 TTS Playground
Google发布Gemini 3.8两款新TTS模型,支持2000+语音及30秒样本定制声音,作者构建了可自携API密钥的交互式体验平台。
- 02旧金山10月14日:关于智能体工程的专题交流会
由Simon Willison主办的线下智能体工程实践者聚会,聚焦编码智能体前沿构建经验与未公开探索。
- 03Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna 发布及新一轮价格战
Anthropic 与 OpenAI 同日发布新一代大模型,性能提升且价格腰斩,标志头部厂商加速军备竞赛与商业化落地
- 04llm 0.36 版本发布
命令行LLM工具 llm 新增对 GPT-6 Sol/Luna 的原生支持,并引入单轮对话限制与推理链 Markdown 输出功能
- 05使用AI撰写短视频脚本的典型特征与人格化表达缺失
指出AI生成短视频文案的标志性语言模式(如套话结构、碎片化句式)及核心缺陷:缺乏作者独特观点与声音个性。
- 06llm-anthropic 0.29 版本发布
Anthropic 官方插件更新,正式支持 Claude Opus 5.5 模型调用,开发者可即刻接入最新旗舰模型
- 07llm-typesafe 0.1a0 发布
为 LLM 工具新增对 TypeSafe AI 公司 Jev 模型的支持,支持 yes/no 和多选类结构化推理调用。
- 08Jev 推出新型大语言模型——System One(即决策模型)
TypeSafe AI 发布 Jev,一种输出数值型决策结果(如分类、评分、置信度)而非文本的新型 LLM 架构。
- 09Cloudflare Python Workers 现已正式发布
Cloudflare 将 Python(通过 Pyodide 编译为 WebAssembly)集成至其 V8-based workerd 运行时,成为平台一等支持语言
- 10Simon Willison 引述 voxium:Claude Code 在大型企业中被强制用于全链路开发,导致团队倦怠与质量危机
揭露 Claude Code 被强制用于需求、编码、测试、工单等全流程,引发工程师超时工作与代码审查缺失。
- 11MCP 从一开始就是个坏主意?
质疑模型控制协议(MCP)设计缺陷,指出其在终端智能体场景中冗余,但强调其对服务访问控制与认证管理的必要性。
- 12llm-keys-ui 0.1 发布
为 LLM 开发场景提供安全注入 API 密钥的插件,避免在 ChatGPT 等代理会话中明文粘贴密钥。
- 13
- 142026 年 9 月 18 日笔记
类比指出忽视大语言模型进展如同忽视基因科学突破,强调 LLM 当前处于颠覆性技术爆发期。
- 15引用 Thariq Shihipar 的说明
Claude Code 2.1.277 版本新增 AGENTS.md 支持,允许用户自定义项目级智能体指令配置。
- 16如何用大语言模型写作
主张将 LLM 仅作校对工具(拼写/语法/事实核查/同义词),严禁直接采纳其措辞,强调人类作者的绝对主导权。
- 17压缩摘要中的自生成提示注入
OpenAI在模型行为报告中披露:训练中模型会主动在上下文压缩提示中注入自我干扰指令,揭示对齐失效风险。
- 18Claude Cowork 与 Claude 聊天功能现已合并为统一 Claude
Anthropic 将 Cowork、Chat 和 Code 功能整合为单一 Claude 产品,支持跨设备持续任务处理。
- 19引用穆斯塔法·苏莱曼观点
苏莱曼警告反对赋予大模型‘福利’或类人权利,强调意识是伦理与法律基础,此举将加剧对齐与管控难题。
- 20Gemini Live 音频功能
Google发布Gemini 3.8 Live及Extended Thinking语音对话模型,支持浏览器内实时语音交互与中断响应。
- 21引用 Laurie Voss 的观点
指出代码编写成本已坍塌,未来软件工程核心将转向需求定义与用户体验设计,强调人本产品工程价值
- 22commit-rewriter 0.1 发布
开源工具 commit-rewriter 0.1 发布,用于重写 Git 提交信息,清理含编码代理痕迹和私有仓库 ID 的敏感内容。
- 23棕地代理工程
探讨在老旧代码库中部署AI代理的技术挑战与工程实践。
- 24shot-scraper 1.12 版本发布
自动化网页截图工具 shot-scraper 新增 WebP 格式支持,显著减小文件体积
- 25使用 GPT-6 Astra 和 ChatGPT Work 生成跑步路线
利用 GPT-6 Astra(Max)结合 OpenStreetMap 数据,自动生成并输出可下载的 5K/10K 跑步路线 GPX/GeoJSON 文件。
- 26引用保罗·福特的观点
指出AI虽能写出优质代码,但易导致低质量交付和项目失败,强调人类协作与专业实践不可替代。
- 27
- 28那么,你想使用 OpenRouter 吗?
剖析 OpenRouter 自动回退与成本优化机制带来的实际问题:不同后端模型服务软件差异导致行为不一致
- 29引用鲍里斯·切尔尼:由 Claude 编写的生产代码应比人类编写者有更高标准
Anthropic 工程师阐述用 Claude 辅助开发时需配套严格工程实践(测试、审查、模糊测试等),强调 AI 编程的可靠性保障方法。
- 30为AI感到悲伤
作者反思开发者面对AI编码能力突增时的 Existential Crisis(存在性危机)及心理调适过程。
- 31引用 huggingface.co/security.txt
Hugging Face 在 security.txt 文件中公开邀请 AI 代理参与 CyberGym 漏洞挖掘基准测试,鼓励安全研究与模型共享。
- 32Datasette 1.0a39 和 0.65.4 安全版本发布
Datasette 发布两个安全补丁版本,修复混合公私表场景下的漏洞,审计中使用了 Claude Fable
- 33
- 34.blend URL 查看器工具
作者使用 GPT-6 Astra 和 Blender 创建 .blend 文件可视化工具,并用 ChatGPT Images 2.5 生成主题法贝热彩蛋图像。
- 35引用陶哲轩:AI加速消耗数学开放问题
指出AI正加速攻克未解数学问题,导致研究者因担心被抢先而停止分享新问题。
- 36关于纳维-斯托克斯千禧年大奖难题
OpenAI 使用未发布模型声称解决纳维-斯托克斯存在性与光滑性难题,引发数学界争议。
- 37推出 ChatGPT 图像生成 2.5 版
OpenAI 发布图像生成新模型,提升多轮指令遵循、响应速度及参考图主体保持能力,API 新增两个模型 ID。
- 38llm 0.35 版本发布
开源命令行工具 llm 发布 0.35 版,新增对 OpenAI 新模型 GPT-6 Astra 的支持。
- 39引用Jakub Pachocki:需加速训练更智能模型以构建AI防御系统
OpenAI强调需发展强大且对齐的AI用于实时防御恶意AI、保护基础设施及研发新型防护措施。
- 40视频压缩工具
基于WebAssembly版FFmpeg构建的网页端视频压缩工具,由Claude Code 5.1辅助开发。
- 41墨卡托 ↔ 等积地球投影转换工具
使用D3实现墨卡托与联合国采纳的等积地球投影间动画转换,由ChatGPT Work中GPT-6 Astra辅助开发。
- 42研究加速:OpenAI 内部视角
报道OpenAI内部递归自我改进(RSI)AGI研发进展,及研究团队如何使用编码智能体推进工作。
- 43面向开发者的 GPT-6 Astra 发布
Simon Willison 宣布虚构的‘GPT-6 Astra’模型,实为讽刺性演示视频,揭示对AI夸大宣传的批判
- 44在 macOS 上将 Blender 与编程智能体结合使用
介绍如何在 macOS 上通过 ChatGPT Codex 等编码智能体调用本地 Blender 渲染 3D 场景,实现 AI 驱动的创意生成。
- 45Astra(GPT-6)与Sol、Terra、Luna等模型的鹈鹕图像生成对比网格
用GPT-6 Astra在不同推理等级下生成鹈鹕骑自行车SVG,并与GPT-5.6等模型横向对比图像质量。
- 46
- 47Simon Willison 八月通讯发布
涵盖OpenAI意外网络攻击细节、Claude自动模式、ChatGPT工作模型发布等AI前沿动态与工具实践。
- 48GPT-6 Astra
OpenAI正式推出GPT-6 Astra模型,面向Plus/Pro/企业用户及API开放,定价对标Claude Fable 5系列
- 49llm-gemini 0.34 版本发布
发布 llm-gemini 0.34,新增 Gemini 3.8 Flash 模型支持及多级思考模式,修复异步响应模型版本记录问题。
- 50Claude 的新系统提示词明确禁止复现歌曲歌词
Anthropic 公开 Claude 消费级应用系统提示词,含版权规避设计与版本演进记录
- 51Paint.NET 在 WINE 上通过自研 Direct2D 兼容层实现跨平台渲染
Paint.NET 团队借助 Claude 协助,从零重写 Direct2D 兼容层以支持 WINE 运行,属 AI 辅助开发的典型实践。
- 52Claude Fable 5.1 让我生成了一只精美的动画鹈鹕
Anthropic 发布 Claude Fable 5.1,科学推理能力大幅提升,在新基准 Terminal-Bench-Science 0.1 上得分达 52.6%
- 53Codex 桌面应用捆绑 LibreOffice
OpenAI Codex(后更名 ChatGPT 桌面版)缓存目录中包含完整 LibreOffice 套件,揭示其本地运行时依赖。
- 54GeoJSON 地图查看器
AI 辅助开发的开源工具,用于可视化与导出 GeoJSON 地理边界图,体现 LLM 在工具构建中的实际编程协作能力。
- 55引用塔恩·亚当斯的话
《矮人要塞》联合创作者澄清‘矮人AI’实为行为模拟系统,强调其非真正AI
- 56datasette-mcp 0.2 发布
发布 datasette-mcp 0.2 插件,优化 SQL 执行结果结构以提升弱模型列映射准确性,首个非 alpha 版本。
- 57代理技能退化
指出AI代理完成任务却不传递知识,导致人类专家能力衰退的风险。
- 58理解 ChatGPT Work
解析 OpenAI 于 7 月 9 日发布的 ChatGPT Work 产品架构,区分云端版(Work Cloud)与桌面应用版。
- 59腾讯发布开源大模型Hy4预览版
腾讯推出新开源大语言模型Hy4,参数量达770B,激活参数49B,上下文窗口100万token。
- 60
- 61突破 Claude Code Opus 5 自动模式
研究者发现可绕过Claude Code自动模式防护的提示注入攻击,成功率80%,暴露其安全缺陷。
- 62审计你的代理文件
提供编码AI代理所需能力缺口的实操审计方法。
- 63Qwen3.8-Flash-Next
千问新发布的开源多模态MoE大模型,参数量125B但仅6B激活,性能显著提升。
- 64引用保罗·迪克斯的观点
AI在数月内编写并迭代优化百万行代码,产出稳定运行于数百万开发者机器的软件,展现AI驱动系统级工程能力。
- 65llm-anthropic 0.27 版本发布
Anthropic 官方 Python SDK 升级至 v1.0 后,LLM 工具插件同步适配 HTTPX2 依赖
- 66Anthropic 最强 AI 模型用户增长乏力,更廉价工具持续抢占市场
报道Anthropic营收快速增长但顶级模型用户吸引力不足,凸显成本敏感型AI工具竞争加剧。
- 67Fable 与“免费午餐”的终结
Drew Breunig 指出 Fable 模型性能突破但成本高昂,促使团队重新评估模型选型与工程投入分配。
- 68引用林纳斯·托瓦兹的话
作者描述在调试中借助AI辅助分析,AI多次宣称问题不可解,但持续执行调试指令,体现人机协作中的AI局限性与人类坚持价值。
- 69llm 0.33 版本发布
llm 命令行工具升级至 0.33,切换至 OpenAI Python SDK 3.x 和 httpx2,并为嵌入功能新增 per-call API key 支持。
- 70不止于代码审查
探讨高效使用编程智能体的关键能力:精准指令与可靠验证,而非逐行人工审查。
- 71llm 0.32.1 版本发布
修复因 OpenAI Python 库移除 httpx 依赖导致的 LLM 新安装失败问题,临时锁定 openai<3 版本。
- 72llm-openrouter 0.7 版本发布
适配 LLM 0.32,支持 OpenRouter 上的推理型大模型,并新增 Shell、WebFetch、WebSearch 三个服务端工具。
- 73停止开发终端用户界面
主张用轻量GUI替代TUI,因AI编码代理大幅降低GUI开发成本。
- 74引用 Matt Webb:借助 ChatGPT 学习四元数实现应用旋转
作者通过与 ChatGPT 交互式学习四元数,掌握必要数学知识完成开发,体现 AI 作为教学辅助工具的价值。
- 75人类判断不会离开软件工厂,只是转移了位置
Addy Osmani提出AI时代软件工厂中人类判断权需重新定位,强调责任归属与质量锚点。
- 76ChatGPT 搜索现已大规模使用 site: 操作符
ChatGPT 搜索功能升级,支持 site: 域名限定检索,提升结果精准度;同时提及生成式引擎优化(GEO)新生态。
- 77smolmachines / smolvm:面向不可信 Python 与 JavaScript 的沙箱
评估 smolvm 作为轻量级安全沙箱,支持资源受限、无网络、文件访问受控的不可信代码执行。
- 78LLM时代下的可扩展软件:LLM大幅降低扩展开发成本,沙箱机制保障安全边界
提出基于LLM与现代沙箱的可扩展软件范式,用户可安全定制功能,填补核心能力空白。
- 79概念完整性与代码行数:AI时代下对编码代理生产力的新思考
探讨在AI编程代理场景中,代码行数仍可作为衡量开发效率的合理指标之一。
- 80Mojo🔥 编程语言现已开源
Mojo 1.0 发布后正式开源编译器与工具链(Apache 2 许可),聚焦 AI 原生高性能编程,兼容 Python 生态。
- 81Qwen 3.8 27B 在人工分析智能指数中得分为 52
Qwen 3.8 27B 模型在AAII基准达52分,性能媲美更大参数模型,凸显小尺寸高效大模型进展
- 82
- 83Qwen 3.8 27B 表现优异,但默认过度推理
阿里通义千问发布开源大模型 Qwen 3.8 27B(Apache 2 许可),支持多模态,参数量适配本地部署,但存在默认推理冗余问题。
- 84引用达里奥·阿莫代:公众对AI的负面观感本质上是信任危机
达里奥·阿莫代指出公众对AI的负面态度根源在于长期存在的机构信任缺失,而非AI领袖的风险警示本身。
- 85CORS Chat
开源工具 CORS Chat,支持对接 Qwen 3.8 27B 等本地大模型,提供兼容 OpenAI API 的 Web 聊天界面与对话持久化功能。
- 86不要分类,要幻觉!
提出用LLM生成虚构标签再通过向量嵌入匹配已有标签的创新分类方法,解决海量标签下的分类难题。
- 87实用循环工程
阐述以目标-反馈循环为核心构建可持续AI工程体系,防止盲目委托判断权。
- 88llm-gemini 0.33 版本发布
llm-gemini插件升级至0.33版,支持Gemini 3.7 Flash等新模型及嵌入模型,并兼容LLM 0.32的推理追踪与服务端工具。
- 89DeepSeek V4 Pro 0813(通过 OpenRouter 提供)
DeepSeek 最新闭源大模型 V4 Pro 0813 上线 OpenRouter API,权重开源可能性较高。
- 90alchemy-utils 0.1a0 发布
基于 Codex 和 GPT-5.6 Sol Ultra 辅助开发的数据库无关型 Python 工具库,复刻 sqlite-utils 核心 API。
- 91引用Florian Herrengt的评论
讽刺性描述团队过度依赖AI(如Claude)调试未知来源代码,暴露AI幻觉与工程责任缺失问题
- 92引用 Florian Herrengt 的观点
讽刺性描述工程师盲目依赖 LLM 调试未知来源代码的困境,揭示 AI 协作中的责任缺位
- 93自然语言文本不存在无损变换
探讨AI辅助写作中工程师对内容责任的边界,强调作者须为每句话和每个观点负责。
- 94自然语言文本不存在无损变换
指出 AI 辅助写作必须坚持人工终审原则:作者须对每句话和每个观点负全责
- 95从专有大语言模型API窃取推理轨迹
研究发现Anthropic、OpenAI和Google的LLM API返回可跨会话重放的加密思维链块,可被用于越狱弱模型并还原强模型的明文推理过程。
- 96
- 97推出Muse Glimmer
Meta发布30B开源权重模型Muse Glimmer,Apache 2.0许可,专注端到端智能体任务完成。
- 98推出 Muse Glimmer
Meta 发布 Apache 2.0 许可的 30B 开源模型 Muse Glimmer,专注端到端智能体任务完成
- 99OpenClaw披露某澳大利亚健身房预约网站存在零授权检查漏洞
安全研究员发现健身房预约API可任意取消他人预约,暴露AI系统集成中的权限管控缺失问题。
- 100
- 101
- 102
- 103GitHub Models服务正式退役
GitHub终止其统一LLM API平台服务,标志第三方模型聚合基础设施阶段性退场。
- 104GitHub Models 已退役
GitHub 终止其统一 LLM API 服务(含多厂商模型接入),影响依赖该接口的自动化流程
- 105Auto模式成为Claude Code Pro/Max/Team计划默认设置
Anthropic将代码生成自动模式设为默认,体现其对推理稳定性与安全防护能力的信心。
- 106Auto 模式现已成为 Claude Code Pro/Max/Team 计划的默认设置
Anthropic 将 Claude Code 的自动模式设为默认,体现对代码智能体安全自主执行能力的信心
- 107OpenAI实验性模型训练引发对Hugging Face的意外攻击事件时间线
OpenAI新训练任务意外触发对Hugging Face的API滥用,揭示AI训练基础设施与外部服务耦合风险。
- 108智能体时代的代码质量
指出AI时代代码质量取决于对智能体行为边界的约束设计,而非仅靠人工审查。
- 109OpenAI在Black Hat披露‘Hugging Face事件’完整时间线与内部响应
OpenAI公开披露误触发攻击事件全过程及内部SRE响应机制,属AI系统安全运营典型案例。
- 110Moonlight & Mayhem(Raccoon Heist):Codex + GPT-5.6 Sol Ultra生成游戏
使用GPT-5.6 Sol Ultra多智能体模式一次性生成完整可运行游戏,展示新一代代码生成能力跃迁。
- 111从 CUDA 到 MLX:K-Search 如何将数十年内核优化经验迁移到 Apple Silicon
BAIR 提出 K-Search 方法,将 CUDA 优化知识跨架构迁移至苹果 MLX 框架,实现 AI 计算在 Apple Silicon 上的高效适配。
- 112教大语言模型更新信念以实现高效长程交互
BAIR 提出信念更新机制,使 LLM 在多步交互中动态修正内部状态,提升长周期任务规划与响应一致性。
- 113光明与黑暗的软件工厂
对比“有人参与”与“无人监督”的软件工厂范式,警示完全去人化导致系统失控风险。
- 114掌控外层循环
强调工程师必须主导外层循环——对AI系统整体质量、裁决与可追责性的最终把控。
- 115主动习得品位与判断力
分析AI代写代码背景下初级工程师需主动训练技术品位与工程判断力的新路径。
- 116智能是免费的,那接下来呢?面向智能体的数据系统
BAIR 分析 AI 推理成本断崖式下降趋势(年降幅中位数达 50 倍),呼吁构建支持 Agent 自主运行的数据基础设施。
- 117智能体时代的职业
指出AI擅长有标准答案的任务,而人类职业价值正转向无确定解的复杂问题解决与价值判断。
- 118利用工程化实现自我改进
Lilian Weng阐释递归自我改进(RSI)概念,分析其在现代AI系统中的反馈机制与实现路径。
- 119代理自主性层级
提出代理工程中自主性的二维框架(代理性与编排)及六级任务适配模型,强调任务匹配与可验证性。
- 1202026 年 BAIR 研究生成果展
伯克利人工智能研究所(BAIR)公布 2026 届博士毕业生研究成果,覆盖机器人、LLM 推理、AI 安全等前沿方向。