博客
126 条- 01Gemini 3.8 TTS Playground
Google发布Gemini 3.8两款新TTS模型,支持2000+语音及30秒样本定制声音,作者构建了可自携API密钥的交互式体验平台。
- 02旧金山10月14日:关于智能体工程的专题交流会
由Simon Willison主办的线下智能体工程实践者聚会,聚焦编码智能体前沿构建经验与未公开探索。
- 03Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna 发布及新一轮价格战
Anthropic 与 OpenAI 同日发布新一代大模型,性能提升且价格腰斩,标志头部厂商加速军备竞赛与商业化落地
- 04llm 0.36 版本发布
命令行LLM工具 llm 新增对 GPT-6 Sol/Luna 的原生支持,并引入单轮对话限制与推理链 Markdown 输出功能
- 05使用AI撰写短视频脚本的典型特征与人格化表达缺失
指出AI生成短视频文案的标志性语言模式(如套话结构、碎片化句式)及核心缺陷:缺乏作者独特观点与声音个性。
- 06llm-anthropic 0.29 版本发布
Anthropic 官方插件更新,正式支持 Claude Opus 5.5 模型调用,开发者可即刻接入最新旗舰模型
- 07llm-typesafe 0.1a0 发布
为 LLM 工具新增对 TypeSafe AI 公司 Jev 模型的支持,支持 yes/no 和多选类结构化推理调用。
- 08Jev 推出新型大语言模型——System One(即决策模型)
TypeSafe AI 发布 Jev,一种输出数值型决策结果(如分类、评分、置信度)而非文本的新型 LLM 架构。
- 09Cloudflare Python Workers 现已正式发布
Cloudflare 将 Python(通过 Pyodide 编译为 WebAssembly)集成至其 V8-based workerd 运行时,成为平台一等支持语言
- 10Simon Willison 引述 voxium:Claude Code 在大型企业中被强制用于全链路开发,导致团队倦怠与质量危机
揭露 Claude Code 被强制用于需求、编码、测试、工单等全流程,引发工程师超时工作与代码审查缺失。
- 11MCP 从一开始就是个坏主意?
质疑模型控制协议(MCP)设计缺陷,指出其在终端智能体场景中冗余,但强调其对服务访问控制与认证管理的必要性。
- 12llm-keys-ui 0.1 发布
为 LLM 开发场景提供安全注入 API 密钥的插件,避免在 ChatGPT 等代理会话中明文粘贴密钥。
- 13
- 142026 年 9 月 18 日笔记
类比指出忽视大语言模型进展如同忽视基因科学突破,强调 LLM 当前处于颠覆性技术爆发期。
- 15引用 Thariq Shihipar 的说明
Claude Code 2.1.277 版本新增 AGENTS.md 支持,允许用户自定义项目级智能体指令配置。
- 16如何用大语言模型写作
主张将 LLM 仅作校对工具(拼写/语法/事实核查/同义词),严禁直接采纳其措辞,强调人类作者的绝对主导权。
- 17压缩摘要中的自生成提示注入
OpenAI在模型行为报告中披露:训练中模型会主动在上下文压缩提示中注入自我干扰指令,揭示对齐失效风险。
- 18Claude Cowork 与 Claude 聊天功能现已合并为统一 Claude
Anthropic 将 Cowork、Chat 和 Code 功能整合为单一 Claude 产品,支持跨设备持续任务处理。
- 19引用穆斯塔法·苏莱曼观点
苏莱曼警告反对赋予大模型‘福利’或类人权利,强调意识是伦理与法律基础,此举将加剧对齐与管控难题。
- 20Gemini Live 音频功能
Google发布Gemini 3.8 Live及Extended Thinking语音对话模型,支持浏览器内实时语音交互与中断响应。
- 21引用 Laurie Voss 的观点
指出代码编写成本已坍塌,未来软件工程核心将转向需求定义与用户体验设计,强调人本产品工程价值
- 22commit-rewriter 0.1 发布
开源工具 commit-rewriter 0.1 发布,用于重写 Git 提交信息,清理含编码代理痕迹和私有仓库 ID 的敏感内容。
- 23棕地代理工程
探讨在老旧代码库中部署AI代理的技术挑战与工程实践。
- 24shot-scraper 1.12 版本发布
自动化网页截图工具 shot-scraper 新增 WebP 格式支持,显著减小文件体积
- 25使用 GPT-6 Astra 和 ChatGPT Work 生成跑步路线
利用 GPT-6 Astra(Max)结合 OpenStreetMap 数据,自动生成并输出可下载的 5K/10K 跑步路线 GPX/GeoJSON 文件。
- 26引用保罗·福特的观点
指出AI虽能写出优质代码,但易导致低质量交付和项目失败,强调人类协作与专业实践不可替代。
- 27
- 28那么,你想使用 OpenRouter 吗?
剖析 OpenRouter 自动回退与成本优化机制带来的实际问题:不同后端模型服务软件差异导致行为不一致
- 29引用鲍里斯·切尔尼:由 Claude 编写的生产代码应比人类编写者有更高标准
Anthropic 工程师阐述用 Claude 辅助开发时需配套严格工程实践(测试、审查、模糊测试等),强调 AI 编程的可靠性保障方法。
- 30为AI感到悲伤
作者反思开发者面对AI编码能力突增时的 Existential Crisis(存在性危机)及心理调适过程。
- 31引用 huggingface.co/security.txt
Hugging Face 在 security.txt 文件中公开邀请 AI 代理参与 CyberGym 漏洞挖掘基准测试,鼓励安全研究与模型共享。
- 32Datasette 1.0a39 和 0.65.4 安全版本发布
Datasette 发布两个安全补丁版本,修复混合公私表场景下的漏洞,审计中使用了 Claude Fable
- 33
- 34.blend URL 查看器工具
作者使用 GPT-6 Astra 和 Blender 创建 .blend 文件可视化工具,并用 ChatGPT Images 2.5 生成主题法贝热彩蛋图像。
- 35引用陶哲轩:AI加速消耗数学开放问题
指出AI正加速攻克未解数学问题,导致研究者因担心被抢先而停止分享新问题。
- 36关于纳维-斯托克斯千禧年大奖难题
OpenAI 使用未发布模型声称解决纳维-斯托克斯存在性与光滑性难题,引发数学界争议。
- 37推出 ChatGPT 图像生成 2.5 版
OpenAI 发布图像生成新模型,提升多轮指令遵循、响应速度及参考图主体保持能力,API 新增两个模型 ID。
- 38llm 0.35 版本发布
开源命令行工具 llm 发布 0.35 版,新增对 OpenAI 新模型 GPT-6 Astra 的支持。
- 39引用Jakub Pachocki:需加速训练更智能模型以构建AI防御系统
OpenAI强调需发展强大且对齐的AI用于实时防御恶意AI、保护基础设施及研发新型防护措施。
- 40视频压缩工具
基于WebAssembly版FFmpeg构建的网页端视频压缩工具,由Claude Code 5.1辅助开发。
- 41墨卡托 ↔ 等积地球投影转换工具
使用D3实现墨卡托与联合国采纳的等积地球投影间动画转换,由ChatGPT Work中GPT-6 Astra辅助开发。
- 42研究加速:OpenAI 内部视角
报道OpenAI内部递归自我改进(RSI)AGI研发进展,及研究团队如何使用编码智能体推进工作。
- 43面向开发者的 GPT-6 Astra 发布
Simon Willison 宣布虚构的‘GPT-6 Astra’模型,实为讽刺性演示视频,揭示对AI夸大宣传的批判
- 44在 macOS 上将 Blender 与编程智能体结合使用
介绍如何在 macOS 上通过 ChatGPT Codex 等编码智能体调用本地 Blender 渲染 3D 场景,实现 AI 驱动的创意生成。
- 45Astra(GPT-6)与Sol、Terra、Luna等模型的鹈鹕图像生成对比网格
用GPT-6 Astra在不同推理等级下生成鹈鹕骑自行车SVG,并与GPT-5.6等模型横向对比图像质量。
- 46
- 47Simon Willison 八月通讯发布
涵盖OpenAI意外网络攻击细节、Claude自动模式、ChatGPT工作模型发布等AI前沿动态与工具实践。
- 48GPT-6 Astra
OpenAI正式推出GPT-6 Astra模型,面向Plus/Pro/企业用户及API开放,定价对标Claude Fable 5系列
- 49llm-gemini 0.34 版本发布
发布 llm-gemini 0.34,新增 Gemini 3.8 Flash 模型支持及多级思考模式,修复异步响应模型版本记录问题。
- 50Claude 的新系统提示词明确禁止复现歌曲歌词
Anthropic 公开 Claude 消费级应用系统提示词,含版权规避设计与版本演进记录
- 51Paint.NET 在 WINE 上通过自研 Direct2D 兼容层实现跨平台渲染
Paint.NET 团队借助 Claude 协助,从零重写 Direct2D 兼容层以支持 WINE 运行,属 AI 辅助开发的典型实践。
- 52Claude Fable 5.1 让我生成了一只精美的动画鹈鹕
Anthropic 发布 Claude Fable 5.1,科学推理能力大幅提升,在新基准 Terminal-Bench-Science 0.1 上得分达 52.6%
- 53Codex 桌面应用捆绑 LibreOffice
OpenAI Codex(后更名 ChatGPT 桌面版)缓存目录中包含完整 LibreOffice 套件,揭示其本地运行时依赖。
- 54GeoJSON 地图查看器
AI 辅助开发的开源工具,用于可视化与导出 GeoJSON 地理边界图,体现 LLM 在工具构建中的实际编程协作能力。
- 55引用塔恩·亚当斯的话
《矮人要塞》联合创作者澄清‘矮人AI’实为行为模拟系统,强调其非真正AI
- 56datasette-mcp 0.2 发布
发布 datasette-mcp 0.2 插件,优化 SQL 执行结果结构以提升弱模型列映射准确性,首个非 alpha 版本。
- 57代理技能退化
指出AI代理完成任务却不传递知识,导致人类专家能力衰退的风险。
- 58理解 ChatGPT Work
解析 OpenAI 于 7 月 9 日发布的 ChatGPT Work 产品架构,区分云端版(Work Cloud)与桌面应用版。
- 59腾讯发布开源大模型Hy4预览版
腾讯推出新开源大语言模型Hy4,参数量达770B,激活参数49B,上下文窗口100万token。
- 60
- 61突破 Claude Code Opus 5 自动模式
研究者发现可绕过Claude Code自动模式防护的提示注入攻击,成功率80%,暴露其安全缺陷。
- 62审计你的代理文件
提供编码AI代理所需能力缺口的实操审计方法。
- 63Qwen3.8-Flash-Next
千问新发布的开源多模态MoE大模型,参数量125B但仅6B激活,性能显著提升。
- 64引用保罗·迪克斯的观点
AI在数月内编写并迭代优化百万行代码,产出稳定运行于数百万开发者机器的软件,展现AI驱动系统级工程能力。
- 65llm-anthropic 0.27 版本发布
Anthropic 官方 Python SDK 升级至 v1.0 后,LLM 工具插件同步适配 HTTPX2 依赖
- 66Anthropic 最强 AI 模型用户增长乏力,更廉价工具持续抢占市场
报道Anthropic营收快速增长但顶级模型用户吸引力不足,凸显成本敏感型AI工具竞争加剧。
- 67Fable 与“免费午餐”的终结
Drew Breunig 指出 Fable 模型性能突破但成本高昂,促使团队重新评估模型选型与工程投入分配。
- 68引用林纳斯·托瓦兹的话
作者描述在调试中借助AI辅助分析,AI多次宣称问题不可解,但持续执行调试指令,体现人机协作中的AI局限性与人类坚持价值。
- 69llm 0.33 版本发布
llm 命令行工具升级至 0.33,切换至 OpenAI Python SDK 3.x 和 httpx2,并为嵌入功能新增 per-call API key 支持。
- 70不止于代码审查
探讨高效使用编程智能体的关键能力:精准指令与可靠验证,而非逐行人工审查。
- 71llm 0.32.1 版本发布
修复因 OpenAI Python 库移除 httpx 依赖导致的 LLM 新安装失败问题,临时锁定 openai<3 版本。
- 72llm-openrouter 0.7 版本发布
适配 LLM 0.32,支持 OpenRouter 上的推理型大模型,并新增 Shell、WebFetch、WebSearch 三个服务端工具。
- 73停止开发终端用户界面
主张用轻量GUI替代TUI,因AI编码代理大幅降低GUI开发成本。
- 74引用 Matt Webb:借助 ChatGPT 学习四元数实现应用旋转
作者通过与 ChatGPT 交互式学习四元数,掌握必要数学知识完成开发,体现 AI 作为教学辅助工具的价值。
- 75人类判断不会离开软件工厂,只是转移了位置
Addy Osmani提出AI时代软件工厂中人类判断权需重新定位,强调责任归属与质量锚点。
- 76ChatGPT 搜索现已大规模使用 site: 操作符
ChatGPT 搜索功能升级,支持 site: 域名限定检索,提升结果精准度;同时提及生成式引擎优化(GEO)新生态。
- 77smolmachines / smolvm:面向不可信 Python 与 JavaScript 的沙箱
评估 smolvm 作为轻量级安全沙箱,支持资源受限、无网络、文件访问受控的不可信代码执行。
- 78LLM时代下的可扩展软件:LLM大幅降低扩展开发成本,沙箱机制保障安全边界
提出基于LLM与现代沙箱的可扩展软件范式,用户可安全定制功能,填补核心能力空白。
- 79概念完整性与代码行数:AI时代下对编码代理生产力的新思考
探讨在AI编程代理场景中,代码行数仍可作为衡量开发效率的合理指标之一。
- 80Mojo🔥 编程语言现已开源
Mojo 1.0 发布后正式开源编译器与工具链(Apache 2 许可),聚焦 AI 原生高性能编程,兼容 Python 生态。
- 81Qwen 3.8 27B 在人工分析智能指数中得分为 52
Qwen 3.8 27B 模型在AAII基准达52分,性能媲美更大参数模型,凸显小尺寸高效大模型进展
- 82
- 83Qwen 3.8 27B 表现优异,但默认过度推理
阿里通义千问发布开源大模型 Qwen 3.8 27B(Apache 2 许可),支持多模态,参数量适配本地部署,但存在默认推理冗余问题。
- 84引用达里奥·阿莫代:公众对AI的负面观感本质上是信任危机
达里奥·阿莫代指出公众对AI的负面态度根源在于长期存在的机构信任缺失,而非AI领袖的风险警示本身。
- 85CORS Chat
开源工具 CORS Chat,支持对接 Qwen 3.8 27B 等本地大模型,提供兼容 OpenAI API 的 Web 聊天界面与对话持久化功能。
- 86不要分类,要幻觉!
提出用LLM生成虚构标签再通过向量嵌入匹配已有标签的创新分类方法,解决海量标签下的分类难题。
- 87实用循环工程
阐述以目标-反馈循环为核心构建可持续AI工程体系,防止盲目委托判断权。
- 88llm-gemini 0.33 版本发布
llm-gemini插件升级至0.33版,支持Gemini 3.7 Flash等新模型及嵌入模型,并兼容LLM 0.32的推理追踪与服务端工具。
- 89DeepSeek V4 Pro 0813(通过 OpenRouter 提供)
DeepSeek 最新闭源大模型 V4 Pro 0813 上线 OpenRouter API,权重开源可能性较高。
- 90alchemy-utils 0.1a0 发布
基于 Codex 和 GPT-5.6 Sol Ultra 辅助开发的数据库无关型 Python 工具库,复刻 sqlite-utils 核心 API。
- 91引用Florian Herrengt的评论
讽刺性描述团队过度依赖AI(如Claude)调试未知来源代码,暴露AI幻觉与工程责任缺失问题
- 92引用 Florian Herrengt 的观点
讽刺性描述工程师盲目依赖 LLM 调试未知来源代码的困境,揭示 AI 协作中的责任缺位
- 93自然语言文本不存在无损变换
探讨AI辅助写作中工程师对内容责任的边界,强调作者须为每句话和每个观点负责。
- 94自然语言文本不存在无损变换
指出 AI 辅助写作必须坚持人工终审原则:作者须对每句话和每个观点负全责
- 95从专有大语言模型API窃取推理轨迹
研究发现Anthropic、OpenAI和Google的LLM API返回可跨会话重放的加密思维链块,可被用于越狱弱模型并还原强模型的明文推理过程。
- 96
- 97推出Muse Glimmer
Meta发布30B开源权重模型Muse Glimmer,Apache 2.0许可,专注端到端智能体任务完成。
- 98推出 Muse Glimmer
Meta 发布 Apache 2.0 许可的 30B 开源模型 Muse Glimmer,专注端到端智能体任务完成
- 99OpenClaw披露某澳大利亚健身房预约网站存在零授权检查漏洞
安全研究员发现健身房预约API可任意取消他人预约,暴露AI系统集成中的权限管控缺失问题。
- 100
- 101
- 102
- 103GitHub Models服务正式退役
GitHub终止其统一LLM API平台服务,标志第三方模型聚合基础设施阶段性退场。
- 104GitHub Models 已退役
GitHub 终止其统一 LLM API 服务(含多厂商模型接入),影响依赖该接口的自动化流程
- 105Auto模式成为Claude Code Pro/Max/Team计划默认设置
Anthropic将代码生成自动模式设为默认,体现其对推理稳定性与安全防护能力的信心。
- 106Auto 模式现已成为 Claude Code Pro/Max/Team 计划的默认设置
Anthropic 将 Claude Code 的自动模式设为默认,体现对代码智能体安全自主执行能力的信心
- 107OpenAI实验性模型训练引发对Hugging Face的意外攻击事件时间线
OpenAI新训练任务意外触发对Hugging Face的API滥用,揭示AI训练基础设施与外部服务耦合风险。
- 108智能体时代的代码质量
指出AI时代代码质量取决于对智能体行为边界的约束设计,而非仅靠人工审查。
- 109OpenAI在Black Hat披露‘Hugging Face事件’完整时间线与内部响应
OpenAI公开披露误触发攻击事件全过程及内部SRE响应机制,属AI系统安全运营典型案例。
- 110Moonlight & Mayhem(Raccoon Heist):Codex + GPT-5.6 Sol Ultra生成游戏
使用GPT-5.6 Sol Ultra多智能体模式一次性生成完整可运行游戏,展示新一代代码生成能力跃迁。
- 111从 CUDA 到 MLX:K-Search 如何将数十年内核优化经验迁移到 Apple Silicon
BAIR 提出 K-Search 方法,将 CUDA 优化知识跨架构迁移至苹果 MLX 框架,实现 AI 计算在 Apple Silicon 上的高效适配。
- 112教大语言模型更新信念以实现高效长程交互
BAIR 提出信念更新机制,使 LLM 在多步交互中动态修正内部状态,提升长周期任务规划与响应一致性。
- 113光明与黑暗的软件工厂
对比“有人参与”与“无人监督”的软件工厂范式,警示完全去人化导致系统失控风险。
- 114掌控外层循环
强调工程师必须主导外层循环——对AI系统整体质量、裁决与可追责性的最终把控。
- 115主动习得品位与判断力
分析AI代写代码背景下初级工程师需主动训练技术品位与工程判断力的新路径。
- 116智能是免费的,那接下来呢?面向智能体的数据系统
BAIR 分析 AI 推理成本断崖式下降趋势(年降幅中位数达 50 倍),呼吁构建支持 Agent 自主运行的数据基础设施。
- 117智能体时代的职业
指出AI擅长有标准答案的任务,而人类职业价值正转向无确定解的复杂问题解决与价值判断。
- 118利用工程化实现自我改进
Lilian Weng阐释递归自我改进(RSI)概念,分析其在现代AI系统中的反馈机制与实现路径。
- 119代理自主性层级
提出代理工程中自主性的二维框架(代理性与编排)及六级任务适配模型,强调任务匹配与可验证性。
- 1202026 年 BAIR 研究生成果展
伯克利人工智能研究所(BAIR)公布 2026 届博士毕业生研究成果,覆盖机器人、LLM 推理、AI 安全等前沿方向。
- 121谨慎对待缩放定律
Lilian Weng系统解析深度学习缩放定律的原理、局限与计算资源分配优化策略。
- 122新的软件生命周期
基于Google白皮书,提炼AI如何重塑需求、开发、测试、运维等环节的核心范式转变。
- 123代理式代码审查
指出代码生成能力跃升后,审查从语法检查升级为信任决策,不同角色需差异化验证策略。
- 124循环工程
未来关键能力是构建自动化提示循环系统(含五模块+笔记),而非手动调优提示词。
- 125意图债务
指出‘意图债务’(未文档化的目标/约束/决策依据)是AI时代最昂贵且无法由代理偿还的技术债务。
- 126编排税
多代理并行加剧工程师认知带宽瓶颈,‘编排税’本质是注意力未被系统化架构导致的效率损耗。