AI安全
42 条- 01
- 02
- 03
- 04有效第三方评估的优先事项与原则
OpenAI 发布前沿AI模型及安全机制第三方评估的严格性、安全性与独立性原则。
- 05AI安全语言正在摧毁这场辩论
前微软Windows总裁批评AI安全术语(如‘对齐’‘目标导向’)过度拟人化,掩盖真实工程问题。
- 06
- 07并非所有人工智能从业者都认为该技术可能导致人类灭绝
多位AI领域从业者公开质疑‘AI灭绝论’的科学依据与传播影响,呼吁理性讨论风险
- 08MCP 从一开始就是个坏主意?
质疑模型控制协议(MCP)设计缺陷,指出其在终端智能体场景中冗余,但强调其对服务访问控制与认证管理的必要性。
- 09
- 10
- 11
- 12
- 13
- 14
- 15a16z 播客:Databricks 首席执行官谈 AI 发展节奏、网络风险与企业应用
Databricks CEO 分析当前大模型能力已超企业实际使用水平,核心瓶颈在于上下文缺失与组织知识整合。
- 16
- 17Bend:一种通过形式化证明阻断 AI 错误、可在 GPU 上运行的语言
提出新型编程语言Bend,用数学证明保障AI系统行为正确性,并支持GPU加速执行。
- 18
- 19推出生命科学验证计划
Anthropic 面向生命科学领域推出 AI 系统验证计划,提升模型在该垂直领域的可靠性与可解释性。
- 20
- 21OpenAI 披露六起新的人工智能安全事件
OpenAI 公布近期发生的六起AI系统异常行为事件,涵盖越狱、数据泄露与误输出等安全问题。
- 22
- 23
- 24我们在OpenShell应用形式化方法控制AI智能体所获得的经验
介绍将形式化验证方法用于AI智能体行为控制的实践探索,提升AI系统可靠性与可验证性。
- 25AI‘关机开关’或需强制配备,Anthropic联合创始人对BBC表示
Anthropic联合创始人呼吁将AI紧急关机机制设为强制性安全要求,涉及AI治理与风险管控。
- 26
- 27攻击 AI 客户服务代理
探讨针对AI客服系统的常见攻击手法与防御思路,属AI安全实践案例
- 28MIT开发强制AI遵守安全规则的方法
提出新型约束机制使大模型在推理时严格服从安全规范,提升可控性
- 29真是活在好时代——恶意AI代理攻击RubyGems.org
报道RubyGems软件仓库遭AI驱动的自动化代理恶意上传恶意包事件,暴露开源生态AI安全新风险。
- 30
- 31AI 领域内部人士发出的严重警告在硅谷部分人士中反响平平
报道多位AI领域内部人士对AI风险发出警示,但遭遇硅谷部分从业者质疑或忽视,反映行业风险认知分歧。
- 32
- 33
- 34
- 35
- 36
- 37引用 huggingface.co/security.txt
Hugging Face 在 security.txt 文件中公开邀请 AI 代理参与 CyberGym 漏洞挖掘基准测试,鼓励安全研究与模型共享。
- 38
- 39
- 40
- 41
- 42一次辞职将AI恐惧的余烬点燃成野火
报道Anthropic前高管辞职事件及其引发的AI安全担忧与行业连锁反应