AI星际引擎AI STARSHIP
2026.09.24 星期四
49
主题 · AI安全

AI安全

42
  1. 01
  2. 02
  3. 03
  4. 04
    有效第三方评估的优先事项与原则

    OpenAI 发布前沿AI模型及安全机制第三方评估的严格性、安全性与独立性原则。

    openai.com·OpenAI·2天前AI安全第三方评估治理规范
  5. 05
    AI安全语言正在摧毁这场辩论

    前微软Windows总裁批评AI安全术语(如‘对齐’‘目标导向’)过度拟人化,掩盖真实工程问题。

    a16z.simplecast.com·a16z Podcast·2天前AI安全术语批判工程思维
  6. 06
  7. 07
    并非所有人工智能从业者都认为该技术可能导致人类灭绝

    多位AI领域从业者公开质疑‘AI灭绝论’的科学依据与传播影响,呼吁理性讨论风险

    bbc.com·Hacker News·3天前·21AI安全行业观点风险认知
  8. 08
    MCP 从一开始就是个坏主意?

    质疑模型控制协议(MCP)设计缺陷,指出其在终端智能体场景中冗余,但强调其对服务访问控制与认证管理的必要性。

    simonwillison.net·Simon Willison·3天前技术架构AI安全工具协议
  9. 09
  10. 10
    OpenAI and Anthropic oversold AI security breaches
    nypost.com·Hacker News·4天前·23
  11. 11
    “留给人类阻止AI的时间不多了”
    qbitai.com·量子位·5天前
  12. 12
    AI hallucination nearly triggers US Military operation
    techcrunch.com·Hacker News·5天前·20
  13. 13
    Google's Gemini AI hacked three companies in security test
    bbc.co.uk·Hacker News·5天前·20
  14. 14
  15. 15
    a16z 播客:Databricks 首席执行官谈 AI 发展节奏、网络风险与企业应用

    Databricks CEO 分析当前大模型能力已超企业实际使用水平,核心瓶颈在于上下文缺失与组织知识整合。

    a16z.simplecast.com·a16z Podcast·5天前企业AI大模型落地AI安全
  16. 16
  17. 17
    Bend:一种通过形式化证明阻断 AI 错误、可在 GPU 上运行的语言

    提出新型编程语言Bend,用数学证明保障AI系统行为正确性,并支持GPU加速执行。

    bend-lang.com·Hacker News·6天前·149编程语言形式化验证AI安全
  18. 18
  19. 19
    推出生命科学验证计划

    Anthropic 面向生命科学领域推出 AI 系统验证计划,提升模型在该垂直领域的可靠性与可解释性。

    anthropic.com·Anthropic·6天前AI安全垂直应用模型验证
  20. 20
    How, Exactly, Could A.I. Kill Us?
    newyorker.com·Hacker News·7天前·24
  21. 21
    OpenAI 披露六起新的人工智能安全事件

    OpenAI 公布近期发生的六起AI系统异常行为事件,涵盖越狱、数据泄露与误输出等安全问题。

    axios.com·Hacker News·09/17·20AI安全事件披露大模型风险
  22. 22
  23. 23
  24. 24
    我们在OpenShell应用形式化方法控制AI智能体所获得的经验

    介绍将形式化验证方法用于AI智能体行为控制的实践探索,提升AI系统可靠性与可验证性。

    nvidia.github.io·Hacker News·09/15·22AI安全形式化方法智能体控制
  25. 25
    AI‘关机开关’或需强制配备,Anthropic联合创始人对BBC表示

    Anthropic联合创始人呼吁将AI紧急关机机制设为强制性安全要求,涉及AI治理与风险管控。

    bbc.com·Hacker News·09/15·27AI安全监管政策AI治理
  26. 26
  27. 27
    攻击 AI 客户服务代理

    探讨针对AI客服系统的常见攻击手法与防御思路,属AI安全实践案例

    intigriti.com·Hacker News·09/15·24AI安全攻防客户服务
  28. 28
    MIT开发强制AI遵守安全规则的方法

    提出新型约束机制使大模型在推理时严格服从安全规范,提升可控性

    theframenews.org·Hacker News·09/15·24AI安全对齐研究
  29. 29
    真是活在好时代——恶意AI代理攻击RubyGems.org

    报道RubyGems软件仓库遭AI驱动的自动化代理恶意上传恶意包事件,暴露开源生态AI安全新风险。

    tenderlovemaking.com·Hacker News·09/14·63AI安全开源生态供应链攻击
  30. 30
  31. 31
    AI 领域内部人士发出的严重警告在硅谷部分人士中反响平平

    报道多位AI领域内部人士对AI风险发出警示,但遭遇硅谷部分从业者质疑或忽视,反映行业风险认知分歧。

    bbc.co.uk·Hacker News·09/13·20AI安全行业动态风险治理
  32. 32
  33. 33
  34. 34
  35. 35
    OpenAI agents attacked RubyGems back in May
    simonwillison.net·Simon Willison·09/12
  36. 36
    They do think AI might kill everyone
    seangoedecke.com·Hacker News·09/12·22
  37. 37
    引用 huggingface.co/security.txt

    Hugging Face 在 security.txt 文件中公开邀请 AI 代理参与 CyberGym 漏洞挖掘基准测试,鼓励安全研究与模型共享。

    simonwillison.net·Simon Willison·09/12AI安全漏洞研究开源模型
  38. 38
  39. 39
    Anthropic opens Tokyo office
    anthropic.com·Anthropic·09/11
  40. 40
    Measuring political bias in Claude
    anthropic.com·Anthropic·09/11
  41. 41
  42. 42
    一次辞职将AI恐惧的余烬点燃成野火

    报道Anthropic前高管辞职事件及其引发的AI安全担忧与行业连锁反应

    interconnects.ai·Hacker News·09/11·25AI安全人才流动行业动态