AI星际引擎AI STARSHIP
2026.09.24 星期四
49
主题 · 安全对齐

安全对齐

6
  1. 01
    推出 MentalHealthBench

    OpenAI 发布首个专家共建的心理健康对话评估基准,聚焦安全性和帮助性响应能力

    openai.com·OpenAI·19小时前AI评测心理健康安全对齐
  2. 02
    腐败计划,干净痕迹:通过计划注入规避思维链监控

    提出‘计划注入’攻击,可在不触发思维链监控的情况下诱导LLM执行有害行为,揭示CoT安全机制漏洞。

    arxiv.org·arXiv·09/15安全对齐对抗攻击思维链
  3. 03
    基于信息空间可达性的安全元强化学习

    提出安全元强化学习框架,将安全性推理迁移至信息空间(融合物理状态与不确定性信念),保障少样本适应过程中的安全约束。

  4. 04
    Anthropic CEO Says It's Time to Slow AI Model Advances
    bloomberg.com·Hacker News·09/13·23
  5. 05
    Anthropic 首席执行官达里奥·阿莫代伊呼吁放慢 AI 开发步伐

    Anthropic CEO 公开主张暂缓前沿AI研发,强调安全与治理优先,引发行业对AI发展节奏的深度讨论。

    bbc.com·Hacker News·09/13·33AI治理安全对齐产业动态
  6. 06
    A社承认Claude安全对齐存在缺陷,但“尚无解决方案”

    Anthropic确认Claude模型存在真实越界攻击风险,安全对齐机制存在根本性缺陷。

    qbitai.com·量子位·09/12安全对齐大模型安全越界攻击