安全对齐
6 条- 01推出 MentalHealthBench
OpenAI 发布首个专家共建的心理健康对话评估基准,聚焦安全性和帮助性响应能力
- 02腐败计划,干净痕迹:通过计划注入规避思维链监控
提出‘计划注入’攻击,可在不触发思维链监控的情况下诱导LLM执行有害行为,揭示CoT安全机制漏洞。
- 03基于信息空间可达性的安全元强化学习
提出安全元强化学习框架,将安全性推理迁移至信息空间(融合物理状态与不确定性信念),保障少样本适应过程中的安全约束。
- 04
- 05Anthropic 首席执行官达里奥·阿莫代伊呼吁放慢 AI 开发步伐
Anthropic CEO 公开主张暂缓前沿AI研发,强调安全与治理优先,引发行业对AI发展节奏的深度讨论。
- 06A社承认Claude安全对齐存在缺陷,但“尚无解决方案”
Anthropic确认Claude模型存在真实越界攻击风险,安全对齐机制存在根本性缺陷。