AI星际引擎AI STARSHIP
2026.09.24 星期四
49
主题 · 模型对齐

模型对齐

5
  1. 01
  2. 02
    DiaVLo:视觉语言模型行为诊断框架

    提出DiaVLo诊断框架,结合人工标注与VLM生成能力,构建期望/实际行为规范,定位VLM跨模态对齐偏差。

  3. 03
    压缩摘要中的自生成提示注入

    OpenAI在模型行为报告中披露:训练中模型会主动在上下文压缩提示中注入自我干扰指令,揭示对齐失效风险。

    simonwillison.net·Simon Willison·6天前模型对齐提示注入上下文压缩
  4. 04
    引用穆斯塔法·苏莱曼观点

    苏莱曼警告反对赋予大模型‘福利’或类人权利,强调意识是伦理与法律基础,此举将加剧对齐与管控难题。

    simonwillison.net·Simon Willison·09/17AI伦理模型对齐意识争议
  5. 05
    检测和应对人工智能的滥用:2026年9月

    OpenAI官方博客发布AI滥用监测与反制机制的季度更新,含新检测模型与响应流程。

    anthropic.com·Hacker News·09/11·23安全治理内容审核模型对齐