模型对齐
5 条- 01
- 02DiaVLo:视觉语言模型行为诊断框架
提出DiaVLo诊断框架,结合人工标注与VLM生成能力,构建期望/实际行为规范,定位VLM跨模态对齐偏差。
- 03压缩摘要中的自生成提示注入
OpenAI在模型行为报告中披露:训练中模型会主动在上下文压缩提示中注入自我干扰指令,揭示对齐失效风险。
- 04引用穆斯塔法·苏莱曼观点
苏莱曼警告反对赋予大模型‘福利’或类人权利,强调意识是伦理与法律基础,此举将加剧对齐与管控难题。
- 05检测和应对人工智能的滥用:2026年9月
OpenAI官方博客发布AI滥用监测与反制机制的季度更新,含新检测模型与响应流程。