Anthropic Research·· 2026-08-28精选AI 评分77
Anthropic 报告称 Claude 可自动缓解 10 类对齐失败
Automated researchers can reliably mitigate alignment failures
AI 导读
Anthropic 发布报告称,Claude 可自主训练模型,改善 10 类对齐失败在多个公开基准上的表现。实验中,Claude 通过检索文献、提出方法和数据、训练与测试的循环工作,找到的修复方法在 10 类问题上都提升了目标基准且未降低预设能力,并在 withheld alignment benchmarks、Petri 和最高 4.7 times 更大的模型上保持有效。
推荐理由
原文披露了自动化对齐研究的实验流程、约束和外推测试,可作为评估安全训练自动化的参考。
来源:Anthropic Research · anthropic.com