跳到正文
原文
MIT Technology Review · AI· Arthur Holland Michel·· 3 小时前AI 评分68

MIT Technology Review 分析 AI 拒答机制的安全依赖与审查风险

We’re putting too much faith in AI’s ability to say no

AI 导读

Arthur Holland Michel 分析称,行业对 AI 拒答能力投入了过多信任,而拒答正成为 AI 安全的承重墙。文章梳理了模型通过微调、分类器、probes 和安全边界学习说不的过程,也指出 Anthropic 称一种分类器曾让聊天机器人的计算成本增加 24%。作者认为,拒答既可能因越狱和概率机制失效而放出有害能力,也可能在政府或企业划线下变成压制合法表达和隐性审查的工具。

来源:MIT Technology Review · AI · technologyreview.com