跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分50

扩散语言模型可被闭环激活引导注入定向偏见

Noise Out, Bias In: Targeted Bias Injection in Diffusion Language Models via Closed-Loop Activation Steering

AI 导读

arXiv 论文研究了针对 masked diffusion language models 的定向偏见注入攻击,利用去噪过程中的内部激活和 PI 控制器动态调整 steering vector。

来源:Hugging Face Daily Papers · arxiv.org