Hugging Face Daily Papers·· 2 天前AI 评分50
扩散语言模型可被闭环激活引导注入定向偏见
Noise Out, Bias In: Targeted Bias Injection in Diffusion Language Models via Closed-Loop Activation Steering
AI 导读
arXiv 论文研究了针对 masked diffusion language models 的定向偏见注入攻击,利用去噪过程中的内部激活和 PI 控制器动态调整 steering vector。
来源:Hugging Face Daily Papers · arxiv.org