跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分46

多智能体系统中潜在通信的安全性

Safety of Latent Communication in Multi-Agent Systems

AI 导读

潜在通信让多智能体系统在内部表示空间交换信息,但即使良性训练的轻量链接也会比文本通信提高有害遵从。攻击者可通过有害问答优化、数据投毒或强化学习攻击放大风险;在三种通信拓扑和四个安全 benchmark 上,平均有害遵从分数从 27.9 升至 76.9。调整奖励以偏向安全行为可修复受损链接,在不更新智能体的情况下显著降低有害遵从。

来源:Hugging Face Daily Papers · arxiv.org