跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分34

面向数据不足场景的 LLM 协作式个性化偏好对齐

Collaborative Personalized Preference Alignment for LLMs under Data Deficiency

AI 导读

研究提出 Approximate Pareto Optimality(APO),用于在用户反馈稀缺时协作学习 LLM 轻量级 aligner 的初始化,以支持少样本个性化适配。APO 先按更新兼容性对用户分组,再结合梯度下降与受控上升协调竞争目标,并用少样本本地适配迭代细化。Fed-ChatbotPA 和 UltraFeedback 实验显示,该方法仅用 20 个本地样本即可稳定优于现有方法。

来源:Hugging Face Daily Papers · arxiv.org