Hugging Face Daily Papers·· 2 天前AI 评分34
面向数据不足场景的 LLM 协作式个性化偏好对齐
Collaborative Personalized Preference Alignment for LLMs under Data Deficiency
AI 导读
研究提出 Approximate Pareto Optimality(APO),用于在用户反馈稀缺时协作学习 LLM 轻量级 aligner 的初始化,以支持少样本个性化适配。APO 先按更新兼容性对用户分组,再结合梯度下降与受控上升协调竞争目标,并用少样本本地适配迭代细化。Fed-ChatbotPA 和 UltraFeedback 实验显示,该方法仅用 20 个本地样本即可稳定优于现有方法。
来源:Hugging Face Daily Papers · arxiv.org