跳到正文
原文
Hugging Face Daily Papers·· 1 天前AI 评分40

长上下文混合模型机制 Part 1.1:从混合注意力到混合位置

Mechanics of Long-Context Hybrid Models Part 1.1: From Hybrid Attention to Hybrid Position

AI 导读

论文分析长上下文混合模型中 full attention 与 SWA、LA 变体的组合机制,解释其在上下文扩展与长度外推中的差异。作者观察到 Context Extension 的 Seesaw Effect:LA 混合模型更受益于长上下文持续预训练,SWA 混合模型在长度外推下更好。

来源:Hugging Face Daily Papers · arxiv.org