Hugging Face Daily Papers·· 3 天前AI 评分46
FocusVTC:基于自适应分辨率的高效高性能视觉文本压缩
FocusVTC: Efficient and High-Performance Visual Text Compression with Adaptive Resolution
AI 导读
FocusVTC 用自适应分辨率改进视觉文本压缩,将低 DPI 全局视图与选择性区域增强结合,降低长上下文推理的计算和内存成本。在 RULER v1 的 72 DPI 设置下,FocusVTC 以 $2.9\times$ 输入压缩得分 87.4,高于 Glyph 的 57.5;在 MRCR 延迟评测中相对 Text 实现 $2.79\times$ 在线端到端加速。
来源:Hugging Face Daily Papers · arxiv.org