跳到正文
原文
Hugging Face Daily Papers·· 2 天前AI 评分31

reViT:用深度编程专家实现单块多深度的循环 Vision Transformer

One Block, Multiple Depths: Recurrent Vision Transformers with Depth-Programmed Experts

AI 导读

reViT 通过反复应用单个 Transformer block,在相近推理 FLOPs 下匹配全深度视觉编码器精度,且无需中间特征蒸馏。reViT-B/16 从头训练达到 DeiT III 精度,同时存储参数减少约 70%;8-experts 蒸馏模型几乎保留 DINOv2 teacher 的线性探测精度,并可迁移到分类、分割和深度预测任务。

来源:Hugging Face Daily Papers · arxiv.org