视觉Transformer
2 条- 01图像分类器是高效的自监督视频表征学习器
提出VideoMSN框架,复用图像ViT处理“超图像”(帧网格),实现轻量高效视频时空自监督学习。
- 02复制相同,蒸馏差异:线性视觉Transformer的初始化方法
提出线性ViT初始化策略,复用Softmax ViT权重并蒸馏注意力差异,显著提升线性ViT性能。
提出VideoMSN框架,复用图像ViT处理“超图像”(帧网格),实现轻量高效视频时空自监督学习。
提出线性ViT初始化策略,复用Softmax ViT权重并蒸馏注意力差异,显著提升线性ViT性能。