The Visual Bottleneck: Sparse-Frame Adaptation of MLLMs for Joint Spatial-Temporal Video Grounding
Qwen3-VL 8B 模型在帧数降至 16 时,时间 mIoU 从 56.0% 降至 22.3%,相对下降 60.2%。仅微调最后三层 ViT(占总参数 4%)达到 68.8% 时间 mIoU,超过使用密集输入的零样本 8B 模型 12.8 个点。语言模型微调收益可忽略或为负。提出边界感知采样策略 Hybrid16。
发展脉络
- 首次出现The Visual Bottleneck: Sparse-Frame Adaptation of MLLMs for Joint Spatial-Temporal Video GroundingarXiv cs.AI
- 当前判断视频审核等大规模应用受限于计算资源,只能使用稀疏帧输入,与 MLLM 预训练条件不匹配。该研究提供了一种低成本适配方案,仅微调 4% 参数即可超越密集输入的零样本模型,可能降低视频理解系统的部署成本。这提示行业在资源受限场景下,可通过针对性微调视觉编码器而非全模型微调来提升性能。Agent Pulse · 分析
大规模视频平台每小时处理数百万上传,需要能定位违规发生时间和位置的审核系统。逐帧处理不可行,系统只能使用每视频 8 到 16 帧的稀疏输入。然而 SOTA 多模态大语言模型在数百帧的密集序列上预训练,导致训练与部署条件不匹配,性能严重下降。研究系统评估了训练策略以弥合这一差距,发现视觉特征提取是稀疏帧输入下的主要瓶颈。仅微调最后三层 ViT 层(总参数 4%)达到 68.8% 时间 mIoU,超过使用密集输入的零样本 8B 模型 12.8 个点。语言模型微调收益可忽略或为负。边界感知采样策略 Hybrid16 进一步改善时间定位。
稀疏帧输入下,视觉特征提取是主要瓶颈,而非语言模型。仅微调最后三层 ViT 层(4% 参数)即可显著提升时间定位性能,表明底层视觉特征对帧数敏感,高层语义特征更鲁棒。语言模型微调收益低,提示在稀疏输入场景中应优先优化视觉编码器。Hybrid16 采样策略通过边界感知选择帧,进一步改善时间定位,说明输入帧的选择策略对性能有重要影响。
视频审核等大规模应用受限于计算资源,只能使用稀疏帧输入,与 MLLM 预训练条件不匹配。该研究提供了一种低成本适配方案,仅微调 4% 参数即可超越密集输入的零样本模型,可能降低视频理解系统的部署成本。这提示行业在资源受限场景下,可通过针对性微调视觉编码器而非全模型微调来提升性能。
对于视频平台和审核系统,该研究提供了一种低成本提升稀疏帧视频理解性能的方法,仅微调 4% 参数即可显著改善时间定位,可能降低计算成本和延迟,同时提高审核准确性。这有助于在资源受限条件下部署高性能视频理解系统。
未来可探索更高效的视觉特征提取方法,以及自适应帧采样策略,以进一步缩小稀疏与密集输入的性能差距。该研究可能推动视频理解模型在真实世界稀疏输入条件下的应用,但需验证在其他模型和任务上的泛化性。