Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent
Video-DeepResearch (Video-DR) 将多模态智能体从静态图像扩展到连续视频流,要求密集时空定位与开放网络探索。初步评估发现两个瓶颈:模态偏差(智能体绕过视觉工具而使用文本搜索)和参数知识泄漏(依赖内部记忆而非工具增强执行)。Video-DR 采用解耦的感知-探索流水线和分阶段工具解锁,强制在网页检索前进行跨帧视觉定位。训练采用两阶段:监督微调和 GRPO。作者构建了 Video-DR-Bench,包含 200 个复杂多跳 VQA 实例。Video-DeepResearch-35B-A3B 达到 64.0% 平均准确率,超过 Claude-4.5-Sonnet 的 59.0%。
Development
- First ReportVideo-DeepResearch: Towards the Next-Generation Multimodal Deepresearch AgentarXiv cs.AI
- Current AssessmentVideo-DR 的发布表明,多模态智能体正在从静态图像向连续视频流演进,这要求模型具备密集时空定位和开放网络探索能力。当前模型的模态偏差和参数知识泄漏问题凸显了工具增强执行的重要性。Video-DR-Bench 的推出为视频深度研究提供了基准,可能推动该领域的标准化评测。Video-DeepResearch-35B-A3B 超越 Claude-4.5-Sonnet 的结果,可能改变闭源与开源模型的竞争格局。Agent Pulse · analysis
Video-DeepResearch (Video-DR) 是一个新框架,将多模态智能体从静态图像扩展到连续视频流,要求密集时空定位与开放网络探索。初步评估揭示当前模型的两个关键瓶颈:模态偏差(智能体绕过视觉工具而使用文本搜索)和参数知识泄漏(依赖内部记忆而非工具增强执行)。Video-DR 通过解耦的感知-探索流水线和分阶段工具解锁来解决这些问题,强制在网页检索前进行跨帧视觉定位。训练采用两阶段:监督微调后接 GRPO,实现自主探索,突破模仿学习上限。作者还构建了 Video-DR-Bench,一个包含 200 个复杂多跳 VQA 实例的人工-AI 协作基准。实验结果显示,Video-DeepResearch-35B-A3B 达到 64.0% 的平均准确率,超过 Claude-4.5-Sonnet 的 59.0%,确立了新的最先进水平。
Video-DR 的核心创新在于解耦感知与探索,并通过分阶段工具解锁强制模型在网页检索前进行跨帧视觉定位,这直接针对模态偏差和参数知识泄漏问题。两阶段训练(SFT 后接 GRPO)使模型能够自主探索,突破模仿学习的天花板。Video-DR-Bench 的 200 个复杂多跳 VQA 实例为视频深度研究提供了标准化评测。Video-DeepResearch-35B-A3B 的 64.0% 准确率表明,在视频深度研究任务上,开源模型可以超越闭源模型。
Video-DR 的发布表明,多模态智能体正在从静态图像向连续视频流演进,这要求模型具备密集时空定位和开放网络探索能力。当前模型的模态偏差和参数知识泄漏问题凸显了工具增强执行的重要性。Video-DR-Bench 的推出为视频深度研究提供了基准,可能推动该领域的标准化评测。Video-DeepResearch-35B-A3B 超越 Claude-4.5-Sonnet 的结果,可能改变闭源与开源模型的竞争格局。
Video-DR 展示了开源模型在视频深度研究任务上超越闭源模型的可能性,这可能降低企业采用高级多模态智能体的成本。Video-DR-Bench 可作为评估视频智能体能力的标准,帮助企业选择合适的技术。对于视频内容分析、监控、教育等领域,Video-DR 可能带来新的应用机会。
未来,视频深度研究智能体可能成为多模态 AI 的重要方向,但需要解决模态偏差和知识泄漏问题。Video-DR 的框架和基准可能被广泛采用,推动更多研究。可验证的下一信号包括:Video-DR-Bench 是否被其他团队使用,以及 Video-DR 方法是否在更大模型上复现。