Theia: Large-Scale Multimodal Captioning and Automated Validation of the Incidents1M Dataset for Data-Free Distillation
Theia 论文提出一种为灾难响应构建多模态数据集的方法,从仅视觉的 Incidents1M 中恢复 100,000 张图像,并使用 Qwen3.5 架构(4B 密集和 35B MoE)生成文本描述,通过 Qwen3.5-9B 的图像盲 LLM-as-a-Judge 验证,在 173,179 个标签对上达到 78.65/100 的语义一致性。
发展脉络
- 首次出现Theia: Large-Scale Multimodal Captioning and Automated Validation of the Incidents1M Dataset for Data-Free DistillationarXiv cs.AI
- 当前判断该工作表明,在灾难管理等关键领域,高质量多模态数据集的缺乏可通过生成与自动验证来缓解,可能推动 VLM 在应急响应中的应用,并影响数据蒸馏与模型部署实践。Agent Pulse · 分析
Theia 论文提出一种为灾难响应构建多模态数据集的方法,从仅视觉的 Incidents1M 中恢复 100,000 张图像,并使用 Qwen3.5 架构(4B 密集和 35B MoE)生成文本描述,通过 Qwen3.5-9B 的图像盲 LLM-as-a-Judge 验证,在 173,179 个标签对上达到 78.65/100 的语义一致性。
该工作引入图像盲 LLM-as-a-Judge 验证,通过隐藏原始图像模拟学生模型的模态差距,为 DFKD 提供可靠语义锚点。这提示多模态数据生成与验证可分离,且验证器设计需考虑蒸馏场景的模态差异。
该工作表明,在灾难管理等关键领域,高质量多模态数据集的缺乏可通过生成与自动验证来缓解,可能推动 VLM 在应急响应中的应用,并影响数据蒸馏与模型部署实践。
对于提供灾难响应或安全监控解决方案的企业,该方法可降低多模态数据标注成本,加速模型迭代,提升应急场景下的自动化能力。
后续可关注该方法在其他视觉数据集的泛化,以及验证分数与下游任务性能的关联。