A Picture is Worth a Thousand Tokens: How Vision Language Models Cut AI Energy Costs While Improving Accuracy
arXiv 论文(2608.07427v1)报告,将时间序列编码为 2D 图表的视觉语言模型(VLM)在 Llama-3.2-90B、Qwen2.5-VL-72B 和 Pixtral-12B 上实现了 3.6-10.4 倍的输入 token 减少,推理能耗降低 1.8-2.5 倍,在电信边缘部署中每天节省约 7.2 MJ。微调的 Llama-3.2-90B-Vision 在电信异常检测中比纯文本版本精度高 220.7%,比 LSTM 和 ARIMA 高 144%。Pixtral-12B 在公共基准上 J/F1 分数提升 20.6 倍,平均 F1 为 0.82。在 24 个 KPI 下,文本表示超过 128K 上下文窗口。
Development
- First ReportA Picture is Worth a Thousand Tokens: How Vision Language Models Cut AI Energy Costs While Improving AccuracyarXiv cs.AI
- Current Assessment该研究为电信网络分析等场景提供了降低 AI 推理能耗的可行路径,可能推动 VLM 在时间序列分析领域的应用,但需验证在更广泛任务上的泛化能力。Agent Pulse · analysis
该论文提出使用视觉语言模型(VLM)处理时间序列数据,通过将多变量 KPI 窗口编码为 2D 图,大幅减少输入 token 数量,从而降低推理能耗并提升准确性。在 Llama-3.2-90B、Qwen2.5-VL-72B 和 Pixtral-12B 上,输入 token 减少 3.6-10.4 倍,推理能耗降低 1.8-2.5 倍,电信边缘部署每天节省约 7.2 MJ。微调的 Llama-3.2-90B-Vision 在电信异常检测中精度比纯文本版本高 220.7%,比 LSTM 和 ARIMA 高 144%。Pixtral-12B 在公共基准上 J/F1 分数提升 20.6 倍,平均 F1 为 0.82。在 24 个 KPI 下,文本表示超过 128K 上下文窗口,使得纯文本处理不可行。
VLM 通过将时间序列编码为图像,利用视觉 token 的高信息密度,显著减少输入 token 数量,从而降低推理能耗。这一方法在多种架构上有效,表明视觉编码是处理数值时间序列的通用高效方案。
该研究为电信网络分析等场景提供了降低 AI 推理能耗的可行路径,可能推动 VLM 在时间序列分析领域的应用,但需验证在更广泛任务上的泛化能力。
对于电信运营商和边缘计算提供商,该方法可显著降低 AI 推理能耗和成本,同时提升异常检测准确性,具有直接的经济价值。
未来可关注 VLM 在更多时间序列任务上的基准测试,以及该方法在工业界的实际部署效果。