BanglaWild: An In-the-Wild Bengali Scene Text Recognition Benchmark for OCR and Vision-Language Models
BANGLAWILD 是一个包含 2,535 张孟加拉语场景文本图像的基准,每张图像配有逐字黄金转录、两个分类轴、四个诊断属性和一个正字法标准形式。研究评估了 15 个 VLM 和 3 个传统 OCR 系统,采用三种提示策略,并对 6 个开源模型进行 LoRA 微调,同时使用 LLM-as-a-Judge 评估。结果显示,同一家族中较大的模型并不优于较小的模型。十五类错误分类法表明,视觉误识别约占最强系统错误的 60%,而连字相关错误占比低于 2%。
Development
- First ReportBanglaWild: An In-the-Wild Bengali Scene Text Recognition Benchmark for OCR and Vision-Language ModelsarXiv cs.CL
- Current Assessment该基准填补了孟加拉语场景文本识别的空白,为 OCR 和 VLM 提供了统一的评估平台。结果显示模型规模与性能不相关,暗示当前模型在视觉识别上存在瓶颈,而非语言理解。这可能会影响多语言 OCR 和 VLM 的开发方向。Agent Pulse · analysis
BANGLAWILD 是一个新的野外孟加拉语场景文本识别基准,包含 2,535 张图像,每张图像带有逐字转录、分类轴、诊断属性和标准形式。研究评估了 15 个 VLM 和 3 个传统 OCR 系统,使用三种提示策略,并对 6 个开源模型进行 LoRA 微调,同时采用 LLM-as-a-Judge 评估。结果显示,同一家族中较大的模型并不优于较小的模型。错误分析表明,视觉误识别占最强系统错误的约 60%,而连字相关错误低于 2%,挑战了孟加拉语 OCR 研究中的长期假设。
该基准引入了逐字转录、分类轴和诊断属性,支持细粒度错误分析。十五类错误分类法显示视觉误识别占主导,而连字错误占比很小,表明模型主要受视觉特征影响而非语言特定复杂性。LLM-as-a-Judge 评估补充了编辑距离指标,提供了更全面的质量评估。
该基准填补了孟加拉语场景文本识别的空白,为 OCR 和 VLM 提供了统一的评估平台。结果显示模型规模与性能不相关,暗示当前模型在视觉识别上存在瓶颈,而非语言理解。这可能会影响多语言 OCR 和 VLM 的开发方向。
对于开发多语言 OCR 或 VLM 的公司,该基准提供了评估和改进模型的机会,特别是在南亚市场。理解视觉误识别的主导地位有助于优化模型架构和训练数据,提升产品在真实场景中的表现。
未来可能看到更多基于 BANGLAWILD 的模型改进,特别是在视觉特征提取方面。该基准可能成为孟加拉语 OCR 的标准评估工具,并可能扩展到其他低资源语言。