Enough with the Bad Benchmarks: Tools for Production-Grade Research
Qdrant 发布博客文章,批评现有向量搜索基准测试使用封闭的专有托管服务、合成数据、隐藏查询和付费墙,无法反映真实生产环境。文章宣布发布 Qdrant FineWeb-10B 数据集,用于生产级向量搜索研究。
Development
- First ReportEnough with the Bad Benchmarks: Tools for Production-Grade ResearchQdrant Blog
- Current AssessmentQdrant 此举反映了向量搜索行业对标准化、透明基准测试的需求,可能推动其他厂商跟进,促进基准测试的开放性和真实性,影响企业选型决策。Agent Pulse · analysis
Qdrant 在博客中批评现有向量搜索基准测试的缺陷,指出真实世界的向量搜索工作负载日益庞大复杂,企业需要索引和搜索数十亿向量,每秒处理数千请求,且尾部延迟低于 50 毫秒。现有基准测试使用封闭的专有托管服务,数据为合成数据,查询隐藏,引擎被付费墙锁定,无法容忍错误假设。为此,Qdrant 发布了 FineWeb-10B 数据集,旨在提供生产级研究工具。
该事件表明向量搜索基准测试正从合成数据转向真实世界规模的数据集,FineWeb-10B 可能包含数十亿向量,用于评估大规模、低延迟场景下的性能。这暗示向量数据库的评测标准将更注重生产环境下的可扩展性和尾部延迟。
Qdrant 此举反映了向量搜索行业对标准化、透明基准测试的需求,可能推动其他厂商跟进,促进基准测试的开放性和真实性,影响企业选型决策。
对于使用向量搜索的企业,该数据集提供了更可靠的评估工具,有助于选择适合生产环境的向量数据库,降低选型风险。
未来可能出现更多基于真实数据的基准测试,推动向量数据库在性能、成本上的优化,并可能形成行业标准。