我要投稿

BM42横空出世！BM25统御搜索引擎40年，终于要落幕了？

发布日期：2024-07-10 12:11:25 浏览次数： 3481

作者：NLP前沿

微信搜一搜，关注“NLP前沿”

Qdrant 在前几天发起了一些重大声明，提到创造了一个新的算法，命名为BM42，用以取代古老的 BM25（甚至更现代的 SPLADE算法）。

对Qdrant不熟悉的小伙伴，提一点，Qdrant是目前OpenAI正在使用的向量库，所以说明各方面可信度都挺高的。

在他们的帖子中，提到：BM25已经统治了搜索引擎40年了，但是BM25在最新的RAG应用场景表现并不好，所以快来看我们的新算法BM42-一个结合语义和关键词的搜索算法。

通过将单词重要性评分（transformer注意力）与IDF等统计指标相结合来解决语义+关键字搜索的问题，声称在各个场景都有优势，如下图

很快，来自 Vespa（竞品公司）的 @Jo Bergum 指出 Quora作为数据集是非常奇怪的，因为这是一个检测句子相似重复的数据集，而不是问答检索数据集。具体点呢，就是 Quora 数据集每个query只有约 1.6 个相关的候选，因此评测种的 precision@10 结果显然是错误的，声称每 10 个query中有4个候选。

最新，Cohere 的 @Nils Reimers 使用 BM42，在金融、生物医学和维基百科领域的更好数据集上重新运行，遗憾的是 BM42 在所有方面都表现不佳：

Qdrant最新的公关回复，对结果进行了修正，并推送了最新的修正后的代码。但是仍然被质疑评测的BM25分数太低，正常可能能达到0.91。

算是最新的大瓜了，早上刷到了很多帖子。天气太热，吃瓜消遣一下~

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费POC验证，效果达标后再合作。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2026-05-15

在手机上用Codex写一下午代码，说实话，有点上头。

2026-05-15

腾讯混元推出轻量翻译大模型，无需联网，手机直接运行！

2026-05-15

谷歌Android重大更新！底层植入Gemini，苹果已掉队

2026-05-15

Codex更新远程控制，你也终于可以在手机上随时随地Vibe Coding了。

2026-05-15

2026年了，我强烈推荐你用一用Codex，功能太全面了！附使用指南

2026-05-14

DAA度量Agent，百度智能云率先重构AI云

2026-05-14

美团 LongCat 开源 General 365：树立推理评测新标尺

2026-05-14

终端里住进了一个叫 Claude Code 的搭档

联系获取

联系获取

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

Claude Opus 4.7刚刚曝光！Claude Code一夜重构，7x24小时替你打工

2026-04-15

刚刚Qwen 3.6 Plus上线预览：1M上下文，阿里Coding/Agent翻身战打响

2026-03-31

2026年国内如何注册 Claude 账号教程

2026-03-13

OpenAI Codex CLI 完整使用指南

2026-04-07

独家| DeepSeek-V4终于要来了：梁文锋憋半年大招，多模态+长期记忆全面破局

2026-03-17

香港终于能直接用 Gemini 了，内地用户能用上吗？

2026-03-17

Claude Code 和 Codex 接入 Figma MCP 保姆级教程

2026-04-07

编程选GPT-5.4，还是GPT-5.3-Codex？

2026-03-21

全球首个 AI 进化网络 EvoMap，给 Agent 装上 DNA

2026-02-20

GPT5.5来了，最大特点解析

2026-04-24

大家都在问

谁来给企业端即将大规模入职的Agent盖办公室？

2026-05-09

鹅厂员工觉得好的code模型应该具备什么能力？

2026-05-09

Markdown要被抛弃了？Claude Code工程师自曝：我已彻底放弃使用Markdown！团队倾向使用HTML！网友：其他编辑工具会被淘汰吗？

2026-05-09

AI吞噬软件的叙事要分化了？

2026-05-08

为什么同一个模型，在 Claude Code/Codex CLI 里感觉像换了个脑子？

2026-05-07

「双线实测」Qwen 3.6-Plus，Agentic Coding 已经这么能「扛活儿」了？

2026-04-26

本体化语义层，会是 AI 数据平台的新地基吗？

2026-04-22

设计行业的“棺材板”，要被Claude Design盖上了？

2026-04-18

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS Skill 提示词技巧 AI+电商 AI面试数字员工 ChatBI AI知识库开源大模型智能营销智能硬件智能化改造 AI+医疗 MaxKB Palantir Glean Openclaw

应聘简历请发送至： ceo@53ai.com

联系我们

售前咨询

预约演示

微信扫码

添加专属顾问

回到顶部