BrowseComp被刷到90%后,美团LongCat甩出LoHoSearch:前沿模型集体跌回三成出头

美团技术团队LongCat发布新检索框架LoHoSearch,在深搜基准BrowseComp上将此前多款领先模型(如GPT-4o、Claude 3.5)的准确率从90%以上拉回至30%出头,提示现有评测体系可能存在“分数通胀”,也意味着真实深度搜索仍远未被解决。

BrowseComp被刷到90%后,美团LongCat甩出LoHoSearch:前沿模型集体跌回三成出头

一句话看懂:美团技术团队LongCat发布新检索框架LoHoSearch,在深搜基准BrowseComp上将此前多款领先模型(如GPT-4o、Claude 3.5)的准确率从90%以上拉回至30%出头,提示现有评测体系可能存在“分数通胀”,也意味着真实深度搜索仍远未被解决。

事件核心:发生了什么

美团旗下技术团队LongCat于近期公开了一项名为LoHoSearch的搜索增强框架。该框架在定位为深度信息检索的BrowseComp评测集上进行了重测。结果显示,此前多款前沿模型在该评测集上达到了接近90%或更高的准确率(如部分前沿模型在优化后超过90%),但引入LoHoSearch的严格约束测试后,这些相同模型的准确率急剧回落至30%左右。LongCat团队指出,这一大幅下降并非模型能力退化,而是LoHoSearch的设计刻意剔除了原有评测中可能存在的“捷径”或“数据泄露”,使得评测更贴近真实的复杂搜索场景。目前,该框架的相关论文与代码已对外公开。

为什么重要

LoHoSearch的发布直接挑战了当前AI社区对“深度搜索能力”的衡量标准。此前,BrowseComp高分被广泛宣传为模型具备高级检索理解能力的证明,这一系列成绩甚至影响了部分企业对搜索产品和技术采购的判断。新的评测结果显示,那些高分可能存在水分——模型可能并未真正理解或综合多层次信息,而是利用了评测设计中的模式。这一事件再次凸显了评测基准本身需要持续迭代,同时表明在复杂的多跳、重逻辑检索任务上,前沿模型与真实可用水平之间仍有巨大鸿沟。对于美团而言,LongCat团队借此在开源社区和技术话语权上完成了一次有力发声,彰显其在大模型与搜索结合方向的研发积累。

对用户/开发者/创作者的影响

对于开发者,这一事件直接提示:不要盲目相信当前主流评测榜单的排名。在为自己的应用选择基础模型或搜索框架时,应构建贴近自身业务场景的评测数据集,而非完全依赖公开基准。对于内容创作者,尤其是那些依赖AI检索生成深度分析或研究报告的用户,应保留对模型输出可靠性的警惕,当前的核心模型在处理需要多级推理的真实检索任务时可靠性不足。对于企业IT采购者,这项新闻敲响警钟:在采购AI搜索或知识库产品时,必须要求供应商提供新基准(如LoHoSearch)下的真实表现,而非仅展示高分榜单成绩,以免企业部署后性能远不及预期。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

首先,其他主流模型厂商(如OpenAI、Anthropic、Google)是否会针对LoHoSearch的评测结果给出官方回应或调整自家模型在对应任务上的表现值得观察。其次,开源社区对LoHoSearch框架的复现和扩展速度将决定其能否成为新的行业评测标准,目前代码已公开是一个积极信号。最后,美团是否计划将这一框架商业化或集成到自有产品(如美团搜索、本地生活智能推荐等)中,将直接决定这项技术对实际用户产生的价值。

来源:AIbase

celebrityanime
celebrityanime
文章: 14492

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注