AI开始赌球会怎样?

一家名为Obside的初创公司用了一个非常规的基准测试——让ChatGPT、Gemini、Claude等主流AI模型用虚拟资金押注世界杯比赛,以衡量它们在不确定性环境下的判断能力。结果显示,Mistral目前领先,而Claude Opus 4.8是唯一亏损的模型。

AI开始赌球会怎样?

一句话看懂:一家名为Obside的初创公司用了一个非常规的基准测试——让ChatGPT、Gemini、Claude等主流AI模型用虚拟资金押注世界杯比赛,以衡量它们在不确定性环境下的判断能力。结果显示,Mistral目前领先,而Claude Opus 4.8是唯一亏损的模型。

事件核心:发生了什么

据Business Insider报道,Obside公司设计了一个实时基准测试:在每场世界杯比赛开赛前一小时,让ChatGPT、Gemini、Claude、Grok、Mistral、DeepSeek和Kimi这七款AI模型进入“智能体模式”,自主研究球队、伤病情况和其他公开信息,然后基于Polymarket上的实时赔率,用虚拟1万美元本金决定投注金额。截至半决赛阶段,法国开源模型Mistral领先,OpenAI的GPT 5.5和DeepSeek的V4紧随其后,而Anthropic的Claude Opus 4.8则排名垫底,是唯一整体亏损的模型。

为什么重要

这个测试之所以值得关注,是因为它衡量了多数AI基准难以覆盖的能力:在信息不完全、结果不确定的情况下做出判断与决策。与标准化测试不同,赌球预测需要模型将公开信息转化为可验证的盈利预测,这对AI在金融、交易、风险分析等领域的实际应用具有参考价值。去年曾有经济学家组织过类似的秘密预测竞赛,ChatGPT的表现仅与人类参赛者平均水平相当。此次世界杯赌球测试显示,不同模型在处理不确定性时的能力差异显著,且开源模型(如Mistral)表现出竞争甚至领先优势,可能对闭源模型的商业定位形成挑战。

对用户/开发者/创作者的影响

对于开发者而言,这个测试提供了评估AI模型“决策智能”的新思路——传统基准测试多聚焦于问答、推理或代码生成,而此类基于真实市场数据的动态测试,更能反映模型在实际场景中的可用性。对于普通用户,特别是关注金融、投资或体育数据分析的群体,这类测试结果说明当前AI在预测类任务上的能力仍参差不齐,不能盲目信赖单一模型的判断。对于AI应用开发者,Mistral和DeepSeek等开源模型的领先表现可能降低企业调用API的成本,同时也提示语言模型在“智能体模式”下的表现差异值得进一步研究。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

首先,世界杯结束后,Obside是否会发布完整测试报告及资金曲线——这将是检验模型长期判断能力的关键。其次,Anthropic是否会对Claude在赌博类测试中表现不佳做出回应,或调整模型在不确定性决策任务上的偏好。再次,这类“预测性基准”是否会成为业界新的评估标准,吸引更多公司参与类似公开测试,从而影响API定价与模型选择。

来源:Business Insider

celebrityanime
celebrityanime
文章: 14357

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注