B 站上线“AI 无限竞技场”:百大模型同台 PK,GPT-6 Astra 暂居榜首

B 站上线"AI 无限竞技场"大模型评测榜单,由不同分区 UP 主用真实工作流出题实测,首轮结果中 GPT-6 Astra 暂居第一,前五名有三款国产模型。它值得关注的地方在于:评测标准不再由厂商或固定跑分定义,而是由真实使用场景决定。

一句话看懂:B 站上线”AI 无限竞技场”大模型评测榜单,由不同分区 UP 主用真实工作流出题实测,首轮结果中 GPT-6 Astra 暂居第一,前五名有三款国产模型。它值得关注的地方在于:评测标准不再由厂商或固定跑分定义,而是由真实使用场景决定。

事件核心:发生了什么

根据 AIbase 报道,B 站于 2026 年 9 月推出”AI 无限竞技场”大模型评测排名,并公布首轮榜单。该平台汇总各领域 UP 主的实测内容,覆盖代码、推理、协作、知识等主题,参与对比的模型包括 DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、Qwen、混元、MiniMax 等主流产品。

与传统 Benchmark 不同,竞技场对题目和评测维度不设限制,UP 主可用真实工作流、专业应用或趣味想法自行出题,在同一题目下横向比较模型表现。首轮十位 UP 主的评测中,GPT-6 Astra 击败 GLM-5.3 拿下”夺冠次数最多”,前五名有三款国产大模型。榜单实时更新,并持续向全站 UP 主开放报名。

官方披露的背景数据是:过去一年 B 站 AI 知识内容消费时长增长 72%,每月有超过 1.9 亿用户观看 AI 相关内容。

为什么重要

大模型评测长期存在两种路径:一是厂商自报,二是标准化跑分。前者容易挑有利指标,后者则常被批评与真实任务脱节——模型刷高分数但在实际写作、调试、长链路协作中表现不稳的情况并不少见。B 站的做法是把评测权交给有具体使用场景的创作者,用”同题竞技”替代固定题库。

这对竞争格局有直接影响。榜单上国产模型与 GPT、Claude、Gemini 同台,且前三名之外仍有国产模型进入前五,说明在中文场景和部分垂直任务上,开源与闭源、国内与海外模型的差距正在被压缩。对厂商而言,这类榜单的传播力和说服力可能不亚于官方发布会,但也意味着评测结果更难被单方面控制。

对用户/开发者/创作者的影响

对普通用户,竞技场更接近”选型参考”而非技术论文:如果某一模型在视频剪辑、表格处理或代码调试的实测中反复胜出,其参考价值通常高于抽象分数。对开发者,真实工作流评测可以补充 API 选型时的盲区,尤其是推理成本、长上下文稳定性和工具调用成功率这些跑分不易体现的维度。对内容创作者,这意味着评测本身正在成为一条可持续的内容赛道,但前提是题目设计足够具体、可复现,否则容易滑向流量化的口水对比。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是榜单是否会公开投票与计分规则,以及如何处理 UP 主立场或商单带来的偏向;二是模型厂商是否会针对高频实测题目做定向优化,从而让榜单逐渐失真;三是这种”社区评测”模式能否沉淀为长期可查的数据库,而非一轮轮热点。目前公开信息显示,竞技场仍处于开放报名和实时更新阶段,最终影响力取决于评测质量能否稳定。

来源:AIbase

celebrityanime
celebrityanime
文章: 24522

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注