一句话看懂:B站上线”AI 无限竞技场”测评榜,把上百个大模型的真实实测结果汇到一个公开榜单里,首轮由 GPT-6 Astra 居首。它值得关注的地方在于:评测权不再只握在少数机构手里,创作者的实际工作流成了排名依据。
事件核心:发生了什么
B站推出”AI 无限竞技场”测评榜,并公布首轮排名。榜单来自 10 位 UP 主的真机实测,覆盖编程、推理、协作、知识等方向。首轮中,GPT-6 Astra 拿下第一,官方给出的说法是”最能爬榜”,排在 GLM-5.3 之前。目前公开信息显示,前五名里有三款国产大模型,与海外头部模型的差距被拉得很近。
与常规 benchmark 不同,这个榜单没有固定评价维度,由不同分区的创作者根据自己的真实工作流、专业场景或趣味想法自主出题,让模型在同一道挑战里暴露实际差异。DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、通义千问、混元、MiniMax 等主流模型均已纳入对比,榜单实时更新,并向全平台持续开放报名。
为什么重要
过去模型能力的”裁判权”集中在少数评测集和机构手中,标准固定、更新慢,也容易和真实使用脱节。B站把评测场景交还给一线创作者,相当于用分散的真实任务去对冲单一 benchmark 的偏差,这类”众测型”榜单对模型厂商的压力更直接:跑分好看但干活不行,很快会被具体案例拆穿。
另一个信号是国产模型的位次。前三到前五的密集程度说明,在不少实际任务上,国产大模型与海外旗舰已进入同一竞争区间,差距更多体现在具体场景而非整体代差。这对厂商的模型迭代节奏、开源与闭源路线选择,都会形成持续参照。
对用户/开发者/创作者的影响
对普通用户,这类榜单更适合当作”选型参考”而非结论:先看和你任务相近的 UP 实测,再决定是否为一个模型付费或更换主力工具。对开发者,多模型同题对比能暴露 API 在长上下文、工具调用、代码补全等环节的稳定性差异,比纸面参数更接近线上表现;如果要做多模型路由或降级方案,这类真实任务数据比跑分更有参考价值。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对创作者,榜单本身也是一次内容机会:出题、复现、对比的过程天然适合做成测评内容,而报名开放意味着中小 UP 也有机会让自己的测试进入公共榜单。
值得关注的后续
一是排名是否会随模型版本更新频繁变动,尤其国产模型后续迭代能否稳定留在前列;二是评审机制如何防止刷题、选题偏向或利益关联,这决定榜单长期可信度;三是厂商是否会针对榜单暴露的短板做定向优化,甚至主动接入参与实测。
来源:AIbase


