B 站上线“AI 无限竞技场”:百大模型同台 PK,GPT-6 Astra 暂居榜首

B 站上线"AI 无限竞技场"大模型评测榜单,由不同分区 UP 主用真实工作流出题实测,首轮结果中 GPT-6 Astra 暂居第一,前五名有三款国产模型。它值得关注的地方在于:评测标准不再由厂商或固定跑分定义,而是由真实使用场景决定。
先解决问题,再了解资讯。选择你现在要完成的任务。

B 站上线"AI 无限竞技场"大模型评测榜单,由不同分区 UP 主用真实工作流出题实测,首轮结果中 GPT-6 Astra 暂居第一,前五名有三款国产模型。它值得关注的地方在于:评测标准不再由厂商或固定跑分定义,而是由真实使用场景决定。

据路透社报道,Anthropic 正考虑在 IPO 筹备期间推出新模型,以应对 OpenAI GPT-6Astra 在企业市场带来的竞争压力,但新模型的安全评估尚未完成,发布时间未定。

据《华尔街日报》9 月 19 日报道,Claude 开发商 Anthropic 计划将 IPO 推迟到 11 月,目标估值约 2 万亿美元、募资最高 100 亿美元,均意在挑战 SpaceX 今年 6 月创下的纪录。

在 NVIDIA RTX 4000 Ada(cc 8.9)上用 Ollama 运行 gpt-oss:20b (MXFP4)时,短的两条消息(system + user) /api/chat 请求会触发 CUDA 图计算中的 ADD_ID failed 断言并导致 llama-server 崩溃(co

这个报错通常发生在 Ollama 以 Docker 容器方式运行、同时接入了 Intel iGPU 的机器上——容器只看到 CPU,日志里明确写出 "Not utilizing Intel QuickSync iGPU",原因是集显被 Ollama 默认丢弃。优先排查是否设置了 OLLAMA_IGP

使用 Open Interpreter 的 /models 选择器加载 OpenCode Zen 提供商时,界面会一直卡在 "loading models" 且无法自行结束,通常与提供商型号列表请求无法完成有关。优先确认 Open Interpreter 是否已升级到包含修复的版本。

Hacker News 上一条讨论指出,企业若连自身数据的含义都梳理不清,再强的 AI 也无法带来有效决策。讨论的核心不是模型能力,而是数据上下文缺失这一更基础的问题。

一篇在 Hacker News 上引发讨论的文章指出,企业若连自身数据的口径、来源和归属都理不清,接入再多 AI 应用也无法产生可靠结果。它把讨论焦点从模型能力拉回到数据治理这个更基础的问题上。

美国科罗拉多州 Friends School Boulder 校长 Ivan Johnson 撰文反思教育技术的历史教训,警告 AI 进校园正在重复过去"推销优先于教师"的旧模式。这不是产品发布,而是一篇来自一线教育管理者对 AI 落地的冷静判断。

BBC 采访了 OpenAI、Meta、DeepMind 等公司的多位匿名 AI 从业者,他们对“AI 会消灭人类”的说法普遍持怀疑甚至嘲讽态度,认为这类警告缺乏具体细节。这反映出 AI 行业内部对风险优先级存在明显分歧。