2026年LLM进展盘点(迄今为止)

Simon Willison 在 WeAreDevelopers 北美大会的主题演讲中,按时间线盘点了 2026 年大模型进展:从 2025 年 11 月 Claude Opus 4.5 和 GPT-5.1 发布后,编程智能体首次跨过“可靠到能日常使用”的门槛,并由此带来一整年的开发方式变化。

Simon Willison 在 WeAreDevelopers 北美大会的主题演讲中,按时间线盘点了 2026 年大模型进展:从 2025 年 11 月 Claude Opus 4.5 和 GPT-5.1 发布后,编程智能体首次跨过“可靠到能日常使用”的门槛,并由此带来一整年的开发方式变化。

开发者 hp6 在 Hacker News 上发布了 TinyAIArena,让多个 AI Agent 在一个回合制对战游戏里互相对打,任何观众都能点开比赛实时围观。它值得关注的地方不在于游戏本身,而在于这是一次用博弈环境测大模型决策能力的公开实验。

一项针对网页信息抽取的测试显示,只要在指令中加入“缺失字段填 null、不要猜测”,16 个模型的编造率从 70.7% 降到 20.2%。这说明很多“自信的错误”并非能力上限,而是提示词没有把“我不知道”设为一个合法答案。

Fireworks Research 发布专用模型 Ember-1,基于 Kimi K3 训练,在保持同等质量的前提下减少了约 40% 的 token 消耗。它试图解决推理模型在自动化编码和智能体任务中“想太多、花太贵”的问题。

华硕推出搭载 NVIDIA GB300 Grace Blackwell Ultra 超级芯片的 ExpertCenter Pro ET900N G3 桌面工作站,重 27 公斤、配备 748GB 一致内存,被评测者称为“放在桌面上的最强性能机器”,据估算售价在 10 万至 12 万美元之间。

AI 博主 @GeekCatX 分享了一套用于 GPT Image 2.5 的通用「角色设定图」提示词,声称只需上传一张人像照片,即可生成能通过 Seedance 人脸校验的角色卡。这反映出图像生成模型与视频生成平台之间,围绕"人脸一致性"的提示工程正在成为一条实用的创作链路。

有用户实测发现,在抓取微信公众号文章和抖音视频这类"反爬"场景里,Gemini 能直接绕过常规阻碍给出可用脚本,而 ChatGPT 却反复尝试浏览器读取、computer use 视觉解析,耗时和 token 消耗都明显更高。这折射出两家头部大模型在 agent 任务规划策略上的差异。

Engadget 编辑对比了使用两年 ChatGPT Voice 与 Gemini Live 的真实体验:ChatGPT 语音更拟人、更爱联网核实,Gemini Live 语调更平但硬件生态和订阅性价比更好。这场对比背后,是 OpenAI 和 Google 在实时语音交互路线上的明显分化。

OpenAI 应用研究负责人 Boris Power 表示,公司 80% 至 90% 的研究资源已经投向 GPT 7、GPT 8 及更远版本,真正有价值的突破来自新一代模型,而非同一代内的版本小升级。这透露出 OpenAI 的资源分配逻辑,也解释了大模型竞争为何正在被拉长到未来两三代产品的周期上。

斯坦福和加州理工的研究者做了一个叫 HomeBody 的系统,把 GPT-6 Astra 直接接进 Unitree G1 机器人,让它在陌生厨房里自主探索、整理和取物。这再次验证了前沿大模型可以直接充当机器人的"大脑",但同时暴露出延迟、散热和算力成本等现实瓶颈。