2026年LLM进展盘点(迄今为止)

Simon Willison 在 WeAreDevelopers 北美大会的主题演讲中,按时间线盘点了 2026 年大模型进展:从 2025 年 11 月 Claude Opus 4.5 和 GPT-5.1 发布后,编程智能体首次跨过“可靠到能日常使用”的门槛,并由此带来一整年的开发方式变化。

Simon Willison 在 WeAreDevelopers 北美大会的主题演讲中,按时间线盘点了 2026 年大模型进展:从 2025 年 11 月 Claude Opus 4.5 和 GPT-5.1 发布后,编程智能体首次跨过“可靠到能日常使用”的门槛,并由此带来一整年的开发方式变化。

首款主打端侧大模型自主操作的中兴 nubia NaviX Ultra,在运行《王者荣耀》时被提示“设备环境异常”并强制下线,豆包手机助手否认介入腾讯游戏或实施模拟点击、外挂等违规行为。这暴露出端侧 AI Agent 与第三方应用安全机制之间的权限边界问题。

谷歌在印度小范围测试让用户直接在 Gemini 的 AI 界面内完成 Flipkart 商品下单,不再跳转外部页面。这意味着大模型正从"帮你找商品"走向"替你完成交易"。

Meta 在 Meta Connect 2026 开发者大会上公布个人 AI 智能体 Muse 的多项升级,并于 9 月 25 日开放预发布体验,重点是把 AI 从聊天窗口推向桌面系统控制、视频化身与智能眼镜等跨设备场景。

据英国《金融时报》报道,暗网上出现大量低价转卖的 AI 模型访问权限,折扣最高达 97%,同时有团伙入侵企业服务器"借用"算力运行自己的模型。这意味着 AI 算力正在成为网络犯罪的新目标。

前苹果 Siri 与 Apple Intelligence 工程师 Nikhil Gupta 推出 AI 智能体 szn,它直接运行在 iMessage 对话里,不只回答问题,还能替用户浏览网站、下单、联系商家。这意味着 AI 助理正从"对话工具"往"代办工具"迁移,但接入方式和隐私授权仍不透明。

MiniMax 于 9 月 27 日上线最新文本模型 M3.1-Flash-Preview,并在 MiniMax Code 平台同步重置全体用户的 Token Plan 额度、发放免费 token 与双倍签到积分,明显是在用福利和稳定性卖点争夺开发者。

据多家消息源透露,OpenAI 计划在即将到来的 DevDay 上发布一款代号为「O」的常驻 AI 助手,内部项目代号为 Aeon,相关配置线索已出现在 ChatGPT 配置文件中,预计发布时间为 9 月 29 日。

Anthropic 把上线近两年的开发者工具 Workbench 正式更名为 Playground,并对 Claude API 做了彻底的界面化和模块化改造,让没有工程背景的人也能直接调试和导出可运行代码。这意味着大模型厂商的竞争,正从聊天入口延伸到如何把普通用户转化为开发者。

微软 AI 负责人 Mustafa Suleyman 就近期多起 AI 安全事件接受采访,谈到在测试比现有模型大 10 倍以上的未来模型时移除安全护栏的风险,并再次呼吁建立跨行业的安全机构。核心矛盾是:模型能力还在加速,但安全治理的组织形式仍未定型。