2026年LLM进展盘点(迄今为止)

Simon Willison 在 WeAreDevelopers 北美大会的主题演讲中,按时间线盘点了 2026 年大模型进展:从 2025 年 11 月 Claude Opus 4.5 和 GPT-5.1 发布后,编程智能体首次跨过“可靠到能日常使用”的门槛,并由此带来一整年的开发方式变化。

一句话看懂:Simon Willison 在 WeAreDevelopers 北美大会的主题演讲中,按时间线盘点了 2026 年大模型进展:从 2025 年 11 月 Claude Opus 4.5 和 GPT-5.1 发布后,编程智能体首次跨过“可靠到能日常使用”的门槛,并由此带来一整年的开发方式变化。

事件核心:发生了什么

Willison 把 2026 年的起点定在 2025 年 11 月。当月 Claude Opus 4.5 与 GPT-5.1 相继发布,它们本身是渐进式升级,但与各自编程智能体工具链(Claude Code、Codex)配合后,从“经常出错”变成“足够可靠、可日常使用”。他常年用“骑自行车的鹈鹕”SVG 测试新模型,11 月时 Claude 仍画不好自行车,GPT-5.1 的车架也不理想。同年 11 月,GitHub 上一个名为 “Warelay” 的仓库迎来首次提交。12 月假期期间,开发者开始密集试用这套组合,意识到能力上限被明显抬高。进入 1 月,他放弃“少接项目”的旧年目标,改为“更激进”,并联合 Bryan Cantrill、Adam Leventhal 在 Oxide and friends 播客做出多项预测,包括 LLM 写好代码将无可否认、沙箱问题终将解决、可能出现编程智能体安全事故,以及新西兰鸮鹦鹉迎来繁殖大年。

为什么重要

这轮变化的关键不是模型跑分,而是“模型加智能体工具链”这一组合进入可用区间。对行业而言,它意味着编程智能体从演示走向生产工具,推动 AI 应用从辅助补全转向能独立完成多步任务。Willison 提到,播客中造了一个词 “Deep Blue”,形容软件工程师因 AI 什么都能做而产生的倦怠感,这已成为全年反复出现的主题。目前公开信息显示,会议 277 场中有约 40 场涉及沙箱或智能体安全,说明安全与隔离正成为与能力并行的工程焦点。

对用户/开发者/创作者的影响

对开发者,值得关注的是能否把 Claude Code、Codex 这类智能体纳入日常流程,并优先补齐沙箱、权限与审计。对企业采购,评估重点应从单模型分数转向“模型加工具链”的稳定性与可控性。对创作者和普通用户,编程成本下降会加速小工具、自动化和内容生产类应用的涌现,但目前公开信息显示,智能体被劫持造成现实经济损失的“挑战者号时刻”尚未真正发生,风险更多停留在工程投入层面。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是编程智能体在真实项目中的出错率与安全事件是否出现拐点;二是沙箱与智能体安全能否形成标准方案并被主流平台采纳;三是 Warelay 仓库的用途与背后项目,以及播客中关于鸮鹦鹉繁殖季等预测是否应验,可作为观察 Willison 年度判断的线索。

来源:Simon Willison

celebrityanime
celebrityanime
文章: 25961

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注