标签: GPT-4

2026年LLM进展盘点(迄今为止)

2026年LLM进展盘点(迄今为止)

Simon Willison 在 WeAreDevelopers 北美大会的主题演讲中,按时间线盘点了 2026 年大模型进展:从 2025 年 11 月 Claude Opus 4.5 和 GPT-5.1 发布后,编程智能体首次跨过“可靠到能日常使用”的门槛,并由此带来一整年的开发方式变化。

Show HN:TinyAIArena 看 AI Agent 一决高下

Show HN:TinyAIArena 看 AI Agent 一决高下

开发者 hp6 在 Hacker News 上发布了 TinyAIArena,让多个 AI Agent 在一个回合制对战游戏里互相对打,任何观众都能点开比赛实时围观。它值得关注的地方不在于游戏本身,而在于这是一次用博弈环境测大模型决策能力的公开实验。

Ember-1

Ember-1

Fireworks Research 发布专用模型 Ember-1,基于 Kimi K3 训练,在保持同等质量的前提下减少了约 40% 的 token 消耗。它试图解决推理模型在自动化编码和智能体任务中“想太多、花太贵”的问题。

An Asus homage to legendary Apple Mac Pro: GB300 DGX workstation gets two thumbs up from reviewer who calls $120,000 AI supercomputer ‘the most capable thing we’ve ever put on a desk’

An Asus homage to legendary Apple Mac Pro: GB300 DGX workstation gets two thumbs up from reviewer who calls $120,000 AI supercomputer 'the most capable thing we’ve ever put on a desk'

华硕推出搭载 NVIDIA GB300 Grace Blackwell Ultra 超级芯片的 ExpertCenter Pro ET900N G3 桌面工作站,重 27 公斤、配备 748GB 一致内存,被评测者称为“放在桌面上的最强性能机器”,据估算售价在 10 万至 12 万美元之间。

分享一个 GPT Image 2.5 通用角色卡提示词,可过Seedance 人脸,上传一张人像图即可。 👇 https://t.co/Eok59wrjqz

分享一个 GPT Image 2.5 通用角色卡提示词,可过Seedance 人脸,上传一张人像图即可。 👇 https://t.co/Eok59wrjqz

AI 博主 @GeekCatX 分享了一套用于 GPT Image 2.5 的通用「角色设定图」提示词,声称只需上传一张人像照片,即可生成能通过 Seedance 人脸校验的角色卡。这反映出图像生成模型与视频生成平台之间,围绕"人脸一致性"的提示工程正在成为一条实用的创作链路。

Gemini是真的屌,我宣布gemini是世界上最屌的模型 我让它抓取公众号文章,它尝试了几种基础的方式发现受阻后,直接模拟微信浏览器内核的请求头给了个脚本完成抓取! 我让它获取dy视频、音频,它依旧是尝试基础操作受阻后直接拿到dy的视频CDN链接,从CDN中直接抓取!然后自己用ytb cli完成解析! 反观GPT 尝试基础脚本不行后,使用内置chrome读取公众号,发现dom加载超时后选择直接调用本机chrome再次读取dom,发现…

Gemini是真的屌,我宣布gemini是世界上最屌的模型 我让它抓取公众号文章,它尝试了几种基础的方式发现受阻后,直接模拟微信浏览器内核的请求头给了个脚本完成抓取! 我让它获取dy视频、音频,它依旧是尝试基础操作受阻后直接拿到dy的视频CDN链接,从CDN中直接抓取!然后自己用ytb cli完成解析! 反观GPT 尝试基础脚本不行后,使用内置chrome读取公众号,发现dom加载超时后选择直接调用本机chrome再次读取dom,发现…

有用户实测发现,在抓取微信公众号文章和抖音视频这类"反爬"场景里,Gemini 能直接绕过常规阻碍给出可用脚本,而 ChatGPT 却反复尝试浏览器读取、computer use 视觉解析,耗时和 token 消耗都明显更高。这折射出两家头部大模型在 agent 任务规划策略上的差异。

OpenAI 称其 80% 至 90% 的研究已瞄准 GPT 7 及更高版本

OpenAI 称其 80% 至 90% 的研究已瞄准 GPT 7 及更高版本

OpenAI 应用研究负责人 Boris Power 表示,公司 80% 至 90% 的研究资源已经投向 GPT 7、GPT 8 及更远版本,真正有价值的突破来自新一代模型,而非同一代内的版本小升级。这透露出 OpenAI 的资源分配逻辑,也解释了大模型竞争为何正在被拉长到未来两三代产品的周期上。