Qwen 3.8 Max

阿里通义千问团队发布了 Qwen 3.8 Max 模型,这是其旗舰大模型的一次重要更新,目前已在官网开放体验,旨在提升复杂推理和多模态能力。

阿里通义千问团队发布了 Qwen 3.8 Max 模型,这是其旗舰大模型的一次重要更新,目前已在官网开放体验,旨在提升复杂推理和多模态能力。

谷歌最强大的旗舰AI模型Gemini 3.5 Pro因在编码能力上表现不佳且内部团队协调困难,已延迟数月尚未发布。内部工程师、研究人员与管理者普遍担心,谷歌正在丧失对OpenAI和Anthropic等竞争对手的技术领先优势。

一家名为Obside的初创公司用了一个非常规的基准测试——让ChatGPT、Gemini、Claude等主流AI模型用虚拟资金押注世界杯比赛,以衡量它们在不确定性环境下的判断能力。结果显示,Mistral目前领先,而Claude Opus 4.8是唯一亏损的模型。

AI 正推动专业服务公司(如咨询、法律、会计)重新设计入门级岗位——不是大批裁掉初级员工,而是重塑招聘标准、培训体系和团队协作模式,让 AI 承担基础分析工作,新人的成长路径因此发生根本改变。

OpenAI 悄然将 Codex 模型的可用上下文大小从 372k 缩减到 272k,用户发现早期频繁出现的“模型上下文大小超限”错误已不再出现。随着上下文缩减,OpenAI 开始采用类似加密子代理日志的方式隐藏会话细节,引发部分高级用户对透明度和可控性的担忧。

美国德州一位在职母亲通过向 Anthropic 的 Claude 发送语音备忘录,实现从日程整合、生日礼物推荐到育儿计划的一站式生活管理。这展示了大语言模型在非技术用户日常场景中的实用落地,也暴露了语音交互在家庭环境中的认知成本。

OpenAI 在 2026 年 7 月 18 日合并了一个 Codex 代码库的 Pull Request(#33972),其中包含了对模型元数据的更新,将 Codex 模型的上下文窗口从 372,000 tokens 缩减至 272,000 tokens。这一“倒退”式的调整引发了开发者社区对模型能力稳定性…

月之暗面(Moonshot AI)的最新模型Kimi K3在Code Arena前端代码基准测试中超越Claude Fable 5和GPT-5.6 Sol,成为首个登顶该榜单的中国模型;但在Epoch AI发布的FrontierMath Tier 4专家级数学测试中,仅取得约39%的正确率,远低于OpenAI…

美国云服务商Box CEO Aaron Levie 和知名投资人 David Sacks 公开指出,试图通过封锁或限制模型来阻止中国 AI 进步的做法已行不通,因为中国 AI 在极短时间内追上了前沿水平。他们认为,美国应以更快的开放、更强的基建和更安全的扩散来保持全球竞争力,而非依赖“造围墙”。

Anthropic 宣布其新模型 Claude Fable 5 将于 2026 年 7 月 20 日纳入 Max 和 Team Premium 计划,并以 50% 配额形式提供。由于需求激增和交付压力,内部团队曾“几乎昼夜不休”地赶工完成上线。