GPT-Live实时音频新架构发布

OpenAI 发布了全新的实时音频架构 GPT-Live,让模型能够“边听边说”,在推理或调用工具时也不打断对话。这件事之所以值得关注,是因为它把 AI 语音交互从“一问一答”推向连续的自然对话。

OpenAI 发布了全新的实时音频架构 GPT-Live,让模型能够“边听边说”,在推理或调用工具时也不打断对话。这件事之所以值得关注,是因为它把 AI 语音交互从“一问一答”推向连续的自然对话。

Hacker News 上一篇讨论指出,AI 行业背后的隐性借款已高达 1.65 万亿美元,这种债务驱动的增长模式可能难以为继;但与此同时,大量从业者表示模型能力仍在快速提升,泡沫论与价值论正形成激烈对峙。

DeepSeek 发布 V4-Flash 模型,以每百万输入 tokens 0.14 美元、输出 0.28 美元的 API 定价大幅拉低大模型调用成本,单次测试成本约 0.03 美元,远低于同期 Kimi K3 和 GPT-5.6 Sol 的报价,直接冲击现有大模型定价体系。

两个独立研究团队在三个小时内,用同一个 AI 模型解决了同一个量子密码学开放问题。这场“撞车”把 AI 辅助科研的效率和“独立发现”的标准推到了台前。

AI 博主 Swyx 记录了一个典型场景——Codex 自动帮他处理客服聊天,不仅完成了升级请求,还在客服试图推卸责任时拿出完整聊天记录“冷静反驳”。这件事的意义在于,AI 助手正在从“回答问题”进化到“独立办事并对结果负责”,这可能是最值得关注的转变。

Hugging Face 遭遇安全事件后发现,智谱 AI 的开源模型 GLM-5.2 反而比多家美国闭源模型更适合用于防御分析。这一事件恰逢美国考虑限制中国开源权重 AI 模型,引发了对“安全限制”与“开放防御”之间矛盾的重新讨论。

两个独立团队在同一时间使用同一个 AI 模型解决同一量子密码学问题,论文提交仅相隔 3 小时,让学术界对 AI 辅助科研的成果归属和署名规则产生追问。

Anthropic 最新模型 Claude Opus5 展示了通过纯代码生成可运行 3D 游戏与虚拟世界的能力,射击、赛车、滑雪、沙盒生存等 demo 均不需要外部素材资产,引发了关于“程序化生成”是否将改变游戏开发与数字内容生产方式的讨论。

OpenAI 内部测试的新模型 Astra 在数学、量子复杂度与理论计算机科学领域解决了 10 个长期开放问题,按 API 价格计算总成本约 2000 美元,成果本身很惊艳;但业界对它的推广解读存在明显的“合成谬误”——把一个领域的突破等同于通用智能的临近。

一位开发者把 DeepSeek-V4-Flash、OpenAI 的 GPT-5.6 Luna 和 Google 系 Antigravity CLI 组合成一个混合 AI 工作流——用 Luna 补足视觉能力、用 agy 补足联网搜索,再让最便宜的 DeepSeek 模型承担核心编码与推理。这件事本身是一次个人…