标签: GPT-4

《AGI的”G”:是已浮现的真实通用性,还是被夸大的幻象?》 杨立昆对”通用智能”的质疑,本质是一场定义权之争,而非对大模型能力的全盘否定。他在Information Bottleneck播客中明确说:”general intelligence is complete BS”,理由是”人类智能本身就是高度专用化的(extremely specialized),我们自以为通用只是一种错觉——因为我们只能想象出我们能想象的问题”。他后续在…

《AGI的"G":是已浮现的真实通用性,还是被夸大的幻象?》 杨立昆对"通用智能"的质疑,本质是一场定义权之争,而非对大模型能力的全盘否定。他在Information Bottleneck播客中明确说:"general intelligence is complete BS",理由是"人类智能本身就是高度专用化的(extremely specialized),我们自以为通用只是一种错觉——因为我们只能想象出我们能想象的问题"。他后续在…

杨立昆公开否认“通用智能”存在,认为人类智能本身高度专用化;但最新评测和商业化数据却显示认知通用性已有实质进展。这场争论本质是“G”的定义权之争,而不是对大模型能力的一票否决。

~1500 Elo! Consistently beats frontier models and Stockfish level 0. Fun seeing an 8b model mogging GPT 5.6 with high reasoning and response chaining. Spends 1-2 seconds per move vs 30 seconds. Play it: https://t.co/q…

~1500 Elo! Consistently beats frontier models and Stockfish level 0. Fun seeing an 8b model mogging GPT 5.6 with high reasoning and response chaining. Spends 1-2 seconds per move vs 30 seconds. Play it: https://t.co/q...

有人用 Qwen 系列的 8B 小模型跑出了一个国际象棋 AI,Elo 约 1500,能稳定击败多个前沿大模型和 Stockfish 最低难度,每步棋只需 1-2 秒。这件事的价值在于:小模型在特定任务上,正用远低于旗舰模型的成本做出可用表现。

未来变量 | 深度研报 🎯 核心结论 **284B 参数的模型,只需 $0.14/M 输入、$0.28/M 输出,就能在 9 项 Agent 基准测试中全面击败自家 1.6T 参数的旗舰——DeepSeek V4 Flash 凭什么重新定义 AI 成本与性能的边界?** > 📌 这不是又一个”性能差不多但更便宜”的模型。这是 2026 年 7 月 31 日刚刚发布的、在 DeepSWE 基准上暴涨 645%、终端任务准确率 82.7%…

未来变量 | 深度研报 🎯 核心结论 **284B 参数的模型,只需 $0.14/M 输入、$0.28/M 输出,就能在 9 项 Agent 基准测试中全面击败自家 1.6T 参数的旗舰——DeepSeek V4 Flash 凭什么重新定义 AI 成本与性能的边界?** > 📌 这不是又一个"性能差不多但更便宜"的模型。这是 2026 年 7 月 31 日刚刚发布的、在 DeepSWE 基准上暴涨 645%、终端任务准确率 82.7%…

DeepSeek 于 7 月 31 日发布 V4 Flash——一款 284B 总参数、仅激活 13B 的 MoE 架构模型,在多项 Agent 基准上超越自家旗舰,API 价格仅为 GPT-5.5 的约 1/35,把“高性能 + 极低成本”的组合推向新边界。

苹果将在AI泡沫破裂时‘看着一切燃烧’

苹果将在AI泡沫破裂时‘看着一切燃烧’

Hacker News 上关于“AI 泡沫何时破裂”的讨论,意外地将苹果推到了中心:相比微软、谷歌和英伟达,苹果没有把赌注全押在云端 AI 上,而是凭借自研芯片和统一内存架构,在本地运行大模型这条路上握有独特筹码。若 AI 资本热潮退潮,苹果可能反而是受伤最轻、甚至能“看着一切燃烧”的那个。

麦克斯韦猜想是错误的(GPT 5.6 解法)

麦克斯韦猜想是错误的(GPT 5.6 解法)

三位数学家构造出 5 个点电荷的特定排布,证明其静电场至少存在 24 个临界点,从而推翻 Maxwell 关于 n 个点电荷最多 (n−1)² 个临界点的两百余年猜想。这项基础数学物理突破,对依赖场论建模的 AI 研究也有潜在参考价值。