在机器学习和信息论中,有一个著名的直觉叫流形假说。 现实世界产生的数据,在名义上往往拥有极高维度:一张高清图片可能对应数百万个像素维度,自然语言、声音、蛋白质序列、行为轨迹也都存在于极其庞大的状态空间中。 但有意义的数据并不会均匀散落在这些空间里,它会被压缩在一个极小、极其特殊的结构区域中。 一张随机生成的百万像素图片几乎不可能恰好构成一张真实人脸,因为自然图像同时受到身份、姿态、光照、透视、物体结构和物理规律等大量约束。 流形,只是…

@Phoenixyin13 在 9 月 16 日发布的一篇长帖,从流形假说出发,把机器学习、信息论和统计物理串成一条线索:智能之所以可能,是因为世界本身不是噪声,而学习在本质上是一种压缩。

一句话看懂:@Phoenixyin13 在 9 月 16 日发布的一篇长帖,从流形假说出发,把机器学习、信息论和统计物理串成一条线索:智能之所以可能,是因为世界本身不是噪声,而学习在本质上是一种压缩。

事件核心:发生了什么

这不是一条产品发布或融资消息,而是一篇关于 AI 基础认知的长文。作者 @Phoenixyin13 的核心论述是:现实数据名义上维度极高,比如一张高清图对应数百万像素,但真正有意义的数据只落在极小区域,受到姿态、光照、物理规律等约束。流形假说只是这种“低复杂度结构”的几何表达。

由此推出两个关键判断:第一,如果宇宙的过去和未来彼此独立,任何 Transformer 或超级计算机都无法通过观察历史提升预测能力,所以智能存在的前提是世界具有可预测结构;第二,模型不需要在参数里存下十亿张人脸的像素副本,而是形成关于身份、轮廓、光照的潜在生成结构,Learning 在深层意义上就是 Compression,这与 Kolmogorov Complexity 的直觉一致。文中还引用了 Mutual Information 和 Information Bottleneck,把智能粗分为 Compression、Prediction、Control 三步。

为什么重要

目前公开信息显示,这些观点并非全新理论,但它把几个常被分开讨论的概念放进同一框架:大模型的参数规模为什么重要、泛化为什么会发生、能力涌现到底是真实突变还是指标阈值效应。作者特别提到,部分涌现可能只是评价方式造成的假象,部分则可能对应 grokking 或内部表示重组这类真实的非线性变化。这个区分对判断“堆算力是否还有效”很关键。

文章还给出一个克制结论:不能说神经网络与现实世界同构,因为同构在数学上过于严格;更准确的说法是,模型在自己的计算介质中形成了一套保存世界部分稳定关系的内部表示,是世界结构的压缩投影。

对用户/开发者/创作者的影响

对训练和推理侧的开发者,这篇文章提示的观察重点不是参数量本身,而是参数空间在学习过程中发生了什么结构重组、哪些依赖被保留、哪些被丢弃。如果 Compression 是理解模型的正路,那么数据质量、去噪和目标函数设计,可能比单纯扩大 token 量更值得投入。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对使用图像生成、大模型 API 的创作者和产品团队,这意味着不能指望模型记住输入的一切;更现实的预期是,模型保留的是可预测、可迁移的那部分结构,这也是为什么 prompt 写法、上下文组织和检索增强仍然有效。

值得关注的后续

一是作者提出的“关注参数空间结构重组”会否引出更具体的实验或可视化工作;二是能力涌现中“指标阈值效应”和“真实表示重组”的比例,是否会有可复现的量化结论;三是 Information Bottleneck 视角会否影响下一阶段开源模型的训练目标设计。

来源:@Phoenixyin13

celebrityanime
celebrityanime
文章: 23793

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注