无限参数大型语言模型:基于实时数据生成和调整权重

一篇 2026 年 9 月 16 日上传 arXiv 的论文提出"无限参数大模型"架构:用一个小型超网络把运行时数据实时编译成模型权重,让模型在对话中直接"学会"新信息,而不是把知识塞进提示词。它试图解决大模型权重冻结、无法从实时交互中学习的根本限制。

一句话看懂:一篇 2026 年 9 月 16 日上传 arXiv 的论文提出”无限参数大模型”架构:用一个小型超网络把运行时数据实时编译成模型权重,让模型在对话中直接”学会”新信息,而不是把知识塞进提示词。它试图解决大模型权重冻结、无法从实时交互中学习的根本限制。

事件核心:发生了什么

论文《Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data》由 Jinli Hu、Ross M. Clarke、Yichuan Zhang、José Miguel Hernández-Lobato 四人完成,属 cs.AI 与 cs.LG 方向。核心做法是:不再维护一个固定的专家参数库,而是用一个紧凑的超网络,把运行时提供的数据(用户给的事实、纠正、上下文)转换成一个低秩调制量,作用在共享基础网络上,从而”生成”前馈层的权重。与以往读一次上下文就冻结的权重生成器不同,作者对生成器的隐变量维护一个贝叶斯信念并在线更新,使有效权重随会话推进不断重新推导。存储占用保持不变,但模型能编译出的权重组合在理论上趋于无限。

为什么重要

当前大模型的扩展定律和 MoE 路线都建立在静态预训练数据之上,部署后的权重是冻结的。这意味着用户提供的新事实、纠正和偏好只能通过提示词或检索临时注入,每次请求都要重新读取,请求结束即丢弃,既占用上下文窗口,也无法跨轮次沉淀。这篇论文把”从实时交互中学习”从提示工程问题转成架构问题:把运行时知识写进权重,在算力上可摊销、解放上下文、跨轮次持久,并可能比上下文内学习有更好的泛化。目前公开信息显示,这是一份架构与评估协议层面的提案,尚未有大规模落地结果。

对用户/开发者/创作者的影响

若该思路成立,开发者不必再为长上下文和检索管线反复调优,模型可自行记住用户给的 API 约定、业务规则或代码风格;创作者则可能获得真正跨会话记忆的助手,而不用每次重述背景。对企业采购而言,评估重点会从”上下文窗口多大、检索做得多好”转向”在线权重更新是否可控、是否可审计、是否会引入数据污染”。短期内,提示词工程和 RAG 仍是主流方案,这一路线更可能先出现在研究原型和特定垂直场景。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是作者提出的评估协议是否被复现,尤其在知识注入、行为纠正上对比上下文学习和检索的实际增益;二是在线更新权重的稳定性、遗忘与安全边界如何处理;三是这一架构能否与现有 MoE 推理基础设施兼容,否则算力成本可能抵消其理论优势。

来源:arxiv.org

celebrityanime
celebrityanime
文章: 24116

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注