标签: GPT-4

Transformer统治AI 7年,初创公司已开始颠覆它!效率、成本、推理成新战场,下一代LLM架构呼之欲出 https://t.co/LGN3y3Rqrz #大语言模型 #AI架构 #Transformer

Transformer统治AI 7年,初创公司已开始颠覆它!效率、成本、推理成新战场,下一代LLM架构呼之欲出 https://t.co/LGN3y3Rqrz #大语言模型 #AI架构 #Transformer

Transformer 架构主导大语言模型已有七年,一批初创公司正尝试用更高效的替代架构挑战其统治地位,焦点集中在训练效率、推理成本和长文本处理能力上。这场架构层面的竞争,可能比模型参数竞赛更值得关注。

让知识蒸馏便宜到可大规模运行

让知识蒸馏便宜到可大规模运行

Multiverse Computing 等研究团队提出两种系统级优化——离线缓存教师模型 Top-K logits,以及融合分块 KL 散度损失——把大模型知识蒸馏的显存峰值从约 250GB 降到约 128GB,让蒸馏可以在单张 H200 上跑通,大幅降低压缩大模型的门槛。