Netflix 测试用语言模型替代人工构建的推荐逻辑

Netflix 正在测试用大语言模型替代人工构建的推荐系统逻辑,新系统名为 GenRec,在离线评测和真实用户 A/B 测试中均超过现有生产系统,且所需标注训练数据大幅减少。

一句话看懂:Netflix 正在测试用大语言模型替代人工构建的推荐系统逻辑,新系统名为 GenRec,在离线评测和真实用户 A/B 测试中均超过现有生产系统,且所需标注训练数据大幅减少。

事件核心:发生了什么

Netflix 技术团队于 2026 年 8 月发布博客,披露了名为 GenRec 的语言模型推荐系统。当前 Netflix 的推荐引擎依赖数千个由人工设计的特征,涵盖用户、标题和交互行为,这导致接入游戏、直播、播客等新内容类型时成本高昂。GenRec 采用两阶段训练:先在一个未公开的开源权重语言模型上进行 Netflix 数据微调,使其理解内容库和用户行为;随后通过第二轮专项训练将其转化为推荐排序模型,这一阶段更新频率更高以应对新内容和偏好变化。

GenRec 的核心思路是将用户行为转化为自然语言文本——播放、观看时长、点赞、加入列表和弃看等行为被构造成用户与系统之间的“对话”,而非传统稠密数值向量。为解决上下文窗口限制,Netflix 对事件进行过滤:长时间观看等高信号事件保留完整细节,短暂点击和快速滚动被丢弃,连续观看内容被压缩。系统在 vLLM 上以单次读取输入、不生成文本的方式对所有候选标题统一打分。离线评测中,GenRec 比多年调优的生产系统排名质量提高约 1.6%,而第二阶段训练所需标注样本仅为原有体系的约 1/40。线上四星期 A/B 实验覆盖约 10% 流量,短期主页行为指标提升 0.115%,长期核心指标提升 0.006%,Netflix 表示两项变化均具统计显著性。

为什么重要

这一进展体现推荐系统技术路线正在从“人工特征工程”转向“上下文工程”。Netflix 在博客中提及 PLUM、GLIDE 和 OneRec-Think 等内部项目,显示出其正推动一个通用语言模型同时服务多种推荐场景,而非为每个任务开发定制架构。对行业而言,这释放了一个信号:即使像 Netflix 这样拥有多年经验积累和复杂特征体系的平台,也认为大语言模型的泛化能力足以在推荐任务上替代精细调校的传统模型。此外,GenRec 大幅降低标注数据依赖的特性,对数据规模有限的中小平台更具借鉴意义,可能推动推荐系统开发的范式转移。

值得注意的是,Netflix 强调现成语言模型“过索引热门内容、幻觉出不存在的标题、忽略业务规则”,因此 GenRec 必须在专用数据上微调并在推理时加入目录约束组件。这意味着通用模型无法直接替代领域系统,仍需结合数据和工程技巧做适配。

对用户/开发者/创作者的影响

对普通用户而言,GenRec 上线可能意味着推荐内容更贴合个人长期习惯和即时兴趣变化,尤其是新类型内容(如游戏、直播)的推荐准确度有望改善,但实际感知提升可能较为细微——0.115% 和 0.006% 的线上指标增幅落在用户可感知阈值之下。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者和推荐系统从业者,GenRec 提供了一个可借鉴的技术范本:用文本序列替代数值特征、用开源模型微调替代全自研系统、用 vLLM 推理优化控制成本。这种“语言模型 + 目录约束 + 少样本微调”的组合可能成为推荐系统的新参考架构。对内容创作者,推荐系统对新内容类型的适应能力增强后,冷启动问题可能得到缓解,但 Netflix 尚未公布 GenRec 如何影响不同内容分区或创作者分发的具体数据。

值得关注的后续

首先,GenRec 目前仅覆盖预计算推荐表面,尚未扩展到实时推荐场景,后续是否扩大应用范围值得追踪。其次,第二阶段微调数据量的扩展收益递减现象明显,且基础模型每“变老”两周,推荐质量差距扩大至约 80%,如何平衡基础模型的更新频率与推理成本将是工程关键。第三,Netflix 尚未透露所使用的开源模型具体是哪一个,若未来公开更多技术细节或开源部分组件,可能加速行业跟进。最后,GenRec 的大规模上线时间表目前公开信息未提及,需留意 Netflix 后续官方公告。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 19676

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注