标签: API

连续扩散语言模型 (CDLM’s)

连续扩散语言模型 (CDLM's)

在沉寂两三年之后,连续扩散语言模型(Continuous Diffusion Language Models)重新成为研究热点。相比当前主流的自回归大模型,这类模型试图用“去噪”而非“逐词预测”的方式生成文本,可能为可控生成、文本填充等任务开辟新路径。

Show HN:Academa – 由LLM生成的长篇STEM教学视频

Show HN:Academa – 由LLM生成的长篇STEM教学视频

Academa 是一个利用大语言模型自动生成长篇 STEM 教学视频的新项目,目前在 Hacker News 上以“Show HN”形式公开。它尝试把 LLM 的内容生成能力从文本扩展到结构化、长时长的教育视频,值得关注的原因是它可能改变 STEM 教育内容的制作成本和分发方式。

连续扩散语言模型 (CDLM’s)

连续扩散语言模型 (CDLM's)

一篇 Hacker News 热帖重新争论“为什么扩散模型没有在大语言模型中取代解码器架构”,核心观点是:让 ChatGPT 成功的不是生成方式,而是 RLHF 等后训练技术,扩散模型只是更复杂的 token 生成方式,并未解决真正的问题。

公平工作委员会谴责“完全错误”的AI法律建议

公平工作委员会谴责“完全错误”的AI法律建议

澳大利亚公平工作委员会(Fair Work Commission)公开谴责一份由 AI 生成的法律意见书“完全错误”,并指出该意见书在关键法律推理上存在严重缺陷。这一事件再次提醒所有行业:大模型输出的专业建议必须经过人工核验,不能直接用于正式决策。

700G 的大模型怎么塞进 8G 显存?聊聊量化和蒸馏

700G 的大模型怎么塞进 8G 显存?聊聊量化和蒸馏

当大模型参数规模逼近 7000 亿,普通消费级显卡的 8GB 显存早已无法直接加载推理,量化和蒸馏成为把模型“塞进去”并跑起来的关键技术手段。这篇文章梳理了这两条技术路线的原理和适用场景,帮助开发者理解如何在算力受限环境下部署大模型。