Show HN:微型LLM在250美元FPGA上跑出21,000 tok/s(现场演示)

一位开发者把 316 万参数的微型语言模型完整装进 250 美元的 FPGA 片上内存,绕开外部 DRAM,实测推理速度约 6 万 token/秒,比同一块板上的 CPU 快约 5000 倍,直观展示了

一句话看懂:一位开发者把 316 万参数的微型语言模型完整装进 250 美元的 FPGA 片上内存,绕开外部 DRAM,实测推理速度约 6 万 token/秒,比同一块板上的 CPU 快约 5000 倍,直观展示了

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

celebrityanime
celebrityanime
文章: 18311

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注