一句话看懂:一位开发者把 316 万参数的微型语言模型完整装进 250 美元的 FPGA 片上内存,绕开外部 DRAM,实测推理速度约 6 万 token/秒,比同一块板上的 CPU 快约 5000 倍,直观展示了
Show HN:微型LLM在250美元FPGA上跑出21,000 tok/s(现场演示)
一位开发者把 316 万参数的微型语言模型完整装进 250 美元的 FPGA 片上内存,绕开外部 DRAM,实测推理速度约 6 万 token/秒,比同一块板上的 CPU 快约 5000 倍,直观展示了



