一句话看懂:法国初创公司 Kog 正尝试用软件优化从企业现有的 GPU 中榨取更多 AI 推理性能,其演示达到了单请求 3000 tokens/秒的解码速度,但验证模型是仅 20 亿参数的小模型;这套方法能否在大模型上复制,是它下一步的关键考验。
事件核心:发生了什么
法国 AI 推理初创公司 Kog 由 Gaël Delalleau 创立,目前团队约 11 人,定位是通过深入的 GPU 底层工程优化,让企业已有的数据中心 GPU(演示使用了 AMD MI300X 和 Nvidia H200)实现远超默认配置的推理速度。今年 5 月,Kog 的技术预览登上 Hacker News 首页,展示了单请求每秒 3000 tokens 的解码吞吐,这一数字远超常规软件栈的水平;但需要说明的是,演示使用的 Laneformer 2B 是 Kog 自研、现已开源的约 20 亿参数小模型,而不是通用大模型。
这次曝光为 Kog 带来了约 200 个明确商业线索。公司判断软件工程会是第一个落地场景——长时间等待 AI 编程工具输出的开发者,是当前最直接的付费群体。
为什么重要
AI 推理速度和成本



