Kog 深挖 GPU,榨取更多推理性能

法国初创公司 Kog 正尝试用软件优化从企业现有的 GPU 中榨取更多 AI 推理性能,其演示达到了单请求 3000 tokens/秒的解码速度,但验证模型是仅 20 亿参数的小模型;这套方法能否在大模型上复制,是它下一步的关键考验。

一句话看懂:法国初创公司 Kog 正尝试用软件优化从企业现有的 GPU 中榨取更多 AI 推理性能,其演示达到了单请求 3000 tokens/秒的解码速度,但验证模型是仅 20 亿参数的小模型;这套方法能否在大模型上复制,是它下一步的关键考验。

事件核心:发生了什么

法国 AI 推理初创公司 Kog 由 Gaël Delalleau 创立,目前团队约 11 人,定位是通过深入的 GPU 底层工程优化,让企业已有的数据中心 GPU(演示使用了 AMD MI300X 和 Nvidia H200)实现远超默认配置的推理速度。今年 5 月,Kog 的技术预览登上 Hacker News 首页,展示了单请求每秒 3000 tokens 的解码吞吐,这一数字远超常规软件栈的水平;但需要说明的是,演示使用的 Laneformer 2B 是 Kog 自研、现已开源的约 20 亿参数小模型,而不是通用大模型。

这次曝光为 Kog 带来了约 200 个明确商业线索。公司判断软件工程会是第一个落地场景——长时间等待 AI 编程工具输出的开发者,是当前最直接的付费群体。

为什么重要

AI 推理速度和成本

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

celebrityanime
celebrityanime
文章: 18465

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注