标签: 算力

Show HN:TurboGPT:13 秒训练一个 22KiB 的 transformer

Show HN:TurboGPT:13 秒训练一个 22KiB 的 transformer

开发者 lostmsu 在 Hacker News 发布 TurboGPT,用 13 秒训练出一个体积仅 22KiB 的 transformer 模型,定位是受 minGPT 启发的家庭实验项目。它本身的实用价值有限,但把“模型体积”重新推到讨论中心,也再次引发了对这类极小型 GPT 复现项目的必要性争论。

Show HN: TurboGPT: train 22KiB transformer in 13s

Show HN: TurboGPT: train 22KiB transformer in 13s

一个名为 TurboGPT 的开源项目,用纯 CUDA C++ 实现了字节级微型 GPT 的训练流程,在 13 秒内完成 22KiB 模型的训练,代码以 MIT 协议开放。它更像是一份“从零手写大模型训练管线”的教学级实现,而非可直接商用的产品。

Baseten partners with OpenAI to let OpenAI enterprise customers use existing commitments for open models served by Baseten within Codex or via the Responses API (Dannie Herzberg/Baseten)

Baseten partners with OpenAI to let OpenAI enterprise customers use existing commitments for open models served by Baseten within Codex or via the Responses API (Dannie Herzberg/Baseten)

推理服务商 Baseten 与 OpenAI 达成合作,OpenAI 企业客户可以直接把已有的消费承诺,用于 Baseten 托管的开源模型,并在 Codex 或 Responses API 中调用。这意味着企业买 OpenAI 的额度,不再只能换闭源模型,也可以换成开源模型的推理算力。