Petals:在家运行大语言模型,BitTorrent 风格

Petals 项目允许用户利用消费级 GPU 或 Google Colab,通过 BitTorrent 风格的分布式网络,加载和运行 Llama 3.1、Mixtral 等大型语言模型的一部分,并与他人共享算力,实现推理和微调。

Petals:在家运行大语言模型,BitTorrent 风格

一句话看懂:Petals 项目允许用户利用消费级 GPU 或 Google Colab,通过 BitTorrent 风格的分布式网络,加载和运行 Llama 3.1、Mixtral 等大型语言模型的一部分,并与他人共享算力,实现推理和微调。

事件核心:发生了什么

Petals 是一个开源项目,源自 BigScience 研究研讨会,旨在降低运行大语言模型的门槛。用户无需拥有高端显卡,只需加载模型的一部分(例如,一个分片),即可加入一个由社区成员组成的点对点网络。网络中的其他人同时运行模型的其他部分,共同完成推理任务。根据公开数据,该网络在单批次推理时,Llama 2(70B)可达每秒 6 个 token,Falcon(180B)可达每秒 4 个 token,足以支持聊天机器人和交互式应用。项目已在 GitHub 上开源,并提供了 Google Colab 快速体验链接。

为什么重要

当前大语言模型(如 Llama 3.1 405B)的完整运行依赖昂贵的集群算力,高昂的硬件成本和 API 调用费用是普通用户和中小开发者进入的主要障碍。Petals 的分布式架构借鉴了 BitTorrent 理念,将算力需求分散到社区闲置的消费级 GPU 上,有可能重塑大模型推理与微调的经济模型。它打破了“逐模型自建算力”的传统模式,转向了类似“算力众筹”的协作方式,为去中心化 AI 基础设施的探索提供了具体实践。对于 OpenAI、Google 等提供闭源 API 的公司而言,这种社区驱动的开源替代方案,正在拓宽技术普及的路径。

对用户/开发者/创作者的影响

对于普通用户,Petals 意味着有可能在自己的笔记本或台式机上,通过加入网络来体验 Llama 3.1 400B 参数级别的模型,而无需支付高昂的 API 费用或购买昂贵硬件。对于开发者而言,它不仅提供了类似传统 API 的调用接口,还保留了 PyTorch 和 🤗 Transformers 的灵活性,允许自定义采样方法、微调模型,甚至访问模型的隐藏状态,这对于研究模型内部机制或进行特定任务微调极有价值。内容创作者可以利用它进行本地化、低成本的文本生成实验,或为特定应用场景(如剧本、对话辅助)部署轻量级模型。不过,目前网络稳定性存在波动(网站提示“网络状态加载失败”),依赖贡献者的在线情况,实际体验可能受网络连接和参与人数影响。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

首先,该网络的长期稳定性和参与度是关键。如果贡献者不足或网络波动频繁,用户体验会大打折扣,项目需要持续运营社区和激励机制。其次,与 Hugging Face 等平台的生态融合程度将决定其可用性,目前它已声明兼容 Transformers 库,但能否无缝接入主流工作流仍需观察。最后,分布式推理在安全性和数据隐私方面是否有额外风险(例如,模型部分被分割运行时,中间状态是否泄漏),也是需要行业关注的潜在监管与合规问题。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 14818

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注