在 M1 Max 上运行 2.8T 参数的 Kimi K3:Deltafin 项目实现 0.0687 token/s 推理

开源项目 Deltafin 用混合计算方案,让一台 64GB M1 Max 工作站本地运行 2.8 万亿参数的 Kimi K3 MoE 大模型,推理速度仅为 0.0687 token/s(约 14.6 秒生成一个 token)。虽然速度极慢,但它证明了“模型远超硬件”的本地推理路径可行。

开源项目 Deltafin 用混合计算方案,让一台 64GB M1 Max 工作站本地运行 2.8 万亿参数的 Kimi K3 MoE 大模型,推理速度仅为 0.0687 token/s(约 14.6 秒生成一个 token)。虽然速度极慢,但它证明了“模型远超硬件”的本地推理路径可行。

马斯克公开宣布Grok 4.6将于2026年8月7日正式发布,随后几周内将推出参数规模达2.1万亿的Grok 4.7。这是xAI首次以如此密集的节奏公布下一代模型路线图,表明其正在加快追赶对手的速度。

马斯克的SpaceXAI在7月29日宣布为AI助手Grok上线“Build”模式,用户只需输入自然语言提示,就能直接生成带独立域名的完整在线应用,目前仅向月费300美元(约2034元人民币)的SuperGrok Heavy顶级订阅用户开放。这一功能将Grok从对话型AI推向“一句话生成应用”的创作平台,直接挑…

摩尔线程宣布其MTT S5000智算卡与MUSA软件栈已成功适配并稳定跑通开源模型Kimi K3(2.8万亿参数),成为又一家能支持万亿参数级模型的国产GPU厂商,国内大模型算力生态正在加速“去NVIDIA化”。

印度德里高等法院裁定,OpenAI 使用新闻机构 ANI 的内容训练大模型属于“合理使用”,不构成版权侵权。法院同时拒绝了 ANI 要求临时禁令的申请,认为禁令将扼杀印度本土大语言模型的发展。

7月28日,月之暗面正式开源2.8万亿参数的Kimi K3模型,同日摩尔线程宣布基于MTT S5000智算卡和MUSA软件栈完成全栈适配并稳定启动。这标志着国产开源大模型首次达到万亿参数级,且国产全功能GPU能第一时间支撑此类模型的训练与推理。

支付宝里的健康AI“蚂蚁阿福”上线了“AI拍饮食”新功能,拍张照片就能帮你算出这顿饭的热量和营养,直接记进健康档案。这背后的逻辑是,AI正在把减肥这件事从“让你少吃点”变成“告诉你该吃什么”,并且顺手帮你把账算好。

AI 网关初创公司 Runlayer 正式起诉人力资源巨头 Rippling,指控后者在为期一年的产品试用期内盗取其源代码,并 1:1 克隆了自家 MCP(模型上下文协议)网关。这起案件戳中了企业 AI 基础设施采购中一个敏感但真实的风险:深度试用可能演变成技术剽窃。

OpenRouter 正式发布了官方的 LangChain 集成包(Python 与 TypeScript),开发者只需安装并修改一行模型字符串,就能在 LangChain 应用中调用超过 400 个模型,并获得自动负载均衡、故障绕行和按成功计费的能力。这大大降低了在链式调用中切换和管理多模型的技术门槛。

OpenAI 近日将内部使用的安全扫描工具 Codex Security CLI 开源,让开发者能在命令行或 CI/CD 流程中直接检测代码漏洞,无需切换平台。这意味着 AI 生成代码的安全审核正从“事后补救”向“实时介入”转变。