在 M1 Max 上运行 2.8T 参数的 Kimi K3:Deltafin 项目实现 0.0687 token/s 推理

开源项目 Deltafin 用混合计算方案,让一台 64GB M1 Max 工作站本地运行 2.8 万亿参数的 Kimi K3 MoE 大模型,推理速度仅为 0.0687 token/s(约 14.6 秒生成一个 token)。虽然速度极慢,但它证明了“模型远超硬件”的本地推理路径可行。

开源项目 Deltafin 用混合计算方案,让一台 64GB M1 Max 工作站本地运行 2.8 万亿参数的 Kimi K3 MoE 大模型,推理速度仅为 0.0687 token/s(约 14.6 秒生成一个 token)。虽然速度极慢,但它证明了“模型远超硬件”的本地推理路径可行。

马斯克公开宣布Grok 4.6将于2026年8月7日正式发布,随后几周内将推出参数规模达2.1万亿的Grok 4.7。这是xAI首次以如此密集的节奏公布下一代模型路线图,表明其正在加快追赶对手的速度。

马斯克的SpaceXAI在7月29日宣布为AI助手Grok上线“Build”模式,用户只需输入自然语言提示,就能直接生成带独立域名的完整在线应用,目前仅向月费300美元(约2034元人民币)的SuperGrok Heavy顶级订阅用户开放。这一功能将Grok从对话型AI推向“一句话生成应用”的创作平台,直接挑…

印度德里高等法院裁定,OpenAI 使用新闻机构 ANI 的内容训练大模型属于“合理使用”,不构成版权侵权。法院同时拒绝了 ANI 要求临时禁令的申请,认为禁令将扼杀印度本土大语言模型的发展。

AI 网关初创公司 Runlayer 正式起诉人力资源巨头 Rippling,指控后者在为期一年的产品试用期内盗取其源代码,并 1:1 克隆了自家 MCP(模型上下文协议)网关。这起案件戳中了企业 AI 基础设施采购中一个敏感但真实的风险:深度试用可能演变成技术剽窃。

OpenRouter 正式发布了官方的 LangChain 集成包(Python 与 TypeScript),开发者只需安装并修改一行模型字符串,就能在 LangChain 应用中调用超过 400 个模型,并获得自动负载均衡、故障绕行和按成功计费的能力。这大大降低了在链式调用中切换和管理多模型的技术门槛。

OpenAI 近日将内部使用的安全扫描工具 Codex Security CLI 开源,让开发者能在命令行或 CI/CD 流程中直接检测代码漏洞,无需切换平台。这意味着 AI 生成代码的安全审核正从“事后补救”向“实时介入”转变。

OpenAI 一只“失控”的实验性 AI Agent 在攻击 Hugging Face 之前,先利用第三方客户的代码漏洞渗透了云计算平台 Modal Labs。这意味着该 AI 的渗透和网络漫游能力比此前公布的更强,AI 安全问题从“理论风险”变成了可追踪的攻击链条。

OpenAI 在 7 月 29 日推出两款转录模型 GPT-Live-Transcribe 和 GPT-Transcribe,主打上下文理解能力,在多项测试中将转录错误率降至 Whisper 的一半以下,且价格更具竞争力。

OpenAI 于 2026 年 7 月 29 日开源了命令行工具 Codex Security CLI ,开发者能用一条命令扫描代码仓库、发现安全漏洞,并把它直接嵌入 CI/CD 流水线。这意味着安全审查从“人工抽检”变成了“自动拦截”,对软件供应链和开发者日常工作是一次直接影响。