Baseten 工程师实测:LLM 生成的推理引擎比 vLLM 快最多 90%

Baseten 工程师用一套「只给技能、不微调模型」的智能体框架,让 LLM 从零生成推理引擎,在单张 B200 上跑 Qwen-3.6-35B-A3B,单流解码速度最高比 vLLM 0.25.1 快 90%,TTFT 快 2.33 倍。

Baseten 工程师用一套「只给技能、不微调模型」的智能体框架,让 LLM 从零生成推理引擎,在单张 B200 上跑 Qwen-3.6-35B-A3B,单流解码速度最高比 vLLM 0.25.1 快 90%,TTFT 快 2.33 倍。

GitHub 为 Copilot 代码审查开放了 REST 和 GraphQL API,并把默认审查强度由 Default 切换为 Balanced,让团队可以把 AI 审查接入已有的脚本、CI 流程和内部工具。

GitHub 已完成无状态安装令牌的分阶段上线,新签发的 App installation token 默认改为约 520 字符的 ghs_APPID_JWT 格式,签发与校验更快,但所有把它当作定长 40 字符串处理的代码都需要提前改造。

Redis 作者 antirez 发布了开源项目 DwarfStar 4(ds4),一个用 C 写成的本地大模型推理引擎,主打让 2840 亿参数的 DeepSeek V4 Flash 这类大 MoE 模型在高内存 Mac、CUDA 和 ROCm 机器上本地跑起来。

Meta 把部分 AI 数据中心归类为具有“实验性质”的试点项目,借此在购买 AI 芯片时申请研发税收抵免,两年累计少缴约 60 亿美元税款,而美国国税局(IRS)可能对此提出挑战。

苹果表示将针对 macOS 的“完全磁盘访问权限”(Full Disk Access)加入更多管控措施,理由是 AI 智能体(AI agents)的普及提高了这一权限级别带来的风险。这意味着 macOS 上权限最敏感的一类授权,可能不再像过去那样一次授权、长期通行。

在 AI 不断制造“震撼时刻”的当下,TIME 刊文提醒:真正塑造人类心智与共同体的“敬畏感”,多数来自他人的勇气、善意与自我牺牲,而非机器能力。

Business Insider 采访了三位小企业主,她们都在用 AI 做营销,但没把预算和品牌决策交给平台。这说明 AI 营销工具的真实价值在于提效,而非替代判断。

Apple 就 macOS 的“完全磁盘访问权限”(Full Disk Access)发出警告,称部分 AI Agent 开发者在用户不完全知情的情况下获取系统级数据访问权,并将为这一权限增加更严格的确认机制。

ChatGPT 上线 Sites 功能,用户用自然语言描述需求即可生成网站、应用或小游戏,并在 ChatGPT 内完成托管、发布和权限管理,目前处于公测阶段。