工程师如何用好 Grok bot?

SpaceXAI 工程师 Lingxi Li 公开了自己用五个专属 Grok Bot 管理编码 agent 的工作方式,并给出一个月合入 2000+ PR、三周做出 iOS 版本等具体数据,展示了“一个工程师带一支 bot 团队”的新型研发形态。

SpaceXAI 工程师 Lingxi Li 公开了自己用五个专属 Grok Bot 管理编码 agent 的工作方式,并给出一个月合入 2000+ PR、三周做出 iOS 版本等具体数据,展示了“一个工程师带一支 bot 团队”的新型研发形态。

AI 工程圈正在把注意力从"怎么写出好提示词"转向"怎么管理模型的整个上下文"——因为多数 Agent 失败已不是模型能力问题,而是上下文被稀释、淹没和遗忘的问题。

Anthropic CEO Dario Amodei 呼吁行业“为前沿模型设定节奏”,但什么是“节奏”、谁来定速度,五大阵营各说各话。这背后是 AI 算力监管从“要不要管”转向“用什么数字管”的真问题。

硅基流动(SiliconFlow)上线开源模型 Hy4 preview,总参数 770B、单次推理激活 49B、支持 1M 上下文,采用 Apache 2.0 协议,可直接接入 Claude Code、Codex、Cursor 等现有工具。

Apple 于 2026 年 9 月 14 日发布新一代 Apple Intelligence,并把全新重构的 Siri AI 以英文测试版形式正式上线,随 2027 软件版本推送。这意味着 Apple 的语音助手正式从“命令执行”转向具备个人上下文理解与跨应用操作的对话式 AI 入口。

Arena 的 Agent Arena 榜单显示,DeepSeek-V4.1-Flash(Max)在开源模型中排名第 3,单任务中位成本仅 0.07 美元,是前三名里最便宜的一个。

Anthropic 披露其测试影响分析服务在 6 个月内遭遇 CI 任务量 25 倍增长,三次临时修补分别只撑了 70 天、29 天和不到 1 天,最终被迫重构架构。这说明智能体编码已经开始反噬软件工程流水线本身。

Entelligence 用 50 个公开基准 PR 对比 GPT-5.6 Luna 与 GPT-6 Astra,发现 Luna 只花 3.6% 的钱就查出 Astra 约 75% 的真实 bug,但误报率接近四分之一,且安全类缺陷漏得最多。

OpenAI、Anthropic、Google DeepMind 与 SpaceX 等公司的负责人近期松口,同意“放缓前沿 AI 开发节奏”,并提出第三方审计、监管本土实验室、达成全球减速协议三步方案。支持者视为安全共识,批评者则怀疑这是借安全之名行卡特尔之实,阻挡潜在竞争者和开源力量。

GitHub Copilot 的自动模型选择功能新增效率、均衡、智能三档,让用户按任务需要决定自动选模时更看重成本、质量还是响应速度。这把“用哪个大模型”从黑盒默认值变成了可调的参数。