一句话看懂:Tura 是一个开源 agent 运行时(runtime harness),它把 ReAct 式多轮工具调用压缩成单轮宏命令图执行,在 DeepSWE 基准上比 Codex CLI 最多减少 69.1% 的 LLM 轮次和 77.5% 的 token,同时把可验证通过率从 63.3% 提升到 65.0% 或 80.0%(取决于配置)。
事件核心:发生了什么
该项目由 Tura-AI 在 HN 上发布,核心痛点是:传统工具调用型 agent 每执行一次工具就要重新进入模型,反复携带系统提示词和不断增长的上下文,既费 token 又拖慢速度。Tura 的做法是向模型暴露一个名为 command_run 的宏工具,让模型一次性构建多步执行树,由运行时接管后续确定性执行,从而把原本需要五轮 LLM 往返的任务压缩到一轮。
公开数据来自 20 个 DeepSWE v1.1 任务和完整 benchmark 报告(25 个高难度任务、6 种 agent/模型配置、270 次会话):Direct 模式比 Codex CLI 少用 77.5% token,通过率 65.0% 对 63.3%;Balanced 模式把省下的预算投入推理和验证,通过率达 80.0%,仍少用 31.1% token。目前公开信息显示,这些结果尚未覆盖 Anthropic、Gemini、OpenAI-compatible、本地模型等更多 provider。
为什么重要
它提示了一个区别于“堆模型能力”的优化路线:通过运行时架构减少模型往返次数,直接解决 coding agent 规模化时最大的成本瓶颈——token 消耗和



