AI代码测试初创公司Blacksmith估值不到一年飙升近10倍

AI 代码生成让写代码变快,但测试验证成为新瓶颈。代码测试初创公司 Blacksmith 获 4500 万美元 B 轮融资,估值不到一年从 6000 万美元涨到 5.5 亿美元,反映出 AI 编程催生的软件质量验证需求正在被资本重估。

AI 代码生成让写代码变快,但测试验证成为新瓶颈。代码测试初创公司 Blacksmith 获 4500 万美元 B 轮融资,估值不到一年从 6000 万美元涨到 5.5 亿美元,反映出 AI 编程催生的软件质量验证需求正在被资本重估。

Redwood Research首席科学家Ryan Greenblatt在播客中集中讨论了AI研发效率、递归自我改进(RSI)的可行性、人类专家数据是否构成训练瓶颈,以及token价格下降对行业的影响。这是少有的由一线对齐研究者系统梳理“AI自己改进自己”技术路径的公开对话。

一家 YC 孵化的初创公司正在用 AI Agents 做新材料发现,目标瞄准数据中心芯片的散热难题,目前已能合成性能不输全球化工巨头保密配方的热界面材料。

UXSpot 推出 MCP Server,让 AI 助手能直接读取和操作设计工具中的界面数据。这相当于为 AI 接入 UI/UX 工作流提供了一个标准接口,值得设计工具链上的开发者关注。

微软发布专为 GitHub Copilot 设计的新代码模型 MAI Code 1.1 Flash,虽然比上一代更便宜、更高效,但在性能和价格上双双落后于开源的 DeepSeek-V4-Flash,引发外界对微软模型策略的质疑。

xAI 推出 Grok Bot 测试版,为每个 AI 智能体配一台云端专属电脑,让它们像员工一样独立处理多步骤任务。它不单独售卖,而是捆绑进 Cursor Ultra、Premium Teams 和 SuperGrok Heavy 三档现有订阅,被视为 AI 从“聊天工具”走向“数字打工人”的一次明确商业化尝…

DeepSeek 为“Harness 团队”注册了官方公众号,首次为这一业务线建立对外沟通渠道,被普遍视为通用 Agent 产品即将发布的前置动作。这意味着 DeepSeek 正在把大模型能力从“能对话”推进到“能干活”的工程化落地阶段。

OpenAI 于 2026 年 8 月 12 日发布 ChatGPT Linux 桌面版预览,将 ChatGPT、ChatGPT Work 与 Codex 整合进同一窗口,补齐了产品线在 macOS、Windows 之后的最后一块拼图,也让与 Anthropic Claude 桌面版的开发者争夺战正式进入操作…

OpenAI 低调上线了一款面向防御性网络安全场景的专属模型 Daybreak Blue,它实际上是高端模型 gpt-5.6-sol 的定制别名,需要单独申请审批才能使用,暂不向免费用户开放。

Tura 是一个开源 agent 运行时(runtime harness),它把 ReAct 式多轮工具调用压缩成单轮宏命令图执行,在 DeepSWE 基准上比 Codex CLI 最多减少 69.1% 的 LLM 轮次和 77.5% 的 token,同时把可验证通过率从 63.3% 提升到 65.0% 或…