标签: GPT-4

提升模型性能的六大Agent Harness能力

提升模型性能的六大Agent Harness能力

NVIDIA Labs 开源了面向对象智能体框架 NOOA,核心结论是智能体的性能不仅取决于模型本身,更取决于“框架架构”(harness)的设计——通过将智能体定义为 Python 类,NVIDIA 在 SWE-bench、CyberGym 等基准上取得领先得分,开发者可以用标准软件工程流程来构建、测试和迭…

Kimi-K3 7月27日在 HuggingFace 发布

Kimi-K3 7月27日在 HuggingFace 发布

月之暗面旗下大模型Kimi-K3于7月27日在HuggingFace发布,其在网络安全基准测试中超过GLM-5.2但仍落后于SOTA闭源模型。社区热议的核心不是模型能力本身,而是要让K3在本地运行所需的RAM高达2~3TB,硬件成本与推理效率的平衡成为焦点。

Cursor 用一群Agent重造SQLite:仅凭 835 页手册,无源码、无测试、不联网

Cursor 用一群Agent重造SQLite:仅凭 835 页手册,无源码、无测试、不联网

Cursor 工程团队让一群 AI 智能体仅凭 835 页 SQLite 技术手册,在无源码、无测试、不联网的条件下用 Rust 从零实现数据库引擎,并一次性通过全部预留测试;关键发现是智能体的编排策略比模型本身更重要——采用规划与执行分离的方案,成本从 10,565 美元降至 1,339 美元,差距近 8…

Once hailed as an AI visionary, Satya Nadella faces pressure as a compute crunch forces Microsoft to prioritize its own AI products over Azure cloud customers (Ashley Stewart/Business Insider)

Once hailed as an AI visionary, Satya Nadella faces pressure as a compute crunch forces Microsoft to prioritize its own AI products over Azure cloud customers (Ashley Stewart/Business Insider)

微软因 AI 算力严重不足,开始把自家 AI 产品(如 Copilot、Azure AI 推理服务)的部署优先级置于 Azure 云客户之上,引发后者不满。曾经被捧为“AI 远见者”的 CEO 萨蒂亚·纳德拉正面临信任危机——一家云基础设施巨头不得不在“卖铲子”和“自己挖金”之间做出艰难取舍。

Prompt Anything: 不再有AI垃圾

Prompt Anything: 不再有AI垃圾

一款名为 Prompt Anything 的新工具在 ProductHunt 上线,宣称要“不再有 AI 垃圾”——目标是通过优化提示词(prompt)流程,直接从源头削减 AI 生成的低质量内容。这件事值得关注,因为它指向 AI 应用层的一个真实痛点:提示工程仍然高度依赖经验,而多数用户产出的结果是“能用但…