贵57.1倍的Claude Opus 4.8五项全输,赢它的不是模型,是Harness

Floatboat 用市面上最便宜的模型 DeepSeek-V4-Flash 作底座,在五项第三方 Agent 基准上全部超过价格贵 57.1 倍的 Claude Opus 4.8。它想证明:Agent 的胜负手不只是模型,而是模型之外那半套系统——Harness。

Floatboat 用市面上最便宜的模型 DeepSeek-V4-Flash 作底座,在五项第三方 Agent 基准上全部超过价格贵 57.1 倍的 Claude Opus 4.8。它想证明:Agent 的胜负手不只是模型,而是模型之外那半套系统——Harness。

Cursor 人力负责人 Adam Ward 在 Lenny's Podcast 中拆解了 AI 时代组建高密度人才团队的方法论:先定义“前 1%”标准,再通过人才地图和长期关系经营持续追踪目标,而非依赖传统招聘漏斗。这为理解 AI 人才市场的结构性分化提供了最新样本。

摩根大通本周一将标普500年末目标价从7800点上调至8000点,理由是AI资本开支的回报终于“越来越可见”——这意味着华尔街开始相信,科技巨头砸下的千亿美元算力投入,正在变成真实的收入和利润,而不是无底洞。

金尼药房(Kinney Drugs)因收到数百起客户投诉,撤下了其 AI 手机助手。这是生成式 AI 在真实客服场景中遭遇大规模负面反馈的典型案例,再次说明 AI 落地不能只看模型能力,更要看人工兜底和用户体验设计。

Meta CEO马克·扎克伯格公开批评“封闭式”AI竞争对手,强调Meta将回归并坚持开放式模型路线。这场关于开源与闭源的路线之争,正在成为AI行业未来走向的关键分水岭。

Hugging Face 与 EleutherAI 合作发起 FineBooks 项目,实测 14 款开源 OCR 模型后发现,当前最优模型能以不到每千页 2 美元的成本,把历史书籍扫描文本的字符准确率提升到 97% 以上,足以改善大模型训练数据的质量,但也还不能直接用于学术研究。

原定发布的《AI音乐周刊 W.A 040》因原文链接访问超时,本期具体资讯内容未能获取。但该周刊持续更新至第 40 期本身,已反映出 AI 音乐生成领域近一年来信息密度和产品迭代频率明显加快。

Anthropic 展示了 Claude 在数学研究上的一次完整闭环:独立产出论文、内部专家验证、外部专家评审,并生成形式化可验证证明。Hacker News 讨论的焦点却不是“AI 多聪明”,而是这种成果高度依赖人类“鼓励”这类难以标准化的互动,以及结果能否被复现。

一篇在 AI 社区流传的网络科普文章指出,当 Claude、本地大模型、数据抓取和出海创业逐渐成为 AI 玩家的日常操作时,IP、DNS、代理、VPN 这类底层网络知识反而成了最容易被忽视的“卡点”。本文整理了该文章的核心观点,并分析为什么补网络基础课正在成为 AI 使用者的新刚需。

一份面向非技术读者的《AI名词小白入门白皮书》出现在社区,核心不是罗列术语,而是提出一套分层框架,帮读者判断 GPT、RAG、MCP、Agent 这些词在 AI 系统中各自处于哪一层。它提示我们:背熟名词清单,不如先分清模型、产品、工具和执行机制之间的层级关系。