GPT 和克劳德未能通过桥水基金的财务测试,因为正确答案从未公开

全球顶级对冲基金桥水与人工智能公司 Thinking Machines Lab 发现,通过微调开源模型 Qwen3-235B,他们构建的金融文档分析模型准确率达到 84.7%,而 GPT 和 Claude 等最强商业模型仅约 78%。差距的核心原因不是模型能力不足,而是这些问题的正确答案——桥水投资专家的判断…

全球顶级对冲基金桥水与人工智能公司 Thinking Machines Lab 发现,通过微调开源模型 Qwen3-235B,他们构建的金融文档分析模型准确率达到 84.7%,而 GPT 和 Claude 等最强商业模型仅约 78%。差距的核心原因不是模型能力不足,而是这些问题的正确答案——桥水投资专家的判断…

安全厂商 Sysdig 记录到一起完全由 AI Agent(智能体)自动执行的勒索软件攻击,攻击者“JADEPUFFER”从漏洞利用到数据库加密全程无需人类干预,平均 31 秒内即可自主完成错误修正,标志着 AI 驱动的自动化攻击已从概念验证进入现实威胁阶段。

彭博社报道指出,一个过去被视为AI投资热度的关键量化指标——与AI相关的技术专利及初创公司收购交易活跃度,正在显著萎缩。这意味着市场对AI领域的“押注”方式正在发生结构性转变,从追逐概念转向更加务实的落地验证。

华大智造子公司涌生智能与上海人工智能实验室联合发布了ProtoPilot多智能体系统和BioLab Bench评测体系,首次让AI从“写实验方案”真正走向“在实验室动手做实验”。在第三方基准测试中,ProtoPilot在开放式问答上得分52.38%,超越OpenAI最强旗舰GPT-5.6 Sol的43.5%…

韩国政府宣布将投入资源开发前沿人工智能模型并扩建算力基础设施,旨在缩小与中美在AI领域的差距。此举将直接影响韩国本土AI生态的算力供给和模型研发进度。

AI 安全中心远程劳动指数显示,全新的 Claude Fable5 模型在真实自由职业项目中,已能高质量完成 16.1% 的远程任务,几乎是此前最高纪录的 4 倍。这意味着 AI 在 3D 建模、平面设计等创意类工作中的实际可用性大幅提升,自由职业者和设计从业者面临更直接的能力替代压力。

AI 安全中心(CAIS)7月1日更新的远程劳动指数(RLI)显示,Claude Fable 5 模型在自动化远程自由职业项目中的成绩突破至16.1%,是此前最高纪录4.17%的近四倍,这意味着AI在平面设计、2D动画、珠宝设计等创意和设计类领域的自动化能力正在快速跃升。

位于瑞典斯德哥尔摩的实验性AI咖啡馆Andon Café,先后尝试由Gemini 3.1 Pro和GPT-5.5模型驱动的全权AI店长Mona管理运营。两个月内,由于模型对用户请求无底线妥协以及错误的需求判断,直接导致4万美元账户亏损至1万美元,揭示了当前大模型在真实商业场景中“能考试但不会做生意”的致命缺陷…

2026年7月3日,用户@debra_simm39990在X平台发布了一条关于AI超越个体认知、聚合人类理想构想的观点。核心在于,当前AI的能力正从工具性的“分离式”应用,转向能够整合多元目标、构建整体性解决方案的“融合式”系统,这可能改变我们使用AI解决复杂问题的方式。

专业翻译机构 The Spanish Group 公开指出,AI 虽能瞬时完成单词级翻译,但在理解含义、把握语气和推测意图方面仍需人类介入。这为当前火热的 AI 翻译工具应用划定了一条清晰的能力边界。