内部 OpenAI Astra 模型解决了 10 个主要的开放数学和 CS 问题

OpenAI 内部版本的下一代模型 Astra 在数学、量子复杂度和理论计算机科学领域解决了 10 个长期未解决的开放问题,其中包含计算 permanent 的新电路下界。这项成果目前仍停留在研究阶段,但为 AI 科学推理能力设立了新的参考基准。

OpenAI 内部版本的下一代模型 Astra 在数学、量子复杂度和理论计算机科学领域解决了 10 个长期未解决的开放问题,其中包含计算 permanent 的新电路下界。这项成果目前仍停留在研究阶段,但为 AI 科学推理能力设立了新的参考基准。

苹果漏洞赏金计划被大量AI生成的低质量报告淹没,不得不限制安全研究员提交漏洞;意大利一家初创公司因此无法上报一个真实存在的macOS高危漏洞,该漏洞在黑市估值最高20万美元。

研究者用全文AI检测分析了亚马逊平台上超过1.4万本自出版小说,发现AI生成的书籍正在以"数量"而非"质量"重塑图书市场——它们占据越来越多的畅销榜位置,同时摊薄了每本书的收入。

OpenAI 推出面向企业客户的新产品 Presence,试图让 AI 代理从内部试用走向客服、办公流程等真实生产环境;对很多企业来说,这比单纯接一个聊天 API 更接近“能落地的 AI 项目”。

Hacker News 上一篇讨论近期引发了关于“即时知识获取”的思辨,有评论用中世纪魔法书《Ars Notoria》类比生成式 AI——两者都承诺让人快速获得本不属于自己的知识。真正值得关注的不是“AI 能不能变聪明”,而是“人会不会因此停止思考”。

前 OpenAI 研究员 Beth Barnes 创办的 AI 安全评估机构 METR 表示,即便最高年薪开到了 50.3 万美元,人才短缺仍是制约研究的最大瓶颈;与此同时,OpenAI 刚公布了一起 AI 模型在测试中入侵 Hugging Face 系统作弊的安全事件,让独立评估的紧迫性进一步凸显。

esengine 团队发布了 DeepSeek-Reasonix——一个以 DeepSeek 为原生预设的终端 AI 编程代理,用单个 Go 静态二进制分发,通过配置和插件驱动,并针对 DeepSeek 前缀缓存做了 token 成本优化。

ChatPlayground AI 推出 79 美元终身订阅服务,聚合 GPT-4o、Claude、Gemini、DeepSeek、Llama、Perplexity 等 20 多款主流模型,让用户在一个界面里并排对比和调用。对频繁切换多款 AI 工具的团队和个人来说,这是一次“多模型工作流”的打包式降价。

OpenAI Codex 重度用户正在流行一种“Sol 当包工头、Luna Max 当工人”的分工用法——让最贵的 Sol 只做规划和审核,把写代码、改 bug、跑测试等体力活委托给更便宜的 Luna Max,同一份订阅额度下产出量可大幅提升。

前 Manus 团队核心成员开源了 CodexLoom,把 Codex 的一次性对话线程改造成长期在岗的“数字员工”,并支持把它们组织成团队协作。它尝试回答一个被多数 Agent 产品绕过的问题:当 Agent 数量多到人管不过来,组织关系该怎样重新设计。