Arena 公布 AI 模型评测榜变现成果,商业评测服务 AI Evaluations 年度经常性收入突破 1 亿美元

知名 AI 模型评测平台 Arena 将其榜单背后的真人评测能力打包为商业服务 AI Evaluations,上线仅 8 个月,年度经常性收入(ARR)即突破 1 亿美元,验证了 AI 评测赛道从“研究工具”转向“企业级付费服务”的商业模式可行性。

知名 AI 模型评测平台 Arena 将其榜单背后的真人评测能力打包为商业服务 AI Evaluations,上线仅 8 个月,年度经常性收入(ARR)即突破 1 亿美元,验证了 AI 评测赛道从“研究工具”转向“企业级付费服务”的商业模式可行性。

DeepSeek V4 正式版定档 7 月中旬,并宣布高峰时段 API 价格翻倍,同时韩国计划投入 800 万亿韩元建设半导体集群,苹果 2027 年产品线也已曝光,涉及 iPhone 19 Pro 系列和折叠设备。AI 模型的商业化节奏与芯片供应链的长期布局正在同步加速。

韩国总统李在明于6月29日公布了一项总额超千万亿韩元的产业投资计划,重点投向半导体和AI数据中心。此举规模空前,旨在巩固韩国在全球AI算力与存储芯片领域的竞争地位。

开发者 Higangssh 在 GitHub 上发布了一套为 AI 编码代理设计的 Yocto/BitBake 专项技能集,通过为代理注入官方文档路由和故障调试能力,减少通用大模型在该领域常见的“幻觉”问题。

中信建投发布研报,认为当前光通信领域的光棒扩产潮不会造成过度供给危机,同时强调GPT-5.6的发布将带动AI算力与应用需求,持续看好AI产业链。这为投资者判断光通信和AI基础设施的中长期节奏提供了参考。
![[分享创造] codex-runway:你的 Codex 额度还可以跑多久?](https://www.chat-gpts.plus/wp-content/uploads/2026/06/ai_cover_3-1042-768x403.jpg)
开发者 Licoy 发布了开源 macOS 状态栏应用 Codex Runway,它能在菜单栏实时显示 OpenAI Codex 的剩余额度、重置次数和成本,解决了高频用户需要反复打开网页查看的痛点。

Hacker News 上一条热门讨论指出,虽然 LLM 能快速输出大量代码,但由于缺乏世界模型,它们无法像人类一样进行真正的系统设计,由此产生的代码债可能成为长期负担。这一观点引发了关于“AI 辅助开发到底削弱还是增强了人的能力”的激烈辩论。

Ornith-1.0 是一类通过“自支架”方法训练的编码代理模型,旨在提升大模型在代码生成和调试中的自主任务规划能力。早期测试显示,其 35B 版本表现不错,但在实际效率与成本上与 DeepSeek V4 Flash 仍有差距。

Switchboard 是一个开源 CLI 工具,能够在本地模型、Codex 和 Claude Code 之间智能路由 AI 提示,将 62% 的请求从昂贵的模型上分流,同时将质量损失控制在 4.6/5 到 4.1/5 之间。它不是 API 代理,而是直接封装现有的命令行工具,用确定性规则优先于学习模型来保证…

微软在ICML 2026上发布了Memora——一种新型可扩展记忆系统,通过将存储内容与检索方式解耦,让AI代理在长周期任务中既保留细节记忆,又节省高达98%的上下文token,性能在LoCoMo和LongMemEval基准上刷新SOTA。这意味着AI代理终于有了真正可用的“长期记忆”。