由 Andreessen Horowitz 投资的 Vals 志在成为 AI 基准测试的黄金标准

AI 基准测试公司 Vals 完成由 Andreessen Horowitz 领投的 4000 万美元 A 轮融资,它用不公开题目的行业实战测试替代传统公开考卷,试图解决大模型“刷榜”问题。

一句话看懂:AI 基准测试公司 Vals 完成由 Andreessen Horowitz 领投的 4000 万美元 A 轮融资,它用不公开题目的行业实战测试替代传统公开考卷,试图解决大模型“刷榜”问题。

事件核心:发生了什么

Vals 成立于 2024 年,总部位于旧金山 Folsom 街一栋由老啤酒厂改造的办公楼。公司创始人 Rayan Krishnan 今年 25 岁,曾在 Palantir 实习,在斯坦福读本科期间为微软和斯坦福 AI 实验室工作。去年 Vals 拿到由 8VC 和 Bloomberg Beta 领投的种子轮,上个月又完成 4000 万美元 A 轮,由 Andreessen Horowitz 领投。目前其营收是去年的 8 倍,团队从年初的 8 人扩张到 25 人,并计划再招 10 到 15 人、搬迁到更大的办公室。

为什么重要

基准测试长期是 AI 公司证明模型能力、抢占公关高地的主要手段,但许多老牌测试体系年代久远,并不适配现代大模型,企业也已经摸清了“刷分”套路。Vals 的做法是不公开具体测试材料,避免模型针对考题做训练,并把评估重点从“模型知道多少”转向“模型能不能在真实行业里干活”。目前公开信息显示,它的测试覆盖法律、金融、编程,还延伸到递归自我改进、心理健康、网络安全、生物安全,甚至研究模型如何应用《日内瓦公约》中的武装冲突法。公司向模型厂商收费做测评,Krishnan 把这比作学生付费参加 SAT。随着 AI 模型成为企业采购和投资决策的核心变量,这类第三方评估的权重可能上升。

对用户/开发者/创作者的影响

对开发者来说,未来选择 API 或开源模型时,可能不再只看跑分榜单,而是参考 Vals 这类评测给出的行业任务表现;对企业采购方,独立的第三方测评有助于判断模型在特定业务场景中的真实水平,降低被厂商宣传误导的风险。对创作者和普通用户,模型能力宣传与实际体验之间的落差有望被更严格地检验。Vals 近期还推出面向联邦机构的模型评估项目,说明合规与安全场景也可能成为评估需求的一部分。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Vals 的评测方法和客户名单是否会进一步公开,能否形成行业公认标准;二是随着 AI 公司陆续上市,这类第三方评估是否会被写入公开文件或投资说明;三是其竞争对手是否会跟进“不公开题库 + 行业实战”的模式,以及监管机构是否采纳类似评估框架。

来源:TechCrunch AI

celebrityanime
celebrityanime
文章: 24429

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注