AI 基准测试公司 Vals 获 a16z 领投 4000 万美元 A 轮
Vals 用不公开的行业级任务测试 AI 模型,让厂商为评估付费,刚拿到 a16z 领投的 4000 万美元 A 轮。它想解决的是旧基准被刷分刷烂、测不出真实工作能力的问题。
基准测试已成为 AI 公司验证模型能力、并借分数做宣传的行业惯例,但不少老基准已跟不上现代模型。成立于 2024 年的 Vals 想解决这个问题:它不公开自己的测试题,避免厂商拿题训练模型,并按法律、金融、编程等行业评估模型的实际产出质量。上月它完成由 Andreessen Horowitz 领投的 4000 万美元 A 轮。
正文摘录
基准测试(benchmarking)已成为 AI 公司验证模型能力、并在指标对自己有利时从竞争中脱颖而出、宣传自身优势的行业惯例。换句话说,好的基准测试几乎总等于好的公关。 不幸的是,各家公司也已经学会如何绕开那些老的基准测试体系 —— 其中许多[已经相当陈旧](https://www.technologyreview.com/2026/03/31/1134833/ai-benchmarks-are-broken-heres-what-we-need-instead/),当初设计时并不是用来衡量现代模型的能力的。 Vals,一家[成立于 2024 年](https://www.bloomberg.com/news/newsletters/2024-04-11/this-startup-is-trying-to-test-how-well-ai-models-actually-work)的初创公司,表示自己的使命正是修复这套极不完美的体系。在不到两年的时间里,这家公司已在科技行业确立了不容忽视的存在感,并在去年拿下由 8VC 和 Bloomberg Beta 领投的种子轮。随后在上个月,经过一段高速增长期,它[完成了 4000 万美元](https://www.citybiz.co/article/890247/vals-ai-raises-40m-to-expand-independent-ai-benchmarking/)的 A 轮融资,由 Andreessen Horowitz 领投。 该公司 25 岁的联合创始人 Rayan Krishnan 曾在 Palantir 实习;在斯坦福读本科期间,他还为 Microsoft 以及该校备受赞誉的人工智能实验室工作过。Krishnan 说,Vals 源自他自己的一个观察:基准测试正在落后于它本应衡量的这个行业的前沿进展。