Modern conference room with a large screen and a
人工智能

A16z领投4000万美元Vals AI A轮融资,准确率仅52%

Vals表示,其Finance Agent v2测试显示,前沿模型仍然无法满足大约一半的真实分析师工作流程,并且它希望成为市场的独立评估者。

作者:Elliot Marsh阅读 5 分钟

Vals AI在其金融代理v2基准将最佳前沿模型的多步骤金融分析师工作准确率提升至52%后,获得了由Andreessen Horowitz领投的4000万美元A轮融资,估值为4亿美元。其宣传语是“人工智能已准备好”,现在的障碍不再是模型发布,而是是否有人能够快速衡量真实工作流程的正确性以跟上进度。

A16z支持Vals,因为金融代理基准将前沿模型的准确率提升至52%。

Vals AI于2026年8月13日以4亿美元估值完成了4000万美元的A轮融资,由Andreessen Horowitz(a16z)领投。回头投资者8VC、Pear VC和Bloomberg Beta再次参与,HRT Ventures和Next Ladder Ventures作为新投资者加入。

这一轮融资被视为基础设施,而不是模型赌注。Vals的金融代理v2基准在2026年5月记录了52%的最高准确率,这意味着现有最佳系统未能正确完成专业金融分析师预计处理的约一半多步骤任务。

从机械上讲,金融代理v2并不是一场选择题考试。它测试代理是否能够端到端地运行工作流程,包括检索支持数据、在不产生虚假数据的情况下合成数据,以及跨步骤进行推理。Vals列出的任务包括在同行公司之间建立相对价值模型、合成行业催化剂以及生成基于实际文档数据的投资建议。

Vals将融资与增长指标结合起来:2025年收入增长八倍,客户数量翻倍,团队在过去六个月内增加了三倍。它还表示,其评估已被OpenAI、Anthropic、Google、Meta和xAI发布的模型卡中引用,这些是官方评估披露。

从排行榜到工作流程正确性:为什么Vals认为公共基准具有误导性。

Vals的核心主张是,公共排行榜越来越多地测量错误的东西,或者在市场已经学会如何操控它之后再进行测量。它指出的失败模式包括基准饱和,顶级模型在测试中变得统计上无法区分,以及基准污染,测试问题泄漏到训练数据中并抬高分数。

该公司的论点依赖于2026年2月的ETH苏黎世和斯坦福大学的预印本分析了60个广泛使用的大型语言模型基准,发现其中29个已达到饱和状态,最佳与第二最佳之间的差距在测量噪声范围内。同一预印本被引用以得出一个让评估者不太舒服的结论:一旦基准的分布特征被广泛了解,私有测试集并不能系统性地防止饱和。

Vals的产品响应是生命周期管理。它将基准视为“易腐烂的”,并在它们不再区分模型时将其退役。在2026年5月,它用Excel测试替换了CorpFin基准,因为CorpFin不再提供足够的前沿模型区分。

这也是Vals对偏好投票排行榜划定界限的地方。Arena(前称LMArena)收集数百万个人类偏好投票,以回答“用户在聊天中更喜欢哪个模型?”Vals明确试图回答一个不同的问题:“哪个模型能够以专业标准正确完成投资研究?”这些是不同的架构,当你尝试在金融工作流程中将它们操作化时,它们的失败方式也不同。

在融资的同时,Vals推出了三款产品,扩大了其超越金融和编码点测试的范围:Vals Smith(基于企业GitHub代码库构建的定制编码基准)、前沿风险基准套件(网络安全、心理健康、AI安全)以及覆盖面更广的Vals Index 2.0。Vals Smith的卖点是测试“这个模型能写Python吗?”与“这个模型能写我们的Python吗?”之间的差距,针对拥有专有代码库的公司。

交易者可以跟踪的信号:基准周转、产品采用,以及52%模型是谁

市场上最相关的缺失细节是基本的:Vals没有说明哪个具体的前沿模型在2026年5月的Finance Agent v2中得分52%。在该映射公开之前,这个数据点更像是该类别的上限,而不是对任何一个实验室发布节奏的清晰解读。

下一个信号是这个上限是否随着后续模型的发布而变化,或者因为瓶颈是工作流程的可靠性而保持不变。如果Vals能够在获得模型访问后“在几小时内”持续交付结果,那么基准就成为对发布炒作的近实时检查。

在产品方面,Vals Smith的采用是企业是否将测量作为一项预算项目的最清晰代理。基于私有GitHub代码库构建的定制基准意味着买家已经过了演示阶段,进入了采购纪律。

最后,关注Vals Index 2.0的覆盖变化以及类似于CorpFin到Excel的基准退役或替换。快速周转是测试快速饱和的迹象,而“记分员”的可信度依赖于持续重建考试。

我的看法:交易不是‘AI聪明’——而是‘测量成为瓶颈’

这里重要的阈值不是一个模型是否能在公共排行榜上名列前茅,而是它是否能够以足够低的错误率清除专业工作流程,从而在生产环境中生存。Finance Agent v2 的52%准确率上限对短期“自主金融代理”叙事构成了一个粗糙的限制,因为这意味着最佳系统仍然常常出错,需要人类控制环节。

如果 Vals 在模型卡中持续被引用,同时又向同一生态系统销售付费评估,那么真正的考验是其激励是否与买方而非卖方保持一致。如果这种独立性得以保持,并且基准周转率保持高位,测量就成为决定哪些模型被部署的门槛层,这就是该类别停止以叙事驱动而开始以采购驱动的实际点。

来源