
A16z رهبری جذب ۴۰ میلیون دلار برای Vals AI را بر عهده گرفت
والس میگوید آزمایش Finance Agent v2 نشان میدهد که مدلهای مرزی هنوز حدود نیمی از جریانهای کاری واقعی تحلیلگران را شکست میدهند و این شرکت میخواهد ارزیاب مستقل بازار باشد.
شرکت Vals AI در تاریخ 13 اوت 2026، یک دور سرمایهگذاری سری A به ارزش 40 میلیون دلار به رهبری Andreessen Horowitz با ارزیابی 400 میلیون دلار را به پایان رساند، پس از اینکه معیار Finance Agent v2 بهترین مدل مرزی را با دقت 52 درصد در کار تحلیل مالی چند مرحلهای معرفی کرد.
ادعا این است که روایتهای "هوش مصنوعی آماده است" اکنون کمتر به انتشار مدلها وابسته است و بیشتر به اینکه آیا کسی میتواند به اندازه کافی سریع صحت واقعی جریان کار را اندازهگیری کند یا نه.
A16z از Vals حمایت میکند زیرا معیارهای Finance-Agent مدلهای مرزی را با دقت 52 درصد نشان میدهند.
شرکت Vals AI در تاریخ 13 اوت 2026، یک دور سرمایهگذاری سری A به ارزش 40 میلیون دلار با ارزیابی 400 میلیون دلار به رهبری Andreessen Horowitz (a16z) را به پایان رساند. سرمایهگذاران قبلی 8VC، Pear VC و Bloomberg Beta دوباره شرکت کردند و HRT Ventures و Next Ladder Ventures به عنوان حامیان جدید به جمع پیوستند.
این دور به عنوان زیرساخت، نه یک شرط مدل، به فروش میرسد. معیار Finance Agent v2 Vals در ماه مه 2026، نمره بالای 52 درصد دقت را ثبت کرد، به این معنی که بهترین سیستم موجود نتوانسته است به درستی تقریباً نیمی از وظایف چند مرحلهای که انتظار میرفت یک تحلیلگر مالی حرفهای انجام دهد را کامل کند.
از نظر مکانیکی، Finance Agent v2 یک آزمون چند گزینهای نیست. این آزمون میکند که آیا یک عامل میتواند یک جریان کار را از ابتدا تا انتها اجرا کند، از جمله بازیابی دادههای پشتیبان، ترکیب آن بدون خیالپردازی اعداد و زنجیرهسازی استدلال در مراحل مختلف. وظایفی که Vals فهرست میکند شامل ساخت مدلهای ارزش نسبی در شرکتهای همرده، ترکیب کاتالیزورهای بخش و تولید توصیههای سرمایهگذاری مبتنی بر دادههای واقعی اسناد است.
Vals این تأمین مالی را با معیارهای کشش همراه کرد: رشد هشت برابری درآمد در سال 2025، دو برابر شدن تعداد مشتریان و سه برابر شدن تیم در شش ماه گذشته. همچنین گفت که ارزیابیهای آن در کارتهای مدل، افشای ارزیابی رسمی که آزمایشگاهها منتشر میکنند، از OpenAI، Anthropic، Google، Meta و xAI ذکر شده است.
از جدولهای ردهبندی تا صحت جریان کار: چرا Vals فکر میکند معیارهای عمومی گمراهکننده هستند.
ادعای اصلی Vals این است که جدولهای ردهبندی عمومی به طور فزایندهای در حال اندازهگیری چیز نادرست هستند، یا آن را پس از اینکه بازار قبلاً یاد گرفته چگونه آن را بازی کند، اندازهگیری میکنند. حالتهای شکست که به آن اشاره میکند شامل اشباع معیار، جایی که مدلهای برتر در یک آزمون به طور آماری غیرقابل تشخیص میشوند، و آلودگی معیار، جایی که سوالات آزمون به دادههای آموزشی نشت میکنند و نمرات را افزایش میدهند.
استدلال شرکت به فوریه 2026 تکیه دارد.ETHپیشنویس زوریخ و استنفورد که 60 معیار مدل زبان بزرگ مورد استفاده قرار گرفته را تحلیل کرده و دریافت که 29 از 60 معیار اشباع شدهاند، با شکافهای بهترین در مقابل دومین بهترین درون نویز اندازهگیری. همان پیشنویس برای نتیجهای کمتر راحت برای ارزیابها ارجاع داده شده است: مجموعههای تست خصوصی بهطور سیستماتیک از اشباع جلوگیری نمیکنند زمانی که ویژگیهای توزیعی یک معیار بهطور گستردهای شناخته شده باشد.
پاسخ محصول Vals مدیریت چرخه عمر است. این معیارها را بهعنوان "فاسدشدنی" در نظر میگیرد و زمانی که دیگر مدلها را متمایز نمیکنند، آنها را بازنشسته میکند. در مه 2026، معیار CorpFin خود را با یک تست اکسل جایگزین کرد پس از اینکه CorpFin دیگر جدایی کافی بین مدلهای مرزی ارائه نداد.
اینجا همچنین جایی است که Vals در برابر تابلوهای رهبری رأیگیری ترجیحی خط میکشد. Arena (که قبلاً LMArena نامیده میشد) میلیونها رأی ترجیحی انسانی را جمعآوری میکند تا به سؤال "کدام مدل را کاربران در چت ترجیح میدهند؟" پاسخ دهد.
Vals بهصراحت در تلاش است تا به سؤال متفاوتی پاسخ دهد: "کدام مدل تحقیق سرمایهگذاری را بهدرستی با استانداردهای حرفهای کامل میکند؟" اینها معماریهای متفاوتی هستند و وقتی سعی میکنید آنها را در یک جریان کار مالی عملیاتی کنید، بهطور متفاوتی شکست میخورند.
در کنار افزایش سرمایه، Vals سه محصول را راهاندازی کرد که دامنهاش را فراتر از تستهای نقطهای مالی و کدنویسی گسترش میدهد: Vals Smith (معیارهای کدنویسی سفارشی ساخته شده از مخازن GitHub شرکتی)، مجموعه معیارهای ریسک مرزی (امنیت سایبری، سلامت روان، ایمنی AI) و Vals Index 2.0 گسترشیافته با پوشش اقتصادی وسیعتر.
پیشنهاد Vals Smith فاصله بین تست "آیا این مدل میتواند پایتون بنویسد؟" و "آیا این مدل میتواند پایتون ما را بنویسد؟" برای شرکتهایی با پایگاههای کد اختصاصی است.
سیگنالهایی که معاملهگران میتوانند ردیابی کنند: گردش معیار، پذیرش محصول و اینکه مدل 52% چه کسی بود.
جزئیات اساسی و مرتبط با بازار که کمبود دارد، این است: Vals نام نمیبرد که کدام مدل مرزی خاص در مه 2026 بر روی Finance Agent v2 امتیاز 52% کسب کرده است. تا زمانی که آن نقشهبرداری عمومی نشود، این نقطه داده بیشتر بهعنوان سقفی بر روی دسته مفید است تا بهعنوان یک خوانش تمیز برای هر یک از چرخههای انتشار یک آزمایشگاه.
سیگنال بعدی این است که آیا آن سقف با راهاندازی مدلهای بعدی جابجا میشود یا اینکه بهدلیل اینکه گلوگاه قابلیت اطمینان جریان کار است نه قابلیت خام، ثابت میماند. اگر Vals بتواند نتایج را "در عرض چند ساعت" پس از دسترسی به مدل برگرداند، معیار به یک بررسی نزدیک به زمان واقعی بر روی هیاهوی انتشار تبدیل میشود.
از نظر محصول، پذیرش Vals Smith بهترین نماینده برای اینکه آیا شرکتها برای اندازهگیری بهعنوان یک مورد بودجهبندی میکنند، است. معیارهای سفارشی ساخته شده از مخازن GitHub خصوصی نشان میدهد که خریدار از مرحله دمو گذشته و به انضباط تأمین وارد شده است.
در نهایت، تغییرات پوشش Vals Index 2.0 و بازنشستگی یا جایگزینی معیارها مشابه تعویض CorpFin به اکسل را زیر نظر داشته باشید. گردش سریع نشانهای است که تستها به سرعت اشباع میشوند و اعتبار "نمرهگیر" بستگی به بازسازی مداوم آزمون دارد.
خوانش من: معامله این نیست که "AI باهوش است"—بلکه "اندازهگیری به گلوگاه تبدیل میشود".
آستانهای که در اینجا اهمیت دارد این نیست که آیا یک مدل میتواند در یک جدول ردهبندی عمومی بالاترین امتیاز را کسب کند، بلکه این است که آیا میتواند جریانهای کاری حرفهای را با نرخ خطاهای پایین به اندازه کافی برای بقا در تولید پاک کند. سقف دقت ۵۲٪ برای Finance Agent v2 یک محدودیت خشن بر روی روایتهای «عامل مالی خودکار» در کوتاهمدت است، زیرا این بدان معناست که بهترین سیستم هنوز به اندازه کافی اشتباه میکند که نیاز به یک حلقه کنترل انسانی دارد.
اگر Vals همچنان در کارتهای مدل ذکر شود در حالی که همچنین ارزیابیهای پولی را به همان اکوسیستم میفروشد، آزمایش واقعی این است که آیا مشوقهای آن با خریداران به جای فروشندگان همراستا باقی میماند. اگر آن استقلال حفظ شود و گردش کار معیارها بالا بماند، اندازهگیری به لایهای تبدیل میشود که تصمیم میگیرد کدام مدلها به کار گرفته شوند و این نقطه عملی است که در آن دسته دیگر تحت تأثیر روایتها قرار نمیگیرد و شروع به تأمین نیازها میکند.