Modern conference room with a large screen and a
هوش مصنوعی

A16z رهبری جذب ۴۰ میلیون دلار برای Vals AI را بر عهده گرفت

والس می‌گوید آزمایش Finance Agent v2 نشان می‌دهد که مدل‌های مرزی هنوز حدود نیمی از جریان‌های کاری واقعی تحلیلگران را شکست می‌دهند و این شرکت می‌خواهد ارزیاب مستقل بازار باشد.

نوشته Elliot Marsh5 دقیقه مطالعه

شرکت Vals AI در تاریخ 13 اوت 2026، یک دور سرمایه‌گذاری سری A به ارزش 40 میلیون دلار به رهبری Andreessen Horowitz با ارزیابی 400 میلیون دلار را به پایان رساند، پس از اینکه معیار Finance Agent v2 بهترین مدل مرزی را با دقت 52 درصد در کار تحلیل مالی چند مرحله‌ای معرفی کرد.

ادعا این است که روایت‌های "هوش مصنوعی آماده است" اکنون کمتر به انتشار مدل‌ها وابسته است و بیشتر به اینکه آیا کسی می‌تواند به اندازه کافی سریع صحت واقعی جریان کار را اندازه‌گیری کند یا نه.

A16z از Vals حمایت می‌کند زیرا معیارهای Finance-Agent مدل‌های مرزی را با دقت 52 درصد نشان می‌دهند.

شرکت Vals AI در تاریخ 13 اوت 2026، یک دور سرمایه‌گذاری سری A به ارزش 40 میلیون دلار با ارزیابی 400 میلیون دلار به رهبری Andreessen Horowitz (a16z) را به پایان رساند. سرمایه‌گذاران قبلی 8VC، Pear VC و Bloomberg Beta دوباره شرکت کردند و HRT Ventures و Next Ladder Ventures به عنوان حامیان جدید به جمع پیوستند.

این دور به عنوان زیرساخت، نه یک شرط مدل، به فروش می‌رسد. معیار Finance Agent v2 Vals در ماه مه 2026، نمره بالای 52 درصد دقت را ثبت کرد، به این معنی که بهترین سیستم موجود نتوانسته است به درستی تقریباً نیمی از وظایف چند مرحله‌ای که انتظار می‌رفت یک تحلیلگر مالی حرفه‌ای انجام دهد را کامل کند.

از نظر مکانیکی، Finance Agent v2 یک آزمون چند گزینه‌ای نیست. این آزمون می‌کند که آیا یک عامل می‌تواند یک جریان کار را از ابتدا تا انتها اجرا کند، از جمله بازیابی داده‌های پشتیبان، ترکیب آن بدون خیال‌پردازی اعداد و زنجیره‌سازی استدلال در مراحل مختلف. وظایفی که Vals فهرست می‌کند شامل ساخت مدل‌های ارزش نسبی در شرکت‌های هم‌رده، ترکیب کاتالیزورهای بخش و تولید توصیه‌های سرمایه‌گذاری مبتنی بر داده‌های واقعی اسناد است.

Vals این تأمین مالی را با معیارهای کشش همراه کرد: رشد هشت برابری درآمد در سال 2025، دو برابر شدن تعداد مشتریان و سه برابر شدن تیم در شش ماه گذشته. همچنین گفت که ارزیابی‌های آن در کارت‌های مدل، افشای ارزیابی رسمی که آزمایشگاه‌ها منتشر می‌کنند، از OpenAI، Anthropic، Google، Meta و xAI ذکر شده است.

از جدول‌های رده‌بندی تا صحت جریان کار: چرا Vals فکر می‌کند معیارهای عمومی گمراه‌کننده هستند.

ادعای اصلی Vals این است که جدول‌های رده‌بندی عمومی به طور فزاینده‌ای در حال اندازه‌گیری چیز نادرست هستند، یا آن را پس از اینکه بازار قبلاً یاد گرفته چگونه آن را بازی کند، اندازه‌گیری می‌کنند. حالت‌های شکست که به آن اشاره می‌کند شامل اشباع معیار، جایی که مدل‌های برتر در یک آزمون به طور آماری غیرقابل تشخیص می‌شوند، و آلودگی معیار، جایی که سوالات آزمون به داده‌های آموزشی نشت می‌کنند و نمرات را افزایش می‌دهند.

استدلال شرکت به فوریه 2026 تکیه دارد.ETHپیش‌نویس زوریخ و استنفورد که 60 معیار مدل زبان بزرگ مورد استفاده قرار گرفته را تحلیل کرده و دریافت که 29 از 60 معیار اشباع شده‌اند، با شکاف‌های بهترین در مقابل دومین بهترین درون نویز اندازه‌گیری. همان پیش‌نویس برای نتیجه‌ای کمتر راحت برای ارزیاب‌ها ارجاع داده شده است: مجموعه‌های تست خصوصی به‌طور سیستماتیک از اشباع جلوگیری نمی‌کنند زمانی که ویژگی‌های توزیعی یک معیار به‌طور گسترده‌ای شناخته شده باشد.

پاسخ محصول Vals مدیریت چرخه عمر است. این معیارها را به‌عنوان "فاسدشدنی" در نظر می‌گیرد و زمانی که دیگر مدل‌ها را متمایز نمی‌کنند، آن‌ها را بازنشسته می‌کند. در مه 2026، معیار CorpFin خود را با یک تست اکسل جایگزین کرد پس از اینکه CorpFin دیگر جدایی کافی بین مدل‌های مرزی ارائه نداد.

این‌جا همچنین جایی است که Vals در برابر تابلوهای رهبری رأی‌گیری ترجیحی خط می‌کشد. Arena (که قبلاً LMArena نامیده می‌شد) میلیون‌ها رأی ترجیحی انسانی را جمع‌آوری می‌کند تا به سؤال "کدام مدل را کاربران در چت ترجیح می‌دهند؟" پاسخ دهد.

Vals به‌صراحت در تلاش است تا به سؤال متفاوتی پاسخ دهد: "کدام مدل تحقیق سرمایه‌گذاری را به‌درستی با استانداردهای حرفه‌ای کامل می‌کند؟" این‌ها معماری‌های متفاوتی هستند و وقتی سعی می‌کنید آن‌ها را در یک جریان کار مالی عملیاتی کنید، به‌طور متفاوتی شکست می‌خورند.

در کنار افزایش سرمایه، Vals سه محصول را راه‌اندازی کرد که دامنه‌اش را فراتر از تست‌های نقطه‌ای مالی و کدنویسی گسترش می‌دهد: Vals Smith (معیارهای کدنویسی سفارشی ساخته شده از مخازن GitHub شرکتی)، مجموعه معیارهای ریسک مرزی (امنیت سایبری، سلامت روان، ایمنی AI) و Vals Index 2.0 گسترش‌یافته با پوشش اقتصادی وسیع‌تر.

پیشنهاد Vals Smith فاصله بین تست "آیا این مدل می‌تواند پایتون بنویسد؟" و "آیا این مدل می‌تواند پایتون ما را بنویسد؟" برای شرکت‌هایی با پایگاه‌های کد اختصاصی است.

سیگنال‌هایی که معامله‌گران می‌توانند ردیابی کنند: گردش معیار، پذیرش محصول و اینکه مدل 52% چه کسی بود.

جزئیات اساسی و مرتبط با بازار که کمبود دارد، این است: Vals نام نمی‌برد که کدام مدل مرزی خاص در مه 2026 بر روی Finance Agent v2 امتیاز 52% کسب کرده است. تا زمانی که آن نقشه‌برداری عمومی نشود، این نقطه داده بیشتر به‌عنوان سقفی بر روی دسته مفید است تا به‌عنوان یک خوانش تمیز برای هر یک از چرخه‌های انتشار یک آزمایشگاه.

سیگنال بعدی این است که آیا آن سقف با راه‌اندازی مدل‌های بعدی جابجا می‌شود یا اینکه به‌دلیل اینکه گلوگاه قابلیت اطمینان جریان کار است نه قابلیت خام، ثابت می‌ماند. اگر Vals بتواند نتایج را "در عرض چند ساعت" پس از دسترسی به مدل برگرداند، معیار به یک بررسی نزدیک به زمان واقعی بر روی هیاهوی انتشار تبدیل می‌شود.

از نظر محصول، پذیرش Vals Smith بهترین نماینده برای اینکه آیا شرکت‌ها برای اندازه‌گیری به‌عنوان یک مورد بودجه‌بندی می‌کنند، است. معیارهای سفارشی ساخته شده از مخازن GitHub خصوصی نشان می‌دهد که خریدار از مرحله دمو گذشته و به انضباط تأمین وارد شده است.

در نهایت، تغییرات پوشش Vals Index 2.0 و بازنشستگی یا جایگزینی معیارها مشابه تعویض CorpFin به اکسل را زیر نظر داشته باشید. گردش سریع نشانه‌ای است که تست‌ها به سرعت اشباع می‌شوند و اعتبار "نمره‌گیر" بستگی به بازسازی مداوم آزمون دارد.

خوانش من: معامله این نیست که "AI باهوش است"—بلکه "اندازه‌گیری به گلوگاه تبدیل می‌شود".

آستانه‌ای که در اینجا اهمیت دارد این نیست که آیا یک مدل می‌تواند در یک جدول رده‌بندی عمومی بالاترین امتیاز را کسب کند، بلکه این است که آیا می‌تواند جریان‌های کاری حرفه‌ای را با نرخ خطاهای پایین به اندازه کافی برای بقا در تولید پاک کند. سقف دقت ۵۲٪ برای Finance Agent v2 یک محدودیت خشن بر روی روایت‌های «عامل مالی خودکار» در کوتاه‌مدت است، زیرا این بدان معناست که بهترین سیستم هنوز به اندازه کافی اشتباه می‌کند که نیاز به یک حلقه کنترل انسانی دارد.

اگر Vals همچنان در کارت‌های مدل ذکر شود در حالی که همچنین ارزیابی‌های پولی را به همان اکوسیستم می‌فروشد، آزمایش واقعی این است که آیا مشوق‌های آن با خریداران به جای فروشندگان هم‌راستا باقی می‌ماند. اگر آن استقلال حفظ شود و گردش کار معیارها بالا بماند، اندازه‌گیری به لایه‌ای تبدیل می‌شود که تصمیم می‌گیرد کدام مدل‌ها به کار گرفته شوند و این نقطه عملی است که در آن دسته دیگر تحت تأثیر روایت‌ها قرار نمی‌گیرد و شروع به تأمین نیازها می‌کند.

منابع