Modern conference room with a large screen and a
AI

A16z ने Vals AI के लिए $40M सीरीज A का नेतृत्व किया

Vals का कहना है कि इसके Finance Agent v2 परीक्षण से पता चलता है कि फ्रंटियर मॉडल अभी भी वास्तविक विश्लेषक कार्यप्रवाहों के लगभग आधे में असफल होते हैं, और यह बाजार का स्वतंत्र मूल्यांकनकर्ता बनना चाहता है।

Elliot Marsh द्वारा5 मिनट का पठन

Vals AI ने अपने Finance Agent v2 बेंचमार्क के बाद $400 मिलियन के मूल्यांकन पर Andreessen Horowitz द्वारा संचालित $40 मिलियन सीरीज ए जुटाई, जिसने बहु-चरण वित्त विश्लेषक कार्य पर सबसे अच्छे फ्रंटियर मॉडल को 52% सटीकता पर रखा। पिच यह है कि "AI तैयार है" कथन अब मॉडल रिलीज़ द्वारा कम और यह कि कोई वास्तविक कार्यप्रवाह की सहीता को तेजी से माप सकता है, इस पर अधिक निर्भर करते हैं।

A16z ने Vals का समर्थन किया क्योंकि Finance-Agent बेंचमार्क ने फ्रंटियर मॉडलों को 52% सटीकता पर रखा।

Vals AI ने 13 अगस्त, 2026 को $400 मिलियन के मूल्यांकन पर $40 मिलियन सीरीज ए बंद की, जिसका नेतृत्व Andreessen Horowitz (a16z) ने किया। लौटने वाले निवेशकों 8VC, Pear VC, और Bloomberg Beta ने फिर से भाग लिया, जबकि HRT Ventures और Next Ladder Ventures नए समर्थकों के रूप में शामिल हुए।

यह दौर एक मॉडल दांव के बजाय बुनियादी ढांचे के रूप में बेचा जा रहा है। Vals के Finance Agent v2 बेंचमार्क ने मई 2026 में 52% सटीकता का शीर्ष स्कोर दर्ज किया, जिसका मतलब है कि सबसे अच्छा उपलब्ध सिस्टम लगभग आधे बहु-चरण कार्यों को सही तरीके से पूरा करने में विफल रहा, जिन्हें एक पेशेवर वित्त विश्लेषक से संभालने की उम्मीद की जाती है।

यांत्रिक रूप से, Finance Agent v2 एक बहुविकल्पीय परीक्षा नहीं है। यह परीक्षण करता है कि क्या एक एजेंट एक कार्यप्रवाह को अंत से अंत तक चला सकता है, जिसमें सहायक डेटा को पुनः प्राप्त करना, बिना आंकड़े गढ़े उसे संश्लेषित करना, और चरणों के बीच तर्क को जोड़ना शामिल है। Vals द्वारा सूचीबद्ध कार्यों में समकक्ष मूल्य मॉडल बनाना, क्षेत्र के उत्प्रेरकों का संश्लेषण करना, और वास्तविक दस्तावेज़ डेटा पर आधारित निवेश सिफारिशें उत्पन्न करना शामिल है।

Vals ने फंडिंग को ट्रैक्शन मैट्रिक्स के साथ जोड़ा: 2025 में आठ गुना राजस्व वृद्धि, ग्राहक संख्या का दोगुना होना, और पिछले छह महीनों में टीम का तीन गुना होना। उसने यह भी कहा कि उसके मूल्यांकन को मॉडल कार्ड में उद्धृत किया गया है, जो आधिकारिक मूल्यांकन प्रकटीकरण हैं जो प्रयोगशालाएँ प्रकाशित करती हैं, OpenAI, Anthropic, Google, Meta, और xAI से।

लीडरबोर्ड से कार्यप्रवाह की सहीता तक: क्यों Vals का मानना है कि सार्वजनिक बेंचमार्क भ्रामक हैं।

Vals का मुख्य दावा है कि सार्वजनिक लीडरबोर्ड बढ़ती हुई गलत चीज़ को माप रहे हैं, या इसे माप रहे हैं जब बाजार पहले ही इसे गेम करना सीख चुका है। वह विफलता के तरीके बेंचमार्क संतृप्ति की ओर इशारा करते हैं, जहां शीर्ष मॉडल एक परीक्षण पर सांख्यिकीय रूप से भेदभाव रहित हो जाते हैं, और बेंचमार्क संदूषण, जहां परीक्षण प्रश्न प्रशिक्षण डेटा में लीक हो जाते हैं और स्कोर कोinflate करते हैं।

कंपनी का तर्क फरवरी 2026 पर आधारित है।ETHज्यूरिख और स्टैनफोर्ड का प्रीप्रिंट जिसने 60 व्यापक रूप से उपयोग किए जाने वाले बड़े भाषा मॉडल बेंचमार्क का विश्लेषण किया और पाया कि 60 में से 29 संतृप्त थे, जिसमें शीर्ष बनाम दूसरे सर्वश्रेष्ठ के बीच के अंतर मापने की शोर में थे। वही प्रीप्रिंट एक कम आरामदायक निष्कर्ष के लिए संदर्भित किया गया है: निजी परीक्षण सेट प्रणालीगत रूप से संतृप्ति को रोकते नहीं हैं जब एक बेंचमार्क के वितरणात्मक विशेषताएँ व्यापक रूप से ज्ञात होती हैं।

Vals का उत्पाद प्रतिक्रिया जीवनचक्र प्रबंधन है। यह बेंचमार्क को "नाशवान" के रूप में मानता है और जब वे मॉडल को अलग करने में असफल होते हैं तो उन्हें सेवानिवृत्त कर देता है। मई 2026 में, इसने अपने CorpFin बेंचमार्क को एक Excel परीक्षण के साथ बदल दिया जब CorpFin ने सीमांत मॉडल के बीच पर्याप्त अलगाव प्रदान करना बंद कर दिया।

यहां Vals प्राथमिकता-मत नेता बोर्ड के खिलाफ एक रेखा खींचता है। एरेना (पूर्व में LMArena) लाखों मानव प्राथमिकता मतों को एकत्र करता है ताकि उत्तर दिया जा सके, "कौन सा मॉडल उपयोगकर्ताओं को चैट में पसंद है?" Vals स्पष्ट रूप से एक अलग प्रश्न का उत्तर देने की कोशिश कर रहा है: "कौन सा मॉडल पेशेवर मानकों पर निवेश अनुसंधान को सही ढंग से पूरा करता है?"

ये अलग-अलग आर्किटेक्चर हैं, और जब आप उन्हें वित्त कार्यप्रवाह के अंदर कार्यान्वित करने की कोशिश करते हैं तो वे अलग-अलग तरीके से विफल होते हैं।

उठाने के साथ, Vals ने तीन उत्पाद लॉन्च किए जो इसके दायरे को वित्त और कोडिंग बिंदु परीक्षणों से परे विस्तारित करते हैं: Vals Smith (कस्टम कोडिंग बेंचमार्क जो एंटरप्राइज GitHub रिपॉजिटरी से बनाए गए हैं), एक सीमांत-जोखिम बेंचमार्क सूट (साइबर सुरक्षा, मानसिक स्वास्थ्य, AI सुरक्षा), और एक विस्तारित Vals Index 2.0 जिसमें व्यापक आर्थिक कवरेज है। Vals Smith का पिच परीक्षण के बीच का अंतर है "क्या यह मॉडल Python लिख सकता है?" और "क्या यह मॉडल हमारा Python लिख सकता है?" उन फर्मों के लिए जिनके पास स्वामित्व कोडबेस हैं।

संकेत व्यापारी ट्रैक कर सकते हैं: बेंचमार्क टर्नओवर, उत्पाद अपनाना, और 52% मॉडल कौन था।

सबसे बाजार-संबंधित गायब विवरण बुनियादी है: Vals यह नहीं बताता कि कौन सा विशिष्ट सीमांत मॉडल ने मई 2026 में Finance Agent v2 पर 52% स्कोर किया। जब तक वह मानचित्रण सार्वजनिक नहीं होता, तब तक यह डेटा बिंदु श्रेणी पर एक छत के रूप में अधिक उपयोगी है न कि किसी एक प्रयोगशाला के रिलीज़ कैडेंस के लिए एक साफ़ पढ़ने के रूप में।

अगला संकेत यह है कि क्या वह छत बाद के मॉडल लॉन्च के साथ चलती है, या यह चिपचिपी रहती है क्योंकि बाधा कार्यप्रवाह की विश्वसनीयता है न कि कच्ची क्षमता। यदि Vals मॉडल एक्सेस प्राप्त करने के "घंटों के भीतर" परिणामों को वापस लाने में सक्षम हो सकता है, तो बेंचमार्क रिलीज़ प्रचार पर एक निकट-वास्तविक समय की जांच बन जाता है।

उत्पाद पक्ष पर, Vals Smith अपनाना इस बात का सबसे साफ़ प्रॉक्सी है कि क्या उद्यम माप के लिए बजट बना रहे हैं। निजी GitHub रिपॉजिटरी से बनाए गए कस्टम बेंचमार्क यह संकेत देते हैं कि खरीदार डेमो-स्टेज से आगे बढ़ चुका है और अधिग्रहण अनुशासन में है।

अंत में, Vals Index 2.0 कवरेज परिवर्तनों और बेंचमार्क सेवानिवृत्तियों या प्रतिस्थापनों पर नज़र रखें जो CorpFin से Excel स्वैप के समान हैं। तेज़ टर्नओवर एक संकेत है कि परीक्षण तेजी से संतृप्त हो रहे हैं, और कि "स्कोरकीपर" विश्वसनीयता लगातार परीक्षा को फिर से बनाने पर निर्भर करती है।

मेरी पढ़ाई: व्यापार यह नहीं है कि 'AI स्मार्ट है'—यह है कि 'माप बाधा बन जाता है'

यहाँ जो थ्रेशोल्ड महत्वपूर्ण है, वह यह नहीं है कि क्या एक मॉडल एक सार्वजनिक लीडरबोर्ड को शीर्ष पर रख सकता है, बल्कि यह है कि क्या यह पेशेवर कार्यप्रवाहों को ऐसे त्रुटि दरों के साथ पार कर सकता है जो उत्पादन में जीवित रहने के लिए पर्याप्त कम हैं। वित्त एजेंट v2 पर 52% सटीकता की छत निकट-अवधि के "स्वायत्त वित्त एजेंट" कथनों पर एक कुंद बाधा है, क्योंकि इसका अर्थ है कि सबसे अच्छा प्रणाली अभी भी अक्सर गलत है, जिससे मानव नियंत्रण लूप की आवश्यकता होती है।

यदि Vals मॉडल कार्ड में उद्धृत होते रहते हैं जबकि उसी पारिस्थितिकी तंत्र को भुगतान किए गए मूल्यांकन भी बेचते हैं, तो असली परीक्षण यह है कि क्या इसके प्रोत्साहन खरीदारों के साथ संरेखित रहते हैं न कि विक्रेताओं के साथ। यदि वह स्वतंत्रता बनी रहती है और बेंचमार्क टर्नओवर उच्च रहता है, तो माप वह गेटिंग लेयर बन जाती है जो तय करती है कि कौन से मॉडल तैनात किए जाते हैं, और यही वह व्यावहारिक बिंदु है जहाँ श्रेणी कथानक-प्रेरित होना बंद कर देती है और खरीद-प्रेरित होना शुरू कर देती है।

स्रोत