
A16z, Vals AI'nin 40M$ Seri A Turu'na Öncülük Etti
Vals, Finance Agent v2 testinin, öncü modellerin hâlâ gerçek analist iş akışlarının yaklaşık yarısını başaramadığını gösterdiğini ve pazarın bağımsız değerlendiricisi olmak istediğini belirtiyor.
Vals AI, Finance Agent v2 kıyaslamasının çok adımlı finans analisti işinde en iyi sınır modelini %52 doğrulukla belirlemesinin ardından, 400 milyon dolarlık bir değerleme ile Andreessen Horowitz liderliğinde 40 milyon dolarlık A Serisi yatırım aldı. Sunum, 'Yapay zeka hazır' anlatılarının artık model yayınlarıyla değil, gerçek iş akışı doğruluğunu hızlı bir şekilde ölçebilen biri olup olmadığıyla daha fazla kısıtlandığıdır.
A16z, Vals'ı destekliyor çünkü Finans-Ajan Kıyaslamaları Sınır Modellerini %52 Doğrulukta Belirliyor
Vals AI, 13 Ağustos 2026'da Andreessen Horowitz (a16z) liderliğinde 400 milyon dolarlık bir değerleme ile 40 milyon dolarlık A Serisi yatırımı kapattı. Önceki yatırımcılar 8VC, Pear VC ve Bloomberg Beta tekrar katıldı, HRT Ventures ve Next Ladder Ventures ise yeni destekçiler olarak katıldı.
Bu tur, bir model bahsi değil, altyapı olarak satılıyor. Vals’in Finance Agent v2 kıyaslaması Mayıs 2026'da %52 doğrulukla en yüksek puanı kaydetti, bu da mevcut en iyi sistemin bir profesyonel finans analistinin üstlenmesi beklenen çok adımlı görevlerin yaklaşık yarısını doğru bir şekilde tamamlayamadığı anlamına geliyor.
Mekanik olarak, Finance Agent v2 çoktan seçmeli bir sınav değildir. Bir ajanın, destekleyici verileri almayı, rakamları hayal etmeden sentezlemeyi ve adımlar arasında mantık zinciri kurmayı da içeren bir iş akışını baştan sona yürütebilir mi olduğunu test eder. Vals’in listelediği görevler, eşit değer modelleri oluşturmayı, sektör katalizörlerini sentezlemeyi ve gerçek belge verilerine dayanan yatırım önerileri üretmeyi içerir.
Vals, finansmanını çekiş metrikleriyle birleştirdi: 2025'te sekiz kat gelir artışı, müşteri sayısının iki katına çıkması ve ekip sayısının son altı ayda üç katına çıkması. Ayrıca, değerlendirmelerinin OpenAI, Anthropic, Google, Meta ve xAI tarafından yayınlanan model kartlarında alıntılandığını belirtti.
Sıralamalardan İş Akışı Doğruluğuna: Vals Neden Kamu Kıyaslamalarının Yanıltıcı Olduğunu Düşünüyor
Vals’in temel iddiası, kamu sıralamalarının giderek yanlış bir şeyi ölçtüğü veya pazarın bunu nasıl manipüle edeceğini öğrendikten sonra ölçtüğüdür. İşaret ettiği başarısızlık modları, en iyi modellerin bir testte istatistiksel olarak ayırt edilemez hale geldiği kıyaslama doygunluğu ve test sorularının eğitim verilerine sızarak puanları şişirdiği kıyaslama kontaminasyonudur.
Şirketin argümanı, Şubat 2026'ya dayanıyor.ETHZürih ve Stanford'dan, 60 yaygın olarak kullanılan büyük dil modeli kıyaslamasını analiz eden bir ön baskı, 60'tan 29'unun doygun olduğunu ve en iyi ile ikinci en iyi arasındaki farkların ölçüm gürültüsü içinde olduğunu buldu.
Aynı ön baskı, değerlendiriciler için daha az rahat bir sonuca atıfta bulunuyor: özel test setleri, bir kıyaslamanın dağılımsal özellikleri geniş ölçüde bilindiğinde doygunluğu sistematik olarak önlemiyor.
Vals'ın ürün yanıtı yaşam döngüsü yönetimidir. Kıyaslamaları "bozulabilir" olarak ele alır ve modelleri ayırt etmeyi bıraktıklarında emekliye ayırır. Mayıs 2026'da, CorpFin'in sınır modelleri arasında yeterli ayrım sağlamayı bıraktığında, CorpFin kıyaslamasını bir Excel testi ile değiştirdi.
Vals'ın tercih oyu liderlik tablolarına karşı bir sınır çizdiği yer burasıdır. Arena (eski adıyla LMArena), "Kullanıcılar hangi modeli tercih ediyor?" sorusuna yanıt vermek için milyonlarca insan tercih oyu toplar. Vals, farklı bir soruya yanıt vermeye açıkça çalışıyor: "Hangi model profesyonel standartlarda yatırım araştırmasını doğru bir şekilde tamamlıyor?"
Bunlar farklı mimarilerdir ve bir finans iş akışında operasyonelleştirmeye çalıştığınızda farklı şekilde başarısız olurlar.
Yükselişin yanı sıra, Vals, kapsamını finans ve kodlama nokta testlerinin ötesine genişleten üç ürün başlattı: Vals Smith (kurumsal GitHub depolarından oluşturulan özel kodlama kıyaslamaları), bir sınır-risk kıyaslama seti (siber güvenlik, zihinsel sağlık, AI güvenliği) ve daha geniş ekonomik kapsama sahip genişletilmiş Vals Index 2.0. Vals Smith'in sunumu, "bu model Python yazabilir mi?" ile "bu model bizim Python'umuzu yazabilir mi?" arasındaki farktır, özel kod tabanına sahip firmalar için.
Tüccarların İzleyebileceği Sinyaller: Kıyaslama Değişimi, Ürün Benimseme ve %52 Modelin Kim Olduğu
Pazar açısından en önemli eksik detay basittir: Vals, Mayıs 2026'da Finance Agent v2'de %52 puan alan hangi spesifik sınır modelini adlandırmıyor. O haritalama kamuya açık olana kadar, veri noktası, bir laboratuvarın yayın temposuna temiz bir geçişten ziyade kategori üzerindeki bir tavan olarak daha faydalıdır.
Bir sonraki sinyal, bu tavanın sonraki model lansmanlarıyla hareket edip etmediği veya darboğazın ham yetenekten ziyade iş akışı güvenilirliği olduğu için yapışkan kalıp kalmadığıdır. Vals, model erişimini aldıktan sonra sonuçları "saatler içinde" döndürmeye devam edebilirse, kıyaslama, yayın heyecanı üzerinde neredeyse gerçek zamanlı bir kontrol haline gelir.
Ürün tarafında, Vals Smith benimsemesi, işletmelerin ölçüm için bir bütçe kalemi ayırıp ayırmadığının en temiz göstergesidir. Özel GitHub depolarından oluşturulan özel kıyaslamalar, bir alıcının demo aşamasını geçtiğini ve tedarik disiplinine girdiğini ima eder.
Son olarak, Vals Index 2.0 kapsamındaki değişiklikleri ve CorpFin'den Excel'e geçişe benzer kıyaslama emekliliklerini veya değişimlerini izleyin. Hızlı değişim, testlerin hızla doygun hale geldiğinin bir işaretidir ve "puan tutucu" güvenilirliği, sınavı sürekli yeniden inşa etmeye bağlıdır.
Benim Okumam: Ticaret 'AI Akıllıdır' Değil - 'Ölçüm Darboğaz Olur'
Burada önemli olan eşik, bir modelin kamu liderlik tablosunu geçip geçememesi değil, profesyonel iş akışlarını yeterince düşük hata oranlarıyla geçip geçememesidir. Finance Agent v2'deki %52 doğruluk tavanı, yakın vadeli "otonom finans ajanı" anlatıları üzerinde sert bir kısıtlamadır, çünkü bu, en iyi sistemin hala insan kontrol döngüsü gerektirecek kadar sık yanlış olduğunu ima eder.
Eğer Vals, model kartlarında alıntı yapılmaya devam ederken aynı ekosisteme ücretli değerlendirmeler de satıyorsa, gerçek test, teşviklerinin satıcılardan ziyade alıcılarla uyumlu kalıp kalmadığıdır. Eğer bu bağımsızlık devam ederse ve kıyaslama cirosu yüksek kalırsa, ölçüm, hangi modellerin dağıtılacağına karar veren engelleyici katman haline gelir ve bu, kategorinin anlatı odaklı olmaktan çıkıp tedarik odaklı hale geldiği pratik noktadır.