Modern conference room with a large screen and a
Trí tuệ nhân tạo

A16z dẫn đầu vòng gọi vốn 40 triệu USD cho Vals AI

Vals cho biết thử nghiệm Finance Agent v2 của họ cho thấy các mô hình tiên tiến vẫn thất bại khoảng một nửa quy trình làm việc của các nhà phân tích thực, và họ muốn trở thành người đánh giá độc lập của thị trường.

Bởi Elliot Marsh5 phút đọc

Vals AI đã huy động được 40 triệu đô la trong vòng Series A do Andreessen Horowitz dẫn dắt với định giá 400 triệu đô la sau khi chỉ số chuẩn Finance Agent v2 của nó cho thấy mô hình tiên tiến nhất đạt 52% độ chính xác trong công việc phân tích tài chính nhiều bước.

Lập luận là rằng các câu chuyện "AI đã sẵn sàng" hiện nay ít bị rào cản bởi việc phát hành mô hình hơn và nhiều hơn bởi việc liệu có ai đó có thể đo lường độ chính xác của quy trình làm việc thực tế nhanh chóng đủ để theo kịp hay không.

A16z Hỗ Trợ Vals Khi Các Chỉ Số Chuẩn Tài Chính Đặt Các Mô Hình Tiên Tiến Ở Độ Chính Xác 52%

Vals AI đã hoàn tất vòng Series A trị giá 40 triệu đô la với định giá 400 triệu đô la vào ngày 13 tháng 8 năm 2026, do Andreessen Horowitz (a16z) dẫn dắt. Các nhà đầu tư quay lại 8VC, Pear VC và Bloomberg Beta cũng tham gia lần nữa, với HRT Ventures và Next Ladder Ventures gia nhập như những nhà đầu tư mới.

Vòng gọi vốn này được bán như một cơ sở hạ tầng, không phải là một cược mô hình. Chỉ số chuẩn Finance Agent v2 của Vals ghi nhận điểm số cao nhất là 52% độ chính xác vào tháng 5 năm 2026, có nghĩa là hệ thống tốt nhất hiện có đã không hoàn thành đúng khoảng một nửa các nhiệm vụ nhiều bước mà một nhà phân tích tài chính chuyên nghiệp được kỳ vọng sẽ xử lý.

Về mặt cơ học, Finance Agent v2 không phải là một bài kiểm tra trắc nghiệm. Nó kiểm tra xem một tác nhân có thể chạy một quy trình làm việc từ đầu đến cuối hay không, bao gồm việc truy xuất dữ liệu hỗ trợ, tổng hợp nó mà không bị ảo tưởng về số liệu, và kết nối lý luận qua các bước.

Các nhiệm vụ mà Vals liệt kê bao gồm xây dựng các mô hình giá trị tương đối giữa các công ty cùng ngành, tổng hợp các yếu tố thúc đẩy ngành, và tạo ra các khuyến nghị đầu tư dựa trên dữ liệu tài liệu thực tế.

Vals đã kết hợp nguồn vốn với các chỉ số tăng trưởng: doanh thu tăng gấp tám lần trong năm 2025, số lượng khách hàng tăng gấp đôi, và đội ngũ tăng gấp ba lần trong sáu tháng qua. Nó cũng cho biết các đánh giá của mình đã được trích dẫn trong các thẻ mô hình, các công bố đánh giá chính thức mà các phòng thí nghiệm công bố, từ OpenAI, Anthropic, Google, Meta và xAI.

Từ Bảng Xếp Hạng Đến Độ Chính Xác Quy Trình Làm Việc: Tại Sao Vals Nghĩ Rằng Các Chỉ Số Công Khai Gây Nhầm Lẫn

Lập luận cốt lõi của Vals là các bảng xếp hạng công khai ngày càng đo lường sai điều gì đó, hoặc đo lường nó sau khi thị trường đã học cách khai thác nó. Các chế độ thất bại mà nó chỉ ra là sự bão hòa chỉ số chuẩn, nơi các mô hình hàng đầu trở nên không thể phân biệt thống kê trên một bài kiểm tra, và sự ô nhiễm chỉ số chuẩn, nơi các câu hỏi kiểm tra rò rỉ vào dữ liệu đào tạo và làm tăng điểm số.

Lập luận của công ty dựa trên một nghiên cứu vào tháng 2 năm 2026ETHBản in trước của Zurich và Stanford đã phân tích 60 tiêu chuẩn mô hình ngôn ngữ lớn được sử dụng rộng rãi và phát hiện 29 trong số 60 tiêu chuẩn đã bão hòa, với khoảng cách giữa mô hình tốt nhất và thứ hai nằm trong độ nhiễu đo lường.

Bản in trước này cũng được trích dẫn cho một kết luận không thoải mái hơn cho các nhà đánh giá: các bộ kiểm tra riêng không ngăn chặn hệ thống sự bão hòa khi các đặc điểm phân phối của tiêu chuẩn đã được biết đến rộng rãi.

Phản hồi sản phẩm của Vals là quản lý vòng đời. Nó coi các tiêu chuẩn là "hàng dễ hỏng" và ngừng sử dụng chúng khi chúng không còn phân biệt được các mô hình. Vào tháng 5 năm 2026, nó đã thay thế tiêu chuẩn CorpFin bằng một bài kiểm tra Excel sau khi CorpFin không còn cung cấp đủ sự phân tách giữa các mô hình tiên phong.

Đây cũng là nơi Vals vạch ra ranh giới chống lại các bảng xếp hạng dựa trên phiếu bầu sở thích. Arena (trước đây là LMArena) thu thập hàng triệu phiếu bầu sở thích của con người để trả lời, "Mô hình nào mà người dùng thích trong trò chuyện?" Vals đang cố gắng trả lời một câu hỏi khác: "Mô hình nào hoàn thành nghiên cứu đầu tư một cách chính xác theo tiêu chuẩn chuyên nghiệp?"

Đó là những kiến trúc khác nhau, và chúng thất bại khác nhau khi bạn cố gắng đưa chúng vào quy trình làm việc tài chính.

Cùng với việc huy động vốn, Vals đã ra mắt ba sản phẩm mở rộng phạm vi của mình vượt ra ngoài các bài kiểm tra điểm tài chính và lập trình: Vals Smith (các tiêu chuẩn lập trình tùy chỉnh được xây dựng từ các kho GitHub doanh nghiệp), một bộ tiêu chuẩn rủi ro tiên phong (an ninh mạng, sức khỏe tâm thần, an toàn AI), và một Vals Index 2.0 mở rộng với phạm vi kinh tế rộng hơn.

Đề xuất của Vals Smith là khoảng cách giữa việc kiểm tra "mô hình này có thể viết Python không?" và "mô hình này có thể viết Python của chúng tôi không?" cho các công ty có cơ sở mã độc quyền.

Các tín hiệu mà các nhà giao dịch có thể theo dõi: Doanh thu tiêu chuẩn, Sự chấp nhận sản phẩm, và Mô hình 52% là ai

Chi tiết thiếu sót quan trọng nhất liên quan đến thị trường là cơ bản: Vals không nêu tên mô hình tiên phong cụ thể nào đã ghi được 52% trên Finance Agent v2 vào tháng 5 năm 2026. Cho đến khi bản đồ đó được công khai, điểm dữ liệu này hữu ích hơn như một giới hạn trên của danh mục hơn là một cách đọc sạch cho bất kỳ nhịp phát hành nào của một phòng thí nghiệm.

Tín hiệu tiếp theo là liệu giới hạn đó có di chuyển với các lần ra mắt mô hình tiếp theo hay không, hoặc liệu nó có giữ nguyên vì nút thắt là độ tin cậy của quy trình làm việc chứ không phải khả năng thô. Nếu Vals có thể tiếp tục quay vòng kết quả "trong vòng vài giờ" sau khi có quyền truy cập mô hình, tiêu chuẩn trở thành một kiểm tra gần như thời gian thực về sự cường điệu phát hành.

Về mặt sản phẩm, việc chấp nhận Vals Smith là chỉ số rõ ràng nhất về việc liệu các doanh nghiệp có đang lập ngân sách cho việc đo lường như một mục trong ngân sách hay không. Các tiêu chuẩn tùy chỉnh được xây dựng từ các kho GitHub riêng cho thấy một người mua đã vượt qua giai đoạn demo và vào kỷ luật mua sắm.

Cuối cùng, hãy theo dõi những thay đổi về phạm vi của Vals Index 2.0 và việc ngừng sử dụng hoặc thay thế các tiêu chuẩn tương tự như sự hoán đổi CorpFin sang Excel. Doanh thu nhanh là dấu hiệu cho thấy các bài kiểm tra đang bão hòa nhanh chóng, và độ tin cậy của "người ghi điểm" phụ thuộc vào việc liên tục xây dựng lại kỳ thi.

Đọc của tôi: Giao dịch không phải là 'AI thông minh' - mà là 'Đo lường trở thành nút thắt'

Ngưỡng quan trọng ở đây không phải là liệu một mô hình có thể đứng đầu bảng xếp hạng công khai hay không, mà là liệu nó có thể vượt qua các quy trình làm việc chuyên nghiệp với tỷ lệ lỗi đủ thấp để tồn tại trong sản xuất.

Một ngưỡng độ chính xác 52% trên Finance Agent v2 là một rào cản thô cho các câu chuyện về "đại lý tài chính tự động" trong ngắn hạn, vì nó ngụ ý rằng hệ thống tốt nhất vẫn thường xuyên sai đủ để cần một vòng kiểm soát của con người.

Nếu Vals tiếp tục được trích dẫn trong các thẻ mô hình trong khi cũng bán các đánh giá trả phí cho cùng một hệ sinh thái, bài kiểm tra thực sự là liệu các động lực của nó có giữ được sự phù hợp với người mua thay vì nhà cung cấp hay không.

Nếu sự độc lập đó giữ vững và doanh thu chuẩn vẫn cao, việc đo lường trở thành lớp ngăn chặn quyết định mô hình nào được triển khai, và đó là điểm thực tiễn mà danh mục này ngừng bị thúc đẩy bởi câu chuyện và bắt đầu bị thúc đẩy bởi việc mua sắm.

Nguồn