
A16z lidera ronda de $40M en Vals AI tras 52% de precisión
Vals dice que su prueba de Finance Agent v2 muestra que los modelos de frontera aún fallan en aproximadamente la mitad de los flujos de trabajo reales de analistas, y quiere ser el evaluador independiente del mercado.
Vals AI recaudó 40 millones de dólares en una Serie A liderada por Andreessen Horowitz con una valoración de 400 millones de dólares después de que su referencia Finance Agent v2 colocara el mejor modelo de frontera en un 52% de precisión en el trabajo de análisis financiero de múltiples pasos.
La propuesta es que las narrativas de "la IA está lista" ahora están menos condicionadas por el lanzamiento de modelos y más por si alguien puede medir la corrección del flujo de trabajo real lo suficientemente rápido como para mantenerse al día.
A16z respalda a Vals mientras las referencias de Finance-Agent colocan modelos de frontera en un 52% de precisión
Vals AI cerró una Serie A de 40 millones de dólares con una valoración de 400 millones de dólares el 13 de agosto de 2026, liderada por Andreessen Horowitz (a16z). Los inversores que regresan 8VC, Pear VC y Bloomberg Beta participaron nuevamente, con HRT Ventures y Next Ladder Ventures uniéndose como nuevos patrocinadores.
La ronda se está vendiendo como infraestructura, no como una apuesta por un modelo. La referencia Finance Agent v2 de Vals registró una puntuación máxima del 52% de precisión en mayo de 2026, lo que significa que el mejor sistema disponible no logró completar correctamente aproximadamente la mitad de las tareas de múltiples pasos que se esperaría que manejara un analista financiero profesional.
Mecánicamente, Finance Agent v2 no es un examen de opción múltiple. Prueba si un agente puede ejecutar un flujo de trabajo de principio a fin, incluyendo la recuperación de datos de apoyo, sintetizándolos sin alucinar cifras, y encadenando razonamientos a través de los pasos.
Las tareas que Vals enumera incluyen construir modelos de valor relativo entre empresas pares, sintetizar catalizadores sectoriales y generar recomendaciones de inversión basadas en datos de documentos reales.
Vals emparejó la financiación con métricas de tracción: crecimiento de ingresos ocho veces en 2025, duplicación del número de clientes y triplicación del equipo en los últimos seis meses. También dijo que sus evaluaciones han sido citadas en tarjetas de modelos, las divulgaciones de evaluación oficiales que publican los laboratorios, de OpenAI, Anthropic, Google, Meta y xAI.
De las tablas de clasificación a la corrección del flujo de trabajo: por qué Vals piensa que las referencias públicas son engañosas
La afirmación central de Vals es que las tablas de clasificación públicas están midiendo cada vez más lo incorrecto, o lo miden después de que el mercado ya ha aprendido a manipularlo.
Los modos de fallo a los que apunta son la saturación de referencias, donde los mejores modelos se vuelven estadísticamente indistinguibles en una prueba, y la contaminación de referencias, donde las preguntas de prueba se filtran en los datos de entrenamiento e inflan las puntuaciones.
El argumento de la empresa se basa en un estudio de febrero de 2026ETHEl preprint de Zúrich y Stanford analizó 60 benchmarks de modelos de lenguaje grande ampliamente utilizados y encontró que 29 de 60 estaban saturados, con diferencias entre el mejor y el segundo mejor dentro del ruido de medición.
El mismo preprint se cita para una conclusión menos cómoda para los evaluadores: los conjuntos de pruebas privados no previenen sistemáticamente la saturación una vez que las características de distribución de un benchmark son ampliamente conocidas.
La respuesta del producto de Vals es la gestión del ciclo de vida. Trata los benchmarks como "perecederos" y los retira cuando dejan de diferenciar modelos. En mayo de 2026, reemplazó su benchmark CorpFin con una prueba de Excel después de que CorpFin dejó de proporcionar suficiente separación entre modelos de frontera.
Aquí es donde Vals traza una línea contra las tablas de clasificación de votos de preferencia. Arena (anteriormente LMArena) recopila millones de votos de preferencia humana para responder: "¿Qué modelo prefieren los usuarios en el chat?" Vals está tratando explícitamente de responder a una pregunta diferente: "¿qué modelo completa la investigación de inversiones correctamente a estándares profesionales?"
Esas son arquitecturas diferentes, y fallan de manera diferente cuando intentas operacionalizarlas dentro de un flujo de trabajo financiero.
Junto con la recaudación, Vals lanzó tres productos que amplían su alcance más allá de las pruebas de puntos de finanzas y codificación: Vals Smith (benchmarks de codificación personalizados construidos a partir de repositorios de GitHub empresariales), un conjunto de benchmarks de riesgo de frontera (ciberseguridad, salud mental, seguridad de IA) y un Vals Index 2.0 ampliado con una cobertura económica más amplia.
La propuesta de Vals Smith es la brecha entre probar "¿puede este modelo escribir Python?" y "¿puede este modelo escribir nuestro Python?" para empresas con bases de código propietarias.
Señales que los traders pueden rastrear: Rotación de benchmarks, adopción de productos y quién fue el modelo del 52%
El detalle más relevante para el mercado que falta es básico: Vals no nombra qué modelo de frontera específico obtuvo 52% en Finance Agent v2 en mayo de 2026. Hasta que ese mapeo sea público, el punto de datos es más útil como un techo para la categoría que como una lectura limpia para el ritmo de lanzamiento de cualquier laboratorio.
La siguiente señal es si ese techo se mueve con los lanzamientos de modelos subsecuentes, o si se mantiene pegajoso porque el cuello de botella es la fiabilidad del flujo de trabajo en lugar de la capacidad bruta. Si Vals puede seguir generando resultados "dentro de unas horas" de obtener acceso al modelo, el benchmark se convierte en un chequeo casi en tiempo real sobre el hype de lanzamiento.
En el lado del producto, la adopción de Vals Smith es el proxy más limpio para saber si las empresas están presupuestando para la medición como un ítem de línea. Los benchmarks personalizados construidos a partir de repositorios privados de GitHub implican que un comprador ha pasado la etapa de demostración y está en la disciplina de adquisición.
Finalmente, observa los cambios en la cobertura de Vals Index 2.0 y las jubilaciones o reemplazos de benchmarks similares al intercambio de CorpFin por Excel. La rápida rotación es un indicativo de que las pruebas se están saturando rápidamente, y que la credibilidad del "contador de puntuaciones" depende de reconstruir continuamente el examen.
Mi lectura: El comercio no es 'La IA es inteligente'—es 'La medición se convierte en el cuello de botella'
El umbral que importa aquí no es si un modelo puede superar una tabla de clasificación pública, sino si puede cumplir con flujos de trabajo profesionales con tasas de error lo suficientemente bajas como para sobrevivir en producción.
Un techo de precisión del 52% en Finance Agent v2 es una restricción contundente para las narrativas de "agente financiero autónomo" a corto plazo, porque implica que el mejor sistema sigue siendo erróneo con suficiente frecuencia como para requerir un bucle de control humano.
Si Vals sigue siendo citado en las tarjetas de modelo mientras también vende evaluaciones pagadas al mismo ecosistema, la verdadera prueba es si sus incentivos permanecen alineados con los compradores en lugar de los vendedores.
Si esa independencia se mantiene y la rotación de referencia sigue siendo alta, la medición se convierte en la capa de control que decide qué modelos se implementan, y ese es el punto práctico donde la categoría deja de estar impulsada por narrativas y comienza a estar impulsada por adquisiciones.