
DeepSeek lanza V4 Flash a $0.28, Opus 4.8 a $25
El movimiento de precios cercano a la frontera llega días después de que OpenAI redujera los precios de salida de GPT-5.6 Luna en un 80% tres semanas después de su lanzamiento.
DeepSeek lanzó V4 Flash, un modelo enfocado en la codificación que posicionó cerca del Claude Opus 4.8 de Anthropic en tareas complejas de codificación y software autónomo, mientras que el precio de salida es de aproximadamente $0.28 frente a $25 por una salida comparable del Opus 4.8.
El lanzamiento intensifica una guerra de precios de API de IA a finales de julio que está comprimiendo los márgenes de los proveedores de modelos y desplazando el valor hacia las capas de enrutamiento y distribución.
DeepSeek V4 Flash llega con un shock de precio del 99%
El nuevo V4 Flash de DeepSeek es un modelo enfocado en la codificación publicado como “DeepSeek-V4-Flash-0731” y comercializado como que rinde cerca del Claude Opus 4.8 de Anthropic en tareas complejas de codificación y software autónomo. El mecanismo es simple y brutal: DeepSeek está tratando de restablecer el precio de referencia para la generación de código de alta gama haciendo que el ítem de salida casi desaparezca.
La propia comparación de DeepSeek puso la brecha en dólares claros. Dijo que cobra alrededor de $0.28 por la misma cantidad de salida que cuesta $25 en Claude Opus 4.8, enmarcándolo como un descuento del 99%.
La señal de rendimiento temprano a la que se apunta es la tabla de clasificación de codificación de front-end crowdsourced de Arena.ai, donde se citó a V4 Flash como debutando por delante de Opus 4.8 mientras entregaba el mejor rendimiento por su precio en su clase. Eso es direccionalmente útil para los traders porque refleja la preferencia de los usuarios en tiempo real, pero no es un punto de referencia controlado.
El material extraído no incluye detalles de metodología o puntuaciones numéricas, y el lenguaje de precios “aproximadamente” puede ocultar supuestos de contabilidad de tokens y niveles.
Una instantánea de precios separada en el mismo paquete, fechada el 31 de julio de 2026, puso los precios de salida por 1 millón de tokens en $0.28 para DeepSeek V4 Flash en el extremo bajo y $30 para GPT-5.6Solen el extremo alto. Los tokens son los fragmentos de texto que los modelos leen y generan, y la mayoría de lasAPIscobran por 1 millón de tokens de entrada o salida.
Los recortes de finales de julio convierten la producción del modelo en una mercancía
Este lanzamiento está aterrizando en un mercado que está reajustando precios más rápido de lo que los ciclos del modelo pueden justificar normalmente. OpenAI redujo el precio de salida de GPT-5.6 Luna en un 80% un jueves mencionado en la misma línea de tiempo, solo tres semanas después del lanzamiento de Luna. En la instantánea del 31 de julio, se mostró que Luna caía de $6 antes del recorte a $1.20 después.
El resto de la cinta de finales de julio se lee como un giro coordinado hacia la eficiencia. Google lanzó tres nuevos modelos “flash” de Gemini enfocados en la eficiencia. SpaceXAI lanzó Grok 4.5 al mismo precio que OpenAI cobraba originalmente por Luna antes del recorte de la semana.
Meta también “revirtió silenciosamente” su curso sobre pesos abiertos, alejándose de la liberación de parámetros del modelo que otros pueden ejecutar o ajustar, describiendo a Muse Spark 1.1 como un modelo de código cerrado con un precio agresivo para desarrolladores.
La consecuencia económica es el apalancamiento del comprador. Cuando las brechas de rendimiento se comprimen y las cargas de trabajo de codificación pueden ser probadas A/B rápidamente, los costos de cambio disminuyen y la adquisición comienza a parecerse a un problema de optimización de $/token en lugar de una decisión de “elige tu laboratorio”.
Zack Kass, exjefe de comercialización de OpenAI, describió la dinámica como “rendimientos decrecientes del modelo”, añadiendo: “En algún momento, el siguiente modelo no te importa”, que es básicamente la explicación del lado de la demanda de por qué los recortes de precios ahora están haciendo el trabajo que solían hacer los lanzamientos.
Anthropic es el más claro resistente en este marco, manteniendo los modelos Claude de primer nivel a precios premium y apostando a que los desarrolladores pagarán más por seguridad y precisión. Esa postura se convierte en un segmento premium duradero, o se convierte en la última impresión de alto precio antes de un reajuste forzado si los desarrolladores siguen migrando a pares cercanos.
Señales que los traders pueden rastrear: Resistencia premium, apuestas de volumen y la capa de enrutador
La primera verificación a corto plazo es si las afirmaciones de codificación de V4 Flash de “casi Opus 4.8” se corroboran más allá de la tabla de clasificación citada de Arena.ai en las próximas 1–2 semanas. Si las evaluaciones de terceros convergen, el movimiento de precios deja de ser una maniobra y comienza a parecer un nuevo punto de referencia para la producción de codificación de alta gama.
La segunda es si Anthropic responde sobre la estructura de precios en lugar de marketing. El mercado ahora está mirando la comparación de $0.28 de DeepSeek frente a $25, y la decisión es binaria en la práctica: mantener precios premium, o introducir un nivel de precios más bajo que ceda el carril de mercancía.
La tercera es si OpenAI sigue comprimiendo la banda después del recorte del 80% de Luna. La instantánea del 31 de julio ya abarca de $0.28 a $30 por 1 millón de tokens de salida, y otra ronda de recortes señalaría que la defensa de la participación se ha vuelto más importante que proteger el margen por token.
La cuarta es la adopción de “enrutadores inteligentes”, software que dirige cada solicitud al mejor modelo para el trabajo según capacidad, velocidad y precio.
El vicepresidente de Qualcomm, Vinesh Sukumar, argumentó que esto podría convertirse en una capa lucrativa, y la implicación del mercado es sencilla: si el enrutamiento se convierte en predeterminado, el poder de precios de laboratorio único se erosiona porque el comprador ya no tiene que comprometerse con un proveedor.
Mi opinión: La lucha se está trasladando de 'mejor modelo' a 'mejor distribución'
La parte que importa aquí no es si V4 Flash es realmente 'mejor' que Opus 4.8 en alguna escala absoluta. Se trata de si está lo suficientemente cerca como para que los desarrolladores puedan tratar la salida de código como intercambiable y enrutarse por precio, porque el marco de $0.28 de DeepSeek frente a $25 es un intento de anclar ese comportamiento.
La verdadera prueba es si el volumen puede superar la compresión de márgenes. Sam Altman ya ha puesto la tesis de volumen sobre márgenes en el registro, diciendo: 'Tendremos tanto uso de nuestros modelos que no necesitamos ser un negocio de márgenes gigantescos para poder costear el entrenamiento de modelos', y eso solo funciona si la distribución y el enrutamiento mantienen la demanda pegajosa a medida que los precios caen.
Si los enrutadores y los mercados se convierten en la interfaz de compra predeterminada, los ganadores se parecen menos a los laboratorios de 'mejor modelo' y más a quienes controlan el flujo de solicitudes.