
DeepSeek lança V4 Flash com preço de $0,28 por código
A recente mudança de preços quase na fronteira ocorre dias depois que a OpenAI reduziu os preços de saída do GPT-5.6 Luna em 80% três semanas após o lançamento.
A DeepSeek lançou o V4 Flash, um modelo focado em codificação que posicionou como próximo do Claude Opus 4.8 da Anthropic em tarefas complexas de codificação e software autônomo, enquanto o preço por saída é de cerca de $0,28 em comparação com $25 para saídas comparáveis do Opus 4.8.
O lançamento intensifica uma guerra de preços de API de IA no final de julho que está comprimindo as margens dos provedores de modelos e deslocando valor para camadas de roteamento e distribuição.
DeepSeek V4 Flash Chega Com um Choque de Preço de 99%
O novo V4 Flash da DeepSeek é um modelo focado em codificação publicado como “DeepSeek-V4-Flash-0731” e comercializado como tendo desempenho próximo ao Claude Opus 4.8 da Anthropic em tarefas complexas de codificação e software autônomo. O mecanismo é simples e brutal: a DeepSeek está tentando redefinir o preço de referência para geração de código de alto nível, fazendo com que o item de saída quase desapareça.
A própria comparação da DeepSeek colocou a diferença em dólares claros. Ela afirmou que cobra cerca de $0,28 pela mesma quantidade de saída que custa $25 no Claude Opus 4.8, enquadrando isso como um desconto de 99%.
O sinal de desempenho inicial apontado é o ranking de codificação de front-end crowdsourced da Arena.ai, onde o V4 Flash foi citado como estreando à frente do Opus 4.8 enquanto entregava o melhor desempenho pelo seu preço em sua classe. Isso é direcionalmente útil para os traders porque reflete a preferência do usuário ao vivo, mas não é um benchmark controlado.
O material extraído não inclui detalhes da metodologia ou pontuações numéricas, e a linguagem de preços “cerca de” pode ocultar suposições de contabilidade de tokens e níveis.
Um instantâneo de preços separado no mesmo pacote, datado de 31 de julho de 2026, colocou os preços de saída por 1 milhão de tokens em $0,28 para o DeepSeek V4 Flash na extremidade baixa e $30 para o GPT-5.6 na extremidade alta.Solsão os pedaços de texto que os modelos leem e geram, e a maioria dasAPIscobra por 1 milhão de tokens de entrada ou saída.
Cortes de Fim de Julho Transformam a Produção do Modelo em uma Mercadoria
Este lançamento está aterrissando em um mercado que está reprecificando mais rápido do que os ciclos do modelo normalmente podem justificar. A OpenAI cortou o preço de saída do GPT-5.6 Luna em 80% em uma quinta-feira referenciada na mesma linha do tempo, apenas três semanas após o lançamento do Luna. No instantâneo de 31 de julho, o Luna foi mostrado caindo de $6 antes do corte para $1,20 depois.
O restante da fita de fim de julho lê como uma mudança coordenada em direção à eficiência. O Google lançou três novos modelos “flash” Gemini focados em eficiência. A SpaceXAI lançou o Grok 4.5 pelo mesmo preço que a OpenAI originalmente cobrava pelo Luna antes do corte da semana.
A Meta também “silenciosamente reverteu o curso” em pesos abertos, afastando-se de liberar parâmetros de modelo que outros podem executar ou ajustar, com o Muse Spark 1.1 descrito como um modelo de código fechado com preço agressivo para desenvolvedores.
A consequência econômica é a alavancagem do comprador. Quando as lacunas de desempenho se comprimem e as cargas de trabalho de codificação podem ser testadas A/B rapidamente, os custos de troca caem e a aquisição começa a parecer um problema de otimização $/token em vez de uma decisão de “escolher seu laboratório”.
Zack Kass, ex-chefe de go-to-market da OpenAI, descreveu a dinâmica como “retornos de modelo em diminuição”, acrescentando: “Em algum momento, o próximo modelo não importa para você”, que é basicamente a explicação do lado da demanda para por que os cortes de preço agora estão fazendo o trabalho que os lançamentos costumavam fazer.
A Anthropic é a mais clara resistência nesse enquadramento, mantendo modelos Claude de primeira linha com preços premium e apostando que os desenvolvedores pagarão mais por segurança e precisão. Essa postura ou se torna um segmento premium durável, ou se torna a última impressão de alto preço antes de uma reprecificação forçada se os desenvolvedores continuarem migrando para pares próximos.
Sinais que os Traders Podem Rastrear: Resistências Premium, Apostas em Volume e a Camada de Roteador
A primeira verificação de curto prazo é se as reivindicações de codificação “próximo ao Opus 4.8” do V4 Flash são corroboradas além da tabela de classificação da Arena.ai citada nas próximas 1–2 semanas. Se as avaliações de terceiros convergirem, o movimento de preços deixa de ser um truque e começa a parecer um novo ponto de referência para a produção de codificação de alto nível.
A segunda é se a Anthropic responde sobre a estrutura de preços em vez de marketing. O mercado agora está olhando para a comparação de $0,28 da DeepSeek versus $25, e a decisão é binária na prática: manter preços premium ou introduzir um nível de preço mais baixo que concede a faixa de mercadoria.
A terceira é se a OpenAI continua comprimindo a faixa após o corte de 80% do Luna. O instantâneo de 31 de julho já abrange de $0,28 a $30 por 1 milhão de tokens de saída, e outra rodada de cortes sinalizaria que a defesa de participação se tornou mais importante do que proteger a margem por token.
A quarta é a adoção de “roteadores inteligentes”, software que direciona cada solicitação para o melhor modelo para o trabalho com base em capacidade, velocidade e preço.
O VP da Qualcomm, Vinesh Sukumar, argumentou que isso poderia se tornar uma camada lucrativa, e a implicação de mercado é direta: se o roteamento se tornar padrão, o poder de precificação de laboratório único se erosiona porque o comprador não precisa mais se comprometer com um único fornecedor.
Minha Opinião: A Luta Está Mudando de 'Melhor Modelo' para 'Melhor Distribuição'
A parte que importa aqui não é se o V4 Flash é realmente "melhor" que o Opus 4.8 em alguma escala absoluta. É se ele está próximo o suficiente para que os desenvolvedores possam tratar a saída de codificação como intercambiável e direcionar pelo preço, porque a comparação de $0,28 da DeepSeek com $25 é uma tentativa de ancorar esse comportamento.
O verdadeiro teste é se o volume pode superar a compressão de margem. Sam Altman já colocou a tese de volume sobre margem em registro, dizendo: "Teremos tanto uso de nossos modelos que não precisamos ser um negócio de margem extremamente alta para poder arcar com o treinamento de modelos", e isso só funciona se a distribuição e o roteamento mantiverem a demanda estável à medida que os preços caem.
Se os roteadores e os marketplaces se tornarem a interface de compra padrão, os vencedores parecerão menos com laboratórios de "melhor modelo" e mais com quem controla o fluxo de solicitações.