A glowing computer screen displaying a lightning
IA

DeepSeek lance V4 Flash : codage à 0,28 $ contre 25 $ sur…

Le mouvement de tarification proche de la frontière intervient quelques jours après qu'OpenAI ait réduit les prix de sortie de GPT-5.6 Luna de 80 % trois semaines après son lancement.

Par Elliot Marsh5 min de lecture

DeepSeek a lancé V4 Flash, un modèle axé sur le codage qu'il a positionné près de Claude Opus 4.8 d'Anthropic pour les tâches de codage complexe et de logiciels autonomes, tout en fixant le prix de sortie à environ 0,28 $ contre 25 $ pour une sortie comparable d'Opus 4.8.

Ce lancement intensifie une guerre des prix sur les API d'IA de fin juillet qui comprime les marges des fournisseurs de modèles et déplace la valeur vers les couches de routage et de distribution.

DeepSeek V4 Flash arrive avec un choc de prix de 99%

Le nouveau V4 Flash de DeepSeek est un modèle axé sur le codage publié sous le nom de "DeepSeek-V4-Flash-0731" et commercialisé comme ayant des performances proches de celles de Claude Opus 4.8 d'Anthropic pour les tâches de codage complexe et de logiciels autonomes. Le mécanisme est simple et brutal : DeepSeek essaie de réinitialiser le prix de référence pour la génération de code haut de gamme en faisant presque disparaître l'élément de sortie.

La propre comparaison de DeepSeek a mis l'écart en dollars clairs. Il a déclaré qu'il facturait environ 0,28 $ pour la même quantité de sortie qui coûte 25 $ sur Claude Opus 4.8, le présentant comme une remise de 99%.

Le signal de performance précoce auquel on fait référence est le tableau de classement de codage front-end crowdsourcé d'Arena.ai, où V4 Flash a été cité comme faisant ses débuts devant Opus 4.8 tout en offrant la meilleure performance pour son prix dans sa catégorie. Cela est utile pour les traders car cela reflète la préférence des utilisateurs en temps réel, mais ce n'est pas un benchmark contrôlé.

Le matériel extrait n'inclut pas de détails méthodologiques ou de scores numériques, et le langage de prix "environ" peut cacher des hypothèses de comptabilité de jetons et de niveaux.

Un instantané de prix séparé dans le même package, daté du 31 juillet 2026, a fixé les prix de sortie par 1 million de jetons à 0,28 $ pour DeepSeek V4 Flash à l'extrémité inférieure et 30 $ pour GPT-5.6Sol à l'extrémité supérieure. Les jetons sont les morceaux de texte que les modèles lisent et génèrent, et la plupart des APIs facturent par 1 million de jetons d'entrée ou de sortie.

Les réductions de fin juillet transforment la sortie des modèles en une marchandise

Ce lancement arrive sur un marché qui se réévalue plus rapidement que les cycles de modèles ne peuvent normalement le justifier. OpenAI a réduit le prix de sortie de GPT-5.6 Luna de 80 % un jeudi mentionné dans la même chronologie, seulement trois semaines après le lancement de Luna. Dans l'instantané du 31 juillet, Luna est tombée de 6 $ avant la réduction à 1,20 $ après.

Le reste de l'enregistrement de fin juillet se lit comme un pivot coordonné vers l'efficacité. Google a publié trois nouveaux modèles « flash » Gemini axés sur l'efficacité. SpaceXAI a lancé Grok 4.5 au même prix qu'OpenAI facturait à l'origine pour Luna avant la réduction de la semaine.

Meta a également « discrètement inversé son cap » sur les poids ouverts, s'éloignant de la publication des paramètres de modèle que d'autres peuvent exécuter ou affiner, avec Muse Spark 1.1 décrit comme un modèle à code source fermé, tarifé de manière agressive pour les développeurs.

La conséquence économique est le levier des acheteurs. Lorsque les écarts de performance se compressent et que les charges de codage peuvent être testées A/B rapidement, les coûts de changement diminuent et l'approvisionnement commence à ressembler à un problème d'optimisation $/token plutôt qu'à une décision de « choisir votre laboratoire ».

Zack Kass, ancien responsable de la mise sur le marché d'OpenAI, a décrit la dynamique comme des « rendements décroissants des modèles », ajoutant : « À un certain moment, le prochain modèle ne vous importe plus », ce qui est essentiellement l'explication du côté de la demande pour laquelle les réductions de prix font maintenant le travail que les sorties faisaient auparavant.

Anthropic est le plus clair des réfractaires dans ce cadre, maintenant les modèles Claude de premier ordre à des prix premium et pariant que les développeurs paieront plus pour la sécurité et la précision. Cette position devient soit un segment premium durable, soit elle devient la dernière impression à prix élevé avant une réévaluation forcée si les développeurs continuent de migrer vers des pairs proches.

Signaux que les traders peuvent suivre : Réfractaires premium, paris sur le volume, et la couche de routeur

La première vérification à court terme est de savoir si les revendications de codage « près d'Opus 4.8 » de V4 Flash sont corroborées au-delà du classement Arena.ai cité au cours des 1 à 2 prochaines semaines. Si les évaluations tierces convergent, le mouvement de prix cesse d'être une opération de marketing et commence à ressembler à un nouveau point de référence pour la sortie de codage haut de gamme.

La deuxième est de savoir si Anthropic répond sur la structure des prix plutôt que sur le marketing. Le marché regarde maintenant la comparaison de 0,28 $ de DeepSeek contre 25 $, et la décision est binaire en pratique : maintenir des prix premium, ou introduire un niveau de prix inférieur qui cède la voie de la marchandise.

La troisième est de savoir si OpenAI continue de comprimer la bande après la réduction de 80 % de Luna. L'instantané du 31 juillet couvre déjà de 0,28 $ à 30 $ par 1 million de tokens de sortie, et un autre tour de réductions signalerait que la défense des parts est devenue plus importante que la protection de la marge par token.

La quatrième est l'adoption de « routeurs intelligents », un logiciel qui achemine chaque demande vers le meilleur modèle pour le travail en fonction de la capacité, de la vitesse et du prix.

Vinesh Sukumar, vice-président de Qualcomm, a soutenu que cela pourrait devenir une couche lucrative, et l'implication pour le marché est simple : si le routage devient par défaut, le pouvoir de tarification d'un laboratoire unique s'érode car l'acheteur n'a plus à s'engager auprès d'un seul fournisseur.

Mon avis : La lutte passe de « Meilleur modèle » à « Meilleure distribution »

La partie qui compte ici n'est pas de savoir si V4 Flash est vraiment « meilleur » qu'Opus 4.8 sur une échelle absolue. Il s'agit de savoir s'il est suffisamment proche pour que les développeurs puissent considérer la sortie de code comme interchangeable et se baser sur le prix, car le cadre de 0,28 $ de DeepSeek contre 25 $ est une tentative d'ancrer ce comportement.

Le véritable test est de savoir si le volume peut dépasser la compression des marges. Sam Altman a déjà mis sur la table la thèse du volume sur la marge, en disant : « Nous aurons tellement d'utilisation de nos modèles que nous n'avons pas besoin d'être une entreprise à très forte marge pour pouvoir nous permettre la formation de modèles », et cela ne fonctionne que si la distribution et le routage maintiennent la demande stable alors que les prix baissent. Si les routeurs et les places de marché deviennent l'interface d'achat par défaut, les gagnants ressemblent moins à des laboratoires de « meilleur modèle » et plus à ceux qui contrôlent le flux de demandes.

Sources