
Ox Alpha lance OpenRouter : modèle gratuit à 100T…
L'attribution reste non résolue alors que les observateurs se divisent entre une lignée Z.ai/GLM-5 et une hypothèse de famille MAI de Microsoft.
Un fournisseur anonyme a listé un modèle de raisonnement « furtif » appelé Ox Alpha sur OpenRouter et l'offre gratuitement pour une période limitée. Le lancement attire l'attention pour une capacité revendiquée de 100 trillions de tokens par jour, même si l'origine du modèle reste non vérifiée.
Ox Alpha est apparu sur OpenRouter jeudi en tant que « modèle furtif » d'un fournisseur tiers anonyme. OpenRouter est une plateforme de routage de modèles qui permet aux développeurs d'envoyer des requêtes à plusieurs modèles via une seule interface, ce qui rend une nouvelle liste immédiatement utilisable dans les applications existantes sans intégration sur mesure.
OpenRouter décrit Ox Alpha comme un « modèle de raisonnement conçu pour le codage, le travail agentique soutenu et les charges de travail de production », et dit qu'il est adapté pour « l'ingénierie logicielle à long terme, le raisonnement complexe et les flux de travail qui combinent texte et contexte visuel.
» Le « travail agentique » ici signifie des flux de travail en plusieurs étapes où un système planifie et exécute des actions vers un objectif, souvent en appelant des outils, plutôt qu'en répondant à une seule invite.
Le modèle a été lancé sur le marché avec un crochet de distribution qui compte plus que les bavardages de référence : il est gratuit, du moins temporairement. OpenCode, un agent de codage IA open source, a déclaré sur X qu'Ox Alpha serait gratuit pendant une semaine avec une « utilisation presque illimitée », présentant le lancement comme une fenêtre d'accès limitée dans le temps plutôt qu'un prix permanent.
Une validation précoce est arrivée rapidement. Le PDG de Stripe, Patrick Collison, a posté sur X après avoir essayé le modèle que « c'est très impressionnant. » Ce type d'approbation ne vérifie pas la lignée, mais augmente les chances que les développeurs continuent à y diriger le trafic suffisamment longtemps pour que des empreintes digitales plus claires émergent.
Attribution Whiplash : Z.ai/GLM-5 contre Microsoft MAI, et quelles preuves existe-t-il
Le débat sur l'identité a avancé plus vite que les preuves. Les premières spéculations se sont concentrées sur un laboratoire d'IA chinois, avec Z.ai, le laboratoire derrière GLM-5, proposé comme candidat.
Le mécanisme derrière cette théorie est familier : les développeurs examinent les modèles de réponse et le comportement des tokenizers, où un tokenizer est le composant de séparation de texte qui peut parfois révéler une ressemblance familiale à travers les lignes de modèles.
Cette théorie Z.ai s'est appuyée sur des précédents autant que sur des indices techniques. GLM-5 avait été précédemment testé anonymement sous le nom de « Pony Alpha », et les observateurs ont souligné des similitudes perçues entre Ox Alpha et le comportement de la famille GLM comme raison de suspecter un autre lancement furtif.
Le problème est que le même type d'attribution basé sur les tokenizers peut aller dans l'autre sens. Une analyse concurrente citée dans la discussion a suggéré que le tokenizer d'Ox Alpha pourrait plutôt pointer vers la famille MAI de Microsoft, ce qui inverserait le récit de « lancement furtif d'un laboratoire chinois » à « distribution testée par un acteur américain.
» À partir de samedi, la conversation publique commençait déjà à se refroidir sur une réponse unique. L'analyste IA Andrew Curran a écrit sur X que GLM avait été la théorie dominante vendredi soir, mais samedi matin « les gens semblent moins sûrs de quoi que ce soit. »
Sans divulgation d'un fournisseur, publication de poids ou partenaire d'hébergement mettant son nom sur la facture, les deux théories restent des inférences basées sur des effets secondaires. Cela est utile pour réduire les possibilités, mais ce n'est pas la même chose que l'attribution.
Pourquoi la revendication de 100T Tokens/Day et l'accès gratuit d'une semaine sont importants pour l'économie de l'inférence
La partie pertinente du marché d'Ox Alpha est le choc de distribution : un modèle de raisonnement positionné pour le codage et les charges de travail agentiques à long terme, offert gratuitement avec une "utilisation presque illimitée", à l'intérieur d'un routeur qui peut rediriger rapidement le trafic des développeurs.
Lorsque le routage est un changement de configuration, "gratuit pendant une semaine" peut suffire à réinitialiser les paramètres par défaut, du moins temporairement, surtout pour les équipes qui évaluent des agents dans des boucles semblables à la production.
OpenCode a également déclaré que le fournisseur avait la capacité de 100 trillions de tokens par jour, décrite comme environ 100 fois le nombre de tokens AI que Visa a déclaré utiliser en un mois entier. Les tokens sont les petites unités de texte que les modèles traitent, et les comptes de tokens sont la façon dont les fournisseurs d'inférence parlent à la fois de l'utilisation et du débit.
Si cette revendication de capacité est même directionnellement précise, cela implique une disponibilité d'inférence exceptionnellement grande pour un déploiement gratuit furtif et limité dans le temps.
Cela importe moins pour les traders AI-crypto parce que cela prouve qu'un laboratoire spécifique "gagne", et plus parce que cela exerce une pression sur le récit des prix autour de l'inférence.
Une fenêtre gratuite de haute capacité peut détourner la demande des points d'extrémité payants, changer ce que les développeurs considèrent comme un profil de latence et de limitation de taux acceptable, et créer une attente éphémère selon laquelle les modèles de "niveau de raisonnement" peuvent être routés comme des marchandises.
Le contexte plus large est que les laboratoires chinois ont réduit l'écart de performance tout en rivalisant fortement sur les prix et l'ouverture.
La même conversation autour d'Ox Alpha a mentionné des laboratoires chinois tels que Zhipu, DeepSeek et Moonshot AI comme des rivaux américains de plus en plus difficiles, et a pointé vers le Kimi K3 de Moonshot, sorti en juillet, comme un modèle à poids ouverts de 2,8 trillions de paramètres construit pour le codage, le raisonnement et les tâches agentiques qui a attiré l'attention pour sa performance et son prix inférieur.
Les signaux à venir sont simples et principalement opérationnels. Le premier est de savoir si OpenRouter, OpenCode ou le fournisseur divulguent l'identité, l'état des poids ou un partenaire d'hébergement avant la fin de la fenêtre gratuite annoncée. Le second est ce qui arrive aux prix et aux limites après la semaine, y compris le throttling, le mise en file d'attente, ou un passage à des niveaux payants.
Le troisième est de savoir si un travail d'attribution technique supplémentaire, y compris les empreintes de tokenizer, renforce matériellement soit la théorie de la lignée Z.ai/GLM-5 soit l'hypothèse de la famille MAI de Microsoft. Le dernier est de savoir si l'utilisation soutenue sur OpenRouter, y compris la disponibilité et la latence sous charge, corrobore ou contredit la revendication de capacité de 100T tokens/jour.
Mon avis : Considérez Ox Alpha comme un signal de capacité et de distribution jusqu'à ce que le fournisseur soit vérifié
Le seuil qui importe ici n'est pas quel logo finit par être attaché à Ox Alpha, mais si la promesse de "gratuit pendant une semaine" se traduit par une disponibilité soutenue et à haut débit sur laquelle les développeurs peuvent réellement compter pour des charges de travail agentiques. Si le modèle reste réactif sous un trafic réel et passe ensuite à un niveau payant crédible, c'est un véritable point de données du marché de l'inférence.
S'il se dégrade en files d'attente, limite fortement, ou disparaît lorsque la fenêtre gratuite se ferme, c'était un pic marketing avec un emballage mystérieux.
L'attribution reste trop incertaine pour être échangée directement car les preuves qui circulent sont principalement des inférences de tokenizer et de comportement, et même les observateurs les plus bruyants ont perdu confiance au fil du temps. Ce qui rendrait cela important en termes pratiques est un fournisseur vérifié plus un tarif post-gratuit qui oblige le reste de la pile d'inférence à re-pricer ou à re-router pour concurrencer.