
Ox Alpha lanza OpenRouter: modelo gratuito de 100T…
La atribución sigue sin resolverse, ya que los observadores se dividen entre una línea de Z.ai/GLM-5 y una hipótesis de la familia MAI de Microsoft.
Un proveedor anónimo ha listado un modelo de razonamiento "stealth" llamado Ox Alpha en OpenRouter y lo está ofreciendo gratis por un tiempo limitado. El lanzamiento está llamando la atención por una supuesta capacidad de 100 billones de tokens por día, incluso cuando el origen del modelo sigue sin verificarse.
Ox Alpha apareció en OpenRouter el jueves como un "modelo stealth" de un proveedor anónimo de terceros. OpenRouter es una plataforma de enrutamiento de modelos que permite a los desarrolladores enviar solicitudes a múltiples modelos a través de una sola interfaz, lo que hace que un nuevo listado sea inmediatamente utilizable en aplicaciones existentes sin una integración a medida.
OpenRouter describe a Ox Alpha como un "modelo de razonamiento diseñado para codificación, trabajo agente sostenido y cargas de trabajo de producción", y dice que es adecuado para "ingeniería de software a largo plazo, razonamiento complejo y flujos de trabajo que combinan texto con contexto visual."
"Trabajo agente" aquí significa flujos de trabajo de múltiples pasos donde un sistema planifica y ejecuta acciones hacia un objetivo, a menudo llamando herramientas, en lugar de responder a un solo aviso.
El modelo se lanzó al mercado con un gancho de distribución que importa más que la charla de referencia: es gratis, al menos temporalmente. OpenCode, un agente de codificación de IA de código abierto, dijo en X que Ox Alpha sería gratuito durante una semana con "uso casi ilimitado", enmarcando el lanzamiento como una ventana de acceso limitada en el tiempo en lugar de un punto de precio permanente.
La validación temprana llegó rápido. El CEO de Stripe, Patrick Collison, publicó en X después de probar el modelo que "es muy impresionante." Ese tipo de respaldo no verifica la ascendencia, pero aumenta las probabilidades de que los desarrolladores sigan dirigiendo tráfico hacia él el tiempo suficiente para que aparezcan huellas más claras.
Atribución Whiplash: Z.ai/GLM-5 vs Microsoft MAI, y qué evidencia hay
El debate sobre la identidad se ha movido más rápido que la evidencia. La especulación temprana se centró en un laboratorio de IA chino, con Z.ai, el laboratorio detrás de GLM-5, como candidato.
El mecanismo detrás de esa teoría es familiar: los desarrolladores observan patrones de respuesta y el comportamiento del tokenizador, donde un tokenizador es el componente que divide el texto y que a veces puede filtrar un parecido familiar entre líneas de modelos.
Esa teoría de Z.ai se basó tanto en precedentes como en indicios técnicos. GLM-5 fue probado anteriormente de forma anónima bajo el nombre de "Pony Alpha", y los observadores señalaron similitudes percibidas entre Ox Alpha y el comportamiento de la familia GLM como una razón para sospechar de otro lanzamiento stealth.
El problema es que el mismo tipo de atribución basada en tokenizadores puede cortar en la otra dirección. Un análisis competidor citado en la discusión sugirió que el tokenizador de Ox Alpha podría apuntar en cambio hacia la familia MAI de Microsoft, lo que cambiaría la narrativa de "lanzamiento stealth de laboratorio chino" a "distribución de pruebas de un incumbente estadounidense."
Hasta el sábado, la conversación pública ya se estaba enfriando sobre cualquier respuesta única. El analista de IA Andrew Curran escribió en X que GLM había sido la teoría principal el viernes por la noche, pero para el sábado por la mañana "la gente parece menos segura de cualquier cosa."
Sin una divulgación del proveedor, liberación de pesos, o un socio de alojamiento que ponga su nombre en la factura, ambas teorías siguen siendo inferencias a partir de efectos secundarios. Eso es útil para reducir posibilidades, pero no es lo mismo que la atribución.
Por qué la afirmación de 100T Tokens/Día y el acceso gratuito de una semana son importantes para la economía de inferencia
La parte relevante del mercado de Ox Alpha es el shock de distribución: un modelo de razonamiento posicionado para codificación y cargas de trabajo agenciales a largo plazo, ofrecido de forma gratuita con "uso casi ilimitado", dentro de un enrutador que puede redirigir rápidamente el tráfico de desarrolladores.
Cuando el enrutamiento es un cambio de configuración, "gratis por una semana" puede ser suficiente para restablecer los valores predeterminados, al menos temporalmente, especialmente para equipos que están evaluando agentes en bucles similares a la producción.
OpenCode también dijo que el proveedor tenía capacidad para 100 billones de tokens por día, descrito como aproximadamente 100 veces el número de tokens de IA que Visa dijo que utiliza en todo un mes. Los tokens son las pequeñas unidades de texto que los modelos procesan, y los recuentos de tokens son cómo los proveedores de inferencia hablan sobre el uso y el rendimiento.
Si esa afirmación de capacidad es siquiera direccionalmente precisa, implica una disponibilidad de inferencia inusualmente grande para un lanzamiento gratuito encubierto y limitado en el tiempo.
Eso importa para los comerciantes de AI-crypto menos porque prueba que un laboratorio específico está "ganando", y más porque presiona la narrativa de precios en torno a la inferencia.
Una ventana gratuita de alta capacidad puede desviar la demanda de puntos finales de pago, cambiar lo que los desarrolladores consideran un perfil de latencia y límite de tasa aceptable, y crear una expectativa efímera de que los modelos de "grado de razonamiento" pueden ser enrutados como mercancías.
El contexto más amplio es que los laboratorios chinos han estado reduciendo la brecha en el rendimiento mientras compiten fuertemente en precio y apertura.
La misma conversación sobre Ox Alpha mencionó laboratorios chinos como Zhipu, DeepSeek y Moonshot AI como rivales estadounidenses cada vez más desafiantes, y señaló el Kimi K3 de Moonshot, lanzado en julio, como un modelo de peso abierto de 2.8 billones de parámetros construido para codificación, razonamiento y tareas agenciales que atrajo atención por su rendimiento y menor precio.
Las señales a futuro son directas y mayormente operativas. La primera es si OpenRouter, OpenCode o el proveedor divulgan identidad, estado de pesos o un socio de alojamiento antes de que finalice la ventana gratuita de una semana. La segunda es qué sucede con los precios y límites después de la semana, incluyendo estrangulación, encolamiento o un cambio a niveles de pago.
La tercera es si un mayor trabajo de atribución técnica, incluyendo huellas dactilares de tokenizadores, fortalece materialmente la teoría de linaje Z.ai/GLM-5 o la hipótesis de la familia MAI de Microsoft. La última es si el uso sostenido en OpenRouter, incluyendo disponibilidad y latencia bajo carga, corrobora o contradice la afirmación de capacidad de 100T tokens/día.
Mi opinión: Trata a Ox Alpha como una señal de capacidad y distribución hasta que el proveedor sea verificado
El umbral que importa aquí no es qué logo termina adjunto a Ox Alpha, sino si la promesa de "gratis por una semana" se traduce en una disponibilidad sostenida y de alto rendimiento en la que los desarrolladores realmente puedan confiar para cargas de trabajo agenciales. Si el modelo se mantiene receptivo bajo tráfico real y luego pasa a un nivel de pago creíble, eso es un verdadero punto de datos del mercado de inferencia.
Si se degrada en colas, estrangula fuertemente o desaparece cuando se cierra la ventana gratuita, fue un pico de marketing con un envoltorio misterioso.
La atribución sigue siendo demasiado incierta para comerciar directamente porque la evidencia que se está compartiendo es mayormente de tokenizadores e inferencia de comportamiento, e incluso los observadores más ruidosos se han vuelto menos seguros con el tiempo.
Lo que haría que esto importara en términos prácticos es un proveedor verificado más precios posteriores a la gratuidad que obliguen al resto de la pila de inferencia a revalorizar o redirigir para competir.