Rows of server racks with illuminated components
IA

Thinking Machines lanza Inkling, modelo MoE de 975B

La empresa dice que solo ~41B parámetros están activos por token y publica huellas de memoria de 2TB a 600GB para su implementación.

Por Elliot Marsh6 min de lectura

Thinking Machines ha lanzado Inkling, un modelo Mixture-of-Experts creado desde cero que dice tener un total de 975 mil millones de parámetros mientras activa aproximadamente 41 mil millones por token. Los pesos se describen como disponibles en Hugging Face bajo una licencia Apache 2.0, junto con requisitos de memoria GPU inusualmente explícitos que relacionan la "apertura" del modelo con las restricciones de implementación reales.

Puntos Clave

  • Thinking Machines lanzó Inkling el 15 de julio de 2026, posicionándolo como el primer modelo de la compañía entrenado desde cero.
  • Inkling se describe como un modelo Mixture-of-Experts de 975B parámetros con aproximadamente 41B parámetros activos por token, utilizando enrutamiento disperso en lugar de computación densa.
  • La arquitectura se especifica como 66 capas con 256 expertos por capa, enrutando seis expertos por token más dos expertos compartidos que se ejecutan en cada token.
  • Las huellas de implementación se indican directamente: alrededor de 2TB de memoria GPU combinada para precisión total y alrededor de 600GB para un punto de control cuantizado.

Inkling se presenta como un lanzamiento MoE creado desde cero bajo licencia Apache 2.0.

Thinking Machines lanzó un modelo llamado Inkling el 15 de julio de 2026. Se describe a la compañía como que pone los pesos a disposición en Hugging Face bajo una licencia Apache 2.0, que típicamente permite un amplio uso y modificación sujeto a los términos de la licencia.

Inkling se enmarca como un sistema Mixture-of-Experts (MoE), lo que significa que el modelo almacena muchos "expertos" de parámetros pero solo ejecuta un subconjunto para cada token generado. El tamaño destacado en el desglose técnico es la diferencia entre un conteo total de parámetros de 975 mil millones y aproximadamente 41 mil millones de parámetros involucrados en el procesamiento de cualquier token único, o alrededor del 4% activo a la vez.

Los detalles del paquete provienen de un desglose técnico secundario que advierte explícitamente que se compila a partir de "detalles compartidos públicamente de varias fuentes" y pide a los lectores que señalen inexactitudes. Las referencias subyacentes y los artefactos de lanzamiento primarios no se incluyen aquí, por lo que el mecanismo es claro pero la verificación directa se limita a lo que está en el extracto.

Los números en los que se anclarán los traders: 2TB de precisión completa, ~600GB cuantizados

El lanzamiento de Inkling se lee como una historia de infraestructura porque adjunta huellas de memoria concretas a los puntos de control del modelo, no solo recuentos de parámetros. El desglose indica que el punto de control de precisión completa necesita al menos 2 TB de memoria GPU combinada, dado como ocho tarjetas NVIDIA B300 o dieciséis tarjetas H200. También describe un punto de control cuantizado de alrededor de 600 GB que cabe en cuatro tarjetas B300.

Esas cifras importan porque convierten los “pesos abiertos” en un problema de planificación de capacidad. Si un modelo puede ser descargado y ejecutado, los traders pueden mapear esa afirmación a una factura aproximada de materiales de hardware, luego a la economía de inferencia alojada, y luego a la demanda de capacidad GPU y las pilas que la sirven.

Un número principal de 975B puede ser combustible narrativo por sí solo, pero un requisito de 2TB es una restricción que aparece en la adquisición, planificación de colo y precios.

MoE es el puente entre esas dos realidades. El diseño de Inkling se describe como la separación del costo de almacenamiento del costo de inferencia por token: aún tienes que cargar el punto de control completo en memoria para ejecutarlo, pero cada token solo activa una pequeña fracción de los parámetros.

Esa es la propuesta de por qué un modelo puede ser “muy grande” en papel mientras que es más barato de ejecutar por token de lo que su recuento total de parámetros implica.

Cómo Inkling llega a 1M tokens: 55 capas de ventana deslizante y 11 capas de atención completa

Inkling se describe como soportando una ventana de contexto de un millón de tokens, que es la cantidad máxima de texto que puede considerar a la vez.

El mecanismo ofrecido para hacer eso factible es la escasez de atención: la mayoría de las capas utilizan atención de ventana deslizante, donde cada token solo atiende a un rango reciente limitado, y un número menor de capas utiliza atención completa, donde los tokens pueden atender a toda la secuencia anterior.

El desglose describe una alternancia de 5:1 entre capas de ventana deslizante y capas de atención completa. También cita notas de integración de vLLM que ponen números en la división: 55 capas de ventana deslizante y 11 capas de atención completa de un total de 66 capas.

Este es un compromiso arquitectónico específico, no una afirmación de marketing en aislamiento. Las capas de ventana deslizante evitan que el cómputo explote con la longitud de la secuencia, pero también corren el riesgo de perder el recuerdo a largo plazo porque los hechos lejanos no son directamente visibles en la mayoría de las capas.

Las capas de atención completa periódicas son la salida, proporcionando “puntos de actualización” globales donde la información de mucho antes en la secuencia puede ser extraída y luego llevada localmente de nuevo.

Qué verificar antes de que los mercados lo valoren: fuentes, truncamiento y benchmarks faltantes

El problema clave para tratar a Inkling como un catalizador es la verificación de los artefactos primarios. El paquete no incluye una tarjeta de modelo de Thinking Machines, una tarjeta de Hugging Face directa.enlace, o los documentos referenciados detrás de las citas entre corchetes del extracto, así que el primer punto de confirmación es la página del modelo real y los términos exactos de licencia y uso de Apache 2.0 adjuntos a los pesos.

La segunda pieza que falta es la evidencia de rendimiento. No se proporcionan referencias, números de latencia, afirmaciones de rendimiento o evaluaciones de contexto largo en el paquete, y el extracto está truncado a mitad de la discusión sobre la codificación de posición.

Las evaluaciones de terceros, especialmente las pruebas que indagan el comportamiento de contexto largo cerca de la ventana de un millón de tokens, serían la forma más rápida de separar "soporta 1M tokens" de "acepta 1M tokens pero olvida lo que importa."

La tercera confirmación es la capacidad de implementación en las huellas establecidas. El desglose da objetivos de memoria específicos para puntos de control de precisión completa y cuantizada, y hace referencia a notas de integración de vLLM para la división de atención 55/11.

Informes de ejecuciones exitosas en esas configuraciones, más evidencia de que las pilas de inferencia comunes manejan el patrón de atención como se describe, aumentarían la confianza en que este es un modelo que las personas realmente pueden alojar en lugar de solo descargar.

Mi lectura: pesos abiertos + huellas explícitas estrechan el ciclo de retroalimentación entre lanzamientos de modelos y operaciones de computación.

La parte que decide si Inkling importa a los mercados no es el titular de 975B, es la combinación de activación escasa y huellas de implementación explícitas. Un modelo MoE que solo activa ~41B parámetros por token puede plausiblemente cambiar la curva de costo por token sin renunciar al aura de marketing de "casi un billón de parámetros", y esa es exactamente el tipo de ambigüedad que los traders suelen tener que adivinar.

El umbral que importa es si la lista de Hugging Face de Apache 2.0 y las afirmaciones de memoria de 2TB a 600GB se mantienen en implementaciones reales, y luego son reflejadas por ajustes finos, variantes de cuantización y ofertas de inferencia alojadas. Si esas confirmaciones llegan, "contexto largo abierto" deja de ser una narrativa y comienza a ser una entrada medible de capacidad de GPU que puede propagarse a través de la pila.

Fuentes