
Thinking Machines lança Inkling, modelo MoE de 975B com…
A empresa afirma que apenas ~41B de parâmetros estão ativos por token e publica pegadas de memória de 2TB a 600GB para implantação.
A Thinking Machines lançou o Inkling, um modelo Mixture-of-Experts desenvolvido do zero que, segundo a empresa, totaliza 975 bilhões de parâmetros, ativando cerca de 41 bilhões por token. Os pesos são descritos como disponíveis no Hugging Face sob uma licença Apache 2.0, juntamente com requisitos de memória GPU incomumente explícitos que mapeiam a "abertura" do modelo para as restrições reais de implantação.
Principais Conclusões
- A Thinking Machines lançou o Inkling em 15 de julho de 2026, posicionando-o como o primeiro modelo da empresa treinado do zero.
- O Inkling é descrito como um modelo Mixture-of-Experts de 975B de parâmetros, com cerca de 41B de parâmetros ativos por token, utilizando roteamento esparso em vez de computação densa.
- A arquitetura é especificada como 66 camadas com 256 especialistas por camada, roteando seis especialistas por token, além de dois especialistas compartilhados que operam em cada token.
- As pegadas de implantação são declaradas diretamente: cerca de 2TB de memória GPU combinada para precisão total e cerca de 600GB para um ponto de verificação quantizado.
O Inkling é lançado como um MoE do zero sob a licença Apache 2.0.
A Thinking Machines lançou um modelo chamado Inkling em 15 de julho de 2026. A empresa é descrita como disponibilizando os pesos no Hugging Face sob uma licença Apache 2.0, que normalmente permite ampla reutilização e modificação, sujeita aos termos da licença.
O Inkling é apresentado como um sistema Mixture-of-Experts (MoE), o que significa que o modelo armazena muitos "especialistas" de parâmetros, mas apenas executa um subconjunto para cada token gerado. O tamanho principal na análise técnica é a diferença entre um total de 975 bilhões de parâmetros e cerca de 41 bilhões de parâmetros envolvidos no processamento de qualquer token único, ou cerca de 4% ativos ao mesmo tempo.
Os detalhes do pacote vêm de uma análise técnica secundária que alerta explicitamente que foi compilada a partir de "detalhes compartilhados publicamente de várias fontes" e pede aos leitores que sinalizem imprecisões. As referências subjacentes e os artefatos de lançamento primários não estão incluídos aqui, portanto, o mecanismo é claro, mas a verificação direta é limitada ao que está no trecho.
Os números que os traders vão se basear: 2TB de precisão total, ~600GB quantizado
O lançamento do Inkling lê como uma história de infraestrutura porque anexa pegadas de memória concretas aos pontos de verificação do modelo, não apenas contagens de parâmetros. A divisão afirma que o ponto de verificação de precisão total precisa de pelo menos 2 TB de memória GPU combinada, dado como oito placas NVIDIA B300 ou dezesseis placas H200. Também descreve um ponto de verificação quantizado em torno de 600 GB que cabe em quatro placas B300.
Esses números importam porque transformam “pesos abertos” em um problema de planejamento de capacidade. Se um modelo pode ser baixado e executado, os traders podem mapear essa afirmação para uma lista aproximada de materiais de hardware, depois para a economia de inferência hospedada, e então para a demanda por capacidade GPU e as pilhas que a atendem.
Um número de 975B pode ser combustível narrativo por si só, mas um requisito de 2TB é uma restrição que aparece na aquisição, planejamento de colo e precificação.
MoE é a ponte entre essas duas realidades. O design do Inkling é descrito como separando o custo de armazenamento do custo de inferência por token: você ainda precisa carregar o ponto de verificação completo na memória para executá-lo, mas cada token ativa apenas uma pequena fração dos parâmetros.
Essa é a justificativa para por que um modelo pode ser “muito grande” no papel enquanto é mais barato de executar por token do que sua contagem total de parâmetros implica.
Como o Inkling chega a 1M tokens: 55 camadas de janela deslizante e 11 camadas de atenção total
O Inkling é descrito como suportando uma janela de contexto de um milhão de tokens, que é a quantidade máxima de texto que pode considerar de uma vez.
O mecanismo oferecido para tornar isso viável é a esparsidade de atenção: a maioria das camadas usa atenção de janela deslizante, onde cada token apenas se atenta a um intervalo recente limitado, e um número menor de camadas usa atenção total, onde os tokens podem se atentar a toda a sequência anterior.
A divisão descreve uma alternância de 5:1 entre camadas de janela deslizante e camadas de atenção total. Também cita notas de integração do vLLM que colocam números na divisão: 55 camadas de janela deslizante e 11 camadas de atenção total de um total de 66 camadas.
Esta é uma troca arquitetônica específica, não uma afirmação de marketing isolada. Camadas de janela deslizante evitam que o cálculo exploda com o comprimento da sequência, mas também correm o risco de perder a recordação de longo alcance porque fatos distantes não são diretamente visíveis na maioria das camadas.
As camadas periódicas de atenção total são a saída, fornecendo “pontos de atualização” globais onde informações de muito antes na sequência podem ser puxadas para frente e depois carregadas localmente novamente.
O que verificar antes que os mercados precifiquem: fontes, truncamento e benchmarks ausentes
A questão crucial para tratar o Inkling como um catalisador é a verificação dos artefatos primários. O pacote não inclui um cartão de modelo Thinking Machines, um Hugging Face direto.link, ou os documentos referenciados por trás das citações entre colchetes do trecho, então o primeiro ponto de confirmação é a página do modelo real e os exatos termos de licença e uso da Apache 2.0 anexados aos pesos.
A segunda peça que falta é a evidência de desempenho. Nenhum benchmark, números de latência, reivindicações de throughput ou avaliações de longo contexto são fornecidos no pacote, e o trecho é truncado no meio da discussão sobre codificação de posição.
Avaliações de terceiros, especialmente testes que investigam o comportamento de longo contexto perto da janela de um milhão de tokens, seriam a maneira mais rápida de separar "suporta 1M tokens" de "aceita 1M tokens, mas esquece o que importa."
A terceira confirmação é a capacidade de implantação nas pegadas declaradas. A divisão fornece metas específicas de memória para pontos de verificação de precisão total e quantizada, e faz referência a notas de integração do vLLM para a divisão de atenção 55/11.
Relatórios de execuções bem-sucedidas nessas configurações, além de evidências de que pilhas de inferência comuns lidam com o padrão de atenção conforme descrito, aumentariam a confiança de que este é um modelo que as pessoas podem realmente hospedar em vez de apenas baixar.
Minha leitura: pesos abertos + pegadas explícitas apertam o ciclo de feedback entre lançamentos de modelos e negociações de computação.
A parte que decide se o Inkling importa para os mercados não é o título de 975B, mas a combinação de ativação esparsa e pegadas de implantação explícitas. Um modelo MoE que ativa apenas ~41B parâmetros por token pode plausivelmente mudar a curva de custo por token sem abrir mão da aura de marketing de "quase um trilhão de parâmetros", e essa é exatamente o tipo de ambiguidade que os traders geralmente têm que adivinhar.
O limiar que importa é se a listagem da Hugging Face da Apache 2.0 e as reivindicações de memória de 2TB para 600GB se sustentam em implantações reais, e depois são ecoadas por ajustes finos, variantes de quantização e ofertas de inferência hospedadas. Se essas confirmações chegarem, "aberto de longo contexto" deixa de ser uma narrativa e começa a ser uma entrada mensurável de capacidade de GPU que pode se propagar pela pilha.