Inkling-Small tem um Quarto do Tamanho do seu Antecessor e é Quase tão Capaz
A Thinking Machines lançou um segundo modelo de IA de código aberto apenas duas semanas após o primeiro. A versão menor custa menos para executar, obtém pontuações mais altas em vários testes de codificação e vem com uma licença amiga dos negócios.

Pontos-chave
- A Thinking Machines lançou o Inkling-Small em 9 de julho de 2025, apenas duas semanas após o lançamento do modelo Inkling original.
- O Inkling-Small tem 276 mil milhões de parâmetros totais mas utiliza apenas 12 mil milhões de cada vez, em comparação com 975 mil milhões totais e 41 mil milhões ativos para o Inkling original.
- O site de benchmarking de terceiros Artificial Analysis atribuiu ao Inkling-Small 40 no seu Índice de Inteligência, um ponto abaixo dos 41 do Inkling.
- O Inkling-Small supera o Inkling em testes de codificação, incluindo 80,2% versus 77,6% no SWE-bench Verified, um benchmark de codificação padrão.
- O modelo é lançado sob a licença de código aberto Apache 2.0, que permite que as empresas o utilizem, modifiquem e comercializem com poucas restrições.
Duas semanas. Foi tudo o que levou a Thinking Machines, a startup fundada pela antiga diretora de tecnologia da OpenAI Mira Murati, para dar seguimento ao seu modelo de IA de estreia com um sucessor mais pequeno, mais barato e quase tão capaz.
O novo modelo chama-se Inkling-Small. É um modelo de raciocínio multimodal, o que significa que pode receber texto, imagens e áudio e produzir texto em resposta. Apesar do nome, não é pequeno por qualquer medida ordinária, mas é dramaticamente mais leve do que o seu homólogo, e a diferença de desempenho é surpreendentemente estreita.
Como se compara ao Inkling original?
No Índice de Inteligência do Artificial Analysis, um sistema de pontuação de terceiros que classifica modelos de IA em dezenas de testes, o Inkling-Small obtém 40 em comparação com os 41 do Inkling. Um ponto de separação de um modelo que é aproximadamente quatro vezes maior.
A diferença de tamanho resume-se à arquitetura. O Inkling-Small utiliza um design chamado modelo sparse Mixture-of-Experts. Pense nele como uma grande equipa de especialistas: o modelo tem 256 sub-redes especialistas, chamadas especialistas, mas para qualquer palavra ou frase que processa, apenas consulta seis delas mais dois especialistas de uso geral que estão sempre ativos. É por isso que o modelo tem 276 mil milhões de parâmetros (valores aprendidos integrados durante o treino) no total, mas ativa apenas 12 mil milhões de cada vez. Menos trabalho por passo significa custos de computação mais baixos.
Em vários benchmarks de codificação e raciocínio, o Inkling-Small supera efetivamente o seu homólogo maior. Obtém 80,2% no SWE-bench Verified, um teste de correção de erros de software no mundo real, versus 77,6% para o Inkling. Também se destaca num benchmark de codificação científica chamado SciCode e no Humanity's Last Exam, um teste de raciocínio ao nível de especialista.
A vantagem não é universal. O Inkling retém uma clara liderança nas tarefas de conhecimento factual: 23,7% versus 15,5% num teste do domínio bancário. As empresas que utilizem o modelo para consultas factuais de alto risco ainda precisarão de o emparelhar com ferramentas de recuperação e revisão humana.
Consegue realmente executá-lo por si próprio?
Não num computador portátil. A versão de precisão completa do Inkling-Small precisa de pelo menos 600 GB de memória GPU combinada, o tipo de poder de computação especializado encontrado em salas de servidores, não em escritórios domésticos. A Thinking Machines lista duas configurações de hardware suportadas: quatro chips NVIDIA B300 ou oito chips NVIDIA H200.
Uma versão comprimida reduz esse requisito para aproximadamente 180 GB, e a empresa diz que essa variante pode funcionar num único chip B300. Ainda assim, isto é claramente território empresarial.
O rótulo "Small" é relativo ao Inkling, não ao mundo mais amplo de modelos leves que funcionam em hardware de consumo. Dito isto, os pesos completos do modelo estão disponíveis gratuitamente no Hugging Face, a principal plataforma para partilha de modelos de IA de código aberto, e a comunidade de código aberto quase certamente produzirá versões ainda mais comprimidas nas próximas semanas.
Quanto custa usar via API?
A Thinking Machines está atualmente a oferecer um desconto de lançamento, reduzindo o preço para $0,58 por milhão de tokens de entrada e $1,44 por milhão de tokens de saída para a versão padrão de contexto 64.000. Um token é aproximadamente três quartos de uma palavra, por isso um milhão de tokens cobre um grande volume de texto.
| Nível de preço | Custo por milhão de tokens |
|---|---|
| Entrada (prefill) | $0,58 |
| Saída (sampled) | $1,44 |
| Treino | $1,73 |
| Entrada em cache | $0,116 |
Vale a pena notar a licença Apache 2.0 que cobre o modelo. Permite que as empresas utilizem, modifiquem, ajustem e criem produtos comerciais em cima do Inkling-Small sem os limites de receita ou condições de marca que aparecem em algumas outras licenças de modelos de IA. Para equipas jurídicas e de aquisição, isto é uma simplificação significativa.
Perguntas comuns
"Código aberto" significa que alguém pode usar isto gratuitamente?
Apache 2.0 é uma das licenças padrão mais permissivas em software. As empresas podem usar, modificar e vender produtos construídos em cima do Inkling-Small, desde que sigam as regras de atribuição da licença e revejam qualquer política de uso aceitável que a Thinking Machines publique junto com ela.
É este modelo seguro confiar para decisões importantes?
As pontuações de conhecimento factual do Inkling-Small ficam atrás do Inkling maior, e a sua pontuação num índice factual é negativa, o que significa que fica abaixo da linha de base na cobertura de conhecimento amplo. Qualquer organização que o utilize para decisões médicas, jurídicas ou financeiras deve incluir recuperação de fontes verificadas e revisão humana dos resultados.


