Inkling-Small tem um Quarto do Tamanho do seu Antecessor e é Quase tão Capaz

A Thinking Machines lançou um segundo modelo de IA de código aberto apenas duas semanas após o primeiro. A versão menor custa menos para executar, obtém pontuações mais altas em vários testes de codificação e vem com uma licença amiga dos negócios.

AI2Day Newsdesk4 min read
Photoreal editorial shot of a sleek modern data centre corridor at night, rows of server racks glowing with soft blue and amber light, faint reflections on poli
Share

Pontos-chave

  • A Thinking Machines lançou o Inkling-Small em 9 de julho de 2025, apenas duas semanas após o lançamento do modelo Inkling original.
  • O Inkling-Small tem 276 mil milhões de parâmetros totais mas utiliza apenas 12 mil milhões de cada vez, em comparação com 975 mil milhões totais e 41 mil milhões ativos para o Inkling original.
  • O site de benchmarking de terceiros Artificial Analysis atribuiu ao Inkling-Small 40 no seu Índice de Inteligência, um ponto abaixo dos 41 do Inkling.
  • O Inkling-Small supera o Inkling em testes de codificação, incluindo 80,2% versus 77,6% no SWE-bench Verified, um benchmark de codificação padrão.
  • O modelo é lançado sob a licença de código aberto Apache 2.0, que permite que as empresas o utilizem, modifiquem e comercializem com poucas restrições.

Duas semanas. Foi tudo o que levou a Thinking Machines, a startup fundada pela antiga diretora de tecnologia da OpenAI Mira Murati, para dar seguimento ao seu modelo de IA de estreia com um sucessor mais pequeno, mais barato e quase tão capaz.

O novo modelo chama-se Inkling-Small. É um modelo de raciocínio multimodal, o que significa que pode receber texto, imagens e áudio e produzir texto em resposta. Apesar do nome, não é pequeno por qualquer medida ordinária, mas é dramaticamente mais leve do que o seu homólogo, e a diferença de desempenho é surpreendentemente estreita.

Como se compara ao Inkling original?

No Índice de Inteligência do Artificial Analysis, um sistema de pontuação de terceiros que classifica modelos de IA em dezenas de testes, o Inkling-Small obtém 40 em comparação com os 41 do Inkling. Um ponto de separação de um modelo que é aproximadamente quatro vezes maior.

A diferença de tamanho resume-se à arquitetura. O Inkling-Small utiliza um design chamado modelo sparse Mixture-of-Experts. Pense nele como uma grande equipa de especialistas: o modelo tem 256 sub-redes especialistas, chamadas especialistas, mas para qualquer palavra ou frase que processa, apenas consulta seis delas mais dois especialistas de uso geral que estão sempre ativos. É por isso que o modelo tem 276 mil milhões de parâmetros (valores aprendidos integrados durante o treino) no total, mas ativa apenas 12 mil milhões de cada vez. Menos trabalho por passo significa custos de computação mais baixos.

Em vários benchmarks de codificação e raciocínio, o Inkling-Small supera efetivamente o seu homólogo maior. Obtém 80,2% no SWE-bench Verified, um teste de correção de erros de software no mundo real, versus 77,6% para o Inkling. Também se destaca num benchmark de codificação científica chamado SciCode e no Humanity's Last Exam, um teste de raciocínio ao nível de especialista.

A vantagem não é universal. O Inkling retém uma clara liderança nas tarefas de conhecimento factual: 23,7% versus 15,5% num teste do domínio bancário. As empresas que utilizem o modelo para consultas factuais de alto risco ainda precisarão de o emparelhar com ferramentas de recuperação e revisão humana.

Consegue realmente executá-lo por si próprio?

Não num computador portátil. A versão de precisão completa do Inkling-Small precisa de pelo menos 600 GB de memória GPU combinada, o tipo de poder de computação especializado encontrado em salas de servidores, não em escritórios domésticos. A Thinking Machines lista duas configurações de hardware suportadas: quatro chips NVIDIA B300 ou oito chips NVIDIA H200.

Uma versão comprimida reduz esse requisito para aproximadamente 180 GB, e a empresa diz que essa variante pode funcionar num único chip B300. Ainda assim, isto é claramente território empresarial.

O rótulo "Small" é relativo ao Inkling, não ao mundo mais amplo de modelos leves que funcionam em hardware de consumo. Dito isto, os pesos completos do modelo estão disponíveis gratuitamente no Hugging Face, a principal plataforma para partilha de modelos de IA de código aberto, e a comunidade de código aberto quase certamente produzirá versões ainda mais comprimidas nas próximas semanas.

Quanto custa usar via API?

A Thinking Machines está atualmente a oferecer um desconto de lançamento, reduzindo o preço para $0,58 por milhão de tokens de entrada e $1,44 por milhão de tokens de saída para a versão padrão de contexto 64.000. Um token é aproximadamente três quartos de uma palavra, por isso um milhão de tokens cobre um grande volume de texto.

Nível de preço Custo por milhão de tokens
Entrada (prefill) $0,58
Saída (sampled) $1,44
Treino $1,73
Entrada em cache $0,116

Vale a pena notar a licença Apache 2.0 que cobre o modelo. Permite que as empresas utilizem, modifiquem, ajustem e criem produtos comerciais em cima do Inkling-Small sem os limites de receita ou condições de marca que aparecem em algumas outras licenças de modelos de IA. Para equipas jurídicas e de aquisição, isto é uma simplificação significativa.

Perguntas comuns

"Código aberto" significa que alguém pode usar isto gratuitamente?

Apache 2.0 é uma das licenças padrão mais permissivas em software. As empresas podem usar, modificar e vender produtos construídos em cima do Inkling-Small, desde que sigam as regras de atribuição da licença e revejam qualquer política de uso aceitável que a Thinking Machines publique junto com ela.

É este modelo seguro confiar para decisões importantes?

As pontuações de conhecimento factual do Inkling-Small ficam atrás do Inkling maior, e a sua pontuação num índice factual é negativa, o que significa que fica abaixo da linha de base na cobertura de conhecimento amplo. Qualquer organização que o utilize para decisões médicas, jurídicas ou financeiras deve incluir recuperação de fontes verificadas e revisão humana dos resultados.

© 2026 AI2Day