Inkling-Small è un quarto della grandezza del suo predecessore e quasi altrettanto capace

Thinking Machines ha rilasciato un secondo modello AI open-source solo due settimane dopo il primo. La versione più piccola costa meno da eseguire, ottiene punteggi più alti in diversi test di programmazione e viene fornita con una licenza favorevole alle aziende.

AI2Day Newsdesk4 min read
Photoreal editorial shot of a sleek modern data centre corridor at night, rows of server racks glowing with soft blue and amber light, faint reflections on poli
Share

Punti chiave

  • Thinking Machines ha rilasciato Inkling-Small il 9 luglio 2025, solo due settimane dopo il lancio del suo modello Inkling originale.
  • Inkling-Small ha 276 miliardi di parametri totali ma utilizza solo 12 miliardi alla volta, rispetto ai 975 miliardi totali e 41 miliardi attivi dell'Inkling originale.
  • Il sito di benchmarking di terze parti Artificial Analysis ha assegnato a Inkling-Small un punteggio di 40 sul suo Intelligence Index, un punto sotto il 41 di Inkling.
  • Inkling-Small supera Inkling nei test di programmazione, incluso 80,2% rispetto al 77,6% su SWE-bench Verified, uno standard di benchmark per la codifica.
  • Il modello è rilasciato con licenza open-source Apache 2.0, che consente alle aziende di utilizzarlo, modificarlo e commercializzarlo con poche restrizioni.

Due settimane. È tutto il tempo che è servito a Thinking Machines, la startup fondata dall'ex chief technology officer di OpenAI Mira Murati, per seguire il debutto del suo modello AI con un successore più piccolo, più economico e quasi altrettanto capace.

Il nuovo modello si chiama Inkling-Small. È un modello di ragionamento multimodale, il che significa che può elaborare testo, immagini e audio e produrre testo in risposta. Nonostante il nome, non è piccolo per nessun standard ordinario, ma è drammaticamente più snello del suo fratello, e il divario di performance è sorprendentemente ridotto.

Come si confronta con l'Inkling originale?

Su Artificial Analysis's Intelligence Index, un sistema di scoring di terze parti che classifica i modelli AI su dozzine di test, Inkling-Small ottiene un punteggio di 40 rispetto al 41 di Inkling. Una differenza di un punto rispetto a un modello che è approssimativamente quattro volte più grande.

La differenza di dimensione dipende dall'architettura. Inkling-Small utilizza un design chiamato modello sparse Mixture-of-Experts. Pensalo come un grande team di specialisti: il modello ha 256 sottorete specializzate, chiamate esperti, ma per ogni parola o frase che elabora, consulta solo sei di loro più due esperti di uso generale che sono sempre attivi. Ecco perché il modello contiene 276 miliardi di parametri (valori appresi durante l'addestramento) in totale, ma attiva solo 12 miliardi alla volta. Meno lavoro per ogni passo significa costi di calcolo inferiori.

Su diversi benchmark di programmazione e ragionamento, Inkling-Small batte effettivamente il suo fratello maggiore. Ottiene l'80,2% su SWE-bench Verified, un test della correzione di bug nel software del mondo reale, rispetto al 77,6% di Inkling. Supera anche un benchmark di codifica scientifica chiamato SciCode e Humanity's Last Exam, un test del ragionamento a livello esperto.

Il vantaggio non è universale. Inkling mantiene un chiaro vantaggio nei compiti di conoscenza fattuale: 23,7% rispetto al 15,5% su uno dei test nel dominio bancario. Le aziende che utilizzano il modello per query fattuali ad alto rischio avranno ancora bisogno di associarlo a strumenti di recupero e revisione umana.

Puoi effettivamente eseguirlo da solo?

Non su un laptop. La versione a precisione intera di Inkling-Small necessita di almeno 600 GB di memoria GPU combinata, il tipo di potenza di calcolo specializzata che si trova nelle server room, non negli uffici domestici. Thinking Machines elenca due configurazioni hardware supportate: quattro chip NVIDIA B300 o otto chip NVIDIA H200.

Una versione compressa riduce quel requisito a circa 180 GB, e l'azienda dice che quella variante può essere eseguita su un singolo chip B300. Comunque, questo è fermamente territorio aziendale.

L'etichetta "Small" è relativa a Inkling, non al più ampio mondo di modelli leggeri che funzionano su hardware consumer. Detto questo, i pesi completi del modello sono liberamente disponibili su Hugging Face, la piattaforma principale per la condivisione di modelli AI open-source, e la comunità open-source quasi certamente produrrà versioni ancora più compresse nelle prossime settimane.

Quanto costa utilizzarlo tramite l'API?

Thinking Machines sta attualmente offrendo uno sconto di lancio, portando il prezzo a 0,58 dollari per milione di token di input e 1,44 dollari per milione di token di output per la versione standard con contesto di 64.000. Un token è approssimativamente tre quarti di una parola, quindi un milione di token copre un grande volume di testo.

Livello di prezzo Costo per milione di token
Input (prefill) $0,58
Output (sampled) $1,44
Training $1,73
Cached input $0,116

Vale la pena notare la licenza Apache 2.0 che copre il modello. Consente alle aziende di utilizzare, modificare, mettere a punto e costruire prodotti commerciali su Inkling-Small senza le soglie di ricavi o condizioni di branding che compaiono in alcune altre licenze di modelli AI. Per i team legali e di approvvigionamento, questo è un significativo semplificazione.

Domande comuni

"Open source" significa che chiunque può usarlo gratuitamente?

Apache 2.0 è una delle licenze standard più permissive del software. Le aziende possono utilizzare, modificare e vendere prodotti costruiti su Inkling-Small, purché seguano le regole di attribuzione della licenza e rivedere qualsiasi policy di acceptable-use che Thinking Machines pubblica insieme ad essa.

È sicuro fidarsi di questo modello per decisioni importanti?

I punteggi di conoscenza fattuale di Inkling-Small rimangono indietro rispetto all'Inkling più grande, e il suo punteggio su uno degli indici fattuali è negativo, il che significa che scende al di sotto della baseline sulla copertura di conoscenza generale. Qualsiasi organizzazione che lo utilizzi per decisioni mediche, legali o finanziarie dovrebbe integrare il recupero da fonti verificate e la revisione umana degli output.

© 2026 AI2Day