Inkling-Small es una cuarta parte del tamaño de su predecesor y casi tan capaz
Thinking Machines ha lanzado un segundo modelo de IA de código abierto apenas dos semanas después del primero. La versión más pequeña cuesta menos de ejecutar, obtiene puntuaciones más altas en varias pruebas de codificación y viene con una licencia compatible con los negocios.

Puntos clave
- Thinking Machines lanzó Inkling-Small el 9 de julio de 2025, apenas dos semanas después de lanzar su modelo Inkling original.
- Inkling-Small tiene 276 mil millones de parámetros totales pero utiliza solo 12 mil millones a la vez, comparado con 975 mil millones totales y 41 mil millones activos para el Inkling original.
- El sitio de evaluación comparativa de terceros Artificial Analysis calificó a Inkling-Small con 40 en su Índice de Inteligencia, un punto por debajo de los 41 de Inkling.
- Inkling-Small supera a Inkling en pruebas de codificación, incluido 80,2% versus 77,6% en SWE-bench Verified, un estándar de evaluación de codificación.
- El modelo se lanza bajo la licencia de código abierto Apache 2.0, que permite a las empresas usarlo, modificarlo y comercializarlo con pocas restricciones.
Dos semanas. Eso es todo lo que necesitó Thinking Machines, la startup fundada por la ex directora de tecnología de OpenAI Mira Murati, para dar seguimiento a su debut con un modelo de IA más pequeño, más económico y casi tan capaz.
El nuevo modelo se llama Inkling-Small. Es un modelo de razonamiento multimodal, lo que significa que puede procesar texto, imágenes y audio y producir texto como respuesta. A pesar del nombre, no es pequeño en ningún sentido ordinario, pero es dramáticamente más eficiente que su homólogo, y la brecha de rendimiento es sorprendentemente estrecha.
¿Cómo se compara con el Inkling original?
En el Índice de Inteligencia de Artificial Analysis, un sistema de evaluación de terceros que clasifica modelos de IA en docenas de pruebas, Inkling-Small obtiene una puntuación de 40 comparado con los 41 de Inkling. Un solo punto de separación de un modelo que es aproximadamente cuatro veces más grande.
La diferencia de tamaño se reduce a la arquitectura. Inkling-Small utiliza un diseño llamado modelo disperso de Mezcla de Expertos. Piénsalo como un gran equipo de especialistas: el modelo tiene 256 subredes especializadas, llamadas expertos, pero para cualquier palabra o frase que procesa, solo consulta seis de ellos más dos expertos de propósito general que siempre están activos. Por eso el modelo contiene 276 mil millones de parámetros (valores aprendidos incorporados durante el entrenamiento) en total, pero activa solo 12 mil millones a la vez. Menos trabajo por paso significa menores costos computacionales.
En varias pruebas de codificación y razonamiento, Inkling-Small en realidad supera a su homólogo más grande. Obtiene 80,2% en SWE-bench Verified, una prueba de corrección de errores de software del mundo real, versus 77,6% para Inkling. También se adelanta en una prueba de codificación científica llamada SciCode y en Humanity's Last Exam, una prueba de razonamiento a nivel experto.
La ventaja no es universal. Inkling mantiene una clara ventaja en tareas de conocimiento factual: 23,7% versus 15,5% en una prueba del dominio bancario. Las empresas que utilicen el modelo para consultas factuales de alto riesgo aún necesitarán combinarlo con herramientas de recuperación y revisión humana.
¿Realmente puedes ejecutarlo por tu cuenta?
No en una laptop. La versión de precisión completa de Inkling-Small necesita al menos 600 GB de memoria GPU combinada, el tipo de potencia informática especializada que se encuentra en salas de servidores, no en oficinas en casa. Thinking Machines enumera dos configuraciones de hardware compatibles: cuatro chips NVIDIA B300 u ocho chips NVIDIA H200.
Una versión comprimida reduce ese requisito a aproximadamente 180 GB, y la empresa dice que esa variante puede ejecutarse en un solo chip B300. Aun así, esto es definitivamente territorio empresarial.
La etiqueta "Small" es relativa a Inkling, no al mundo más amplio de modelos ligeros que se ejecutan en hardware de consumidor. Dicho esto, los pesos completos del modelo están disponibles libremente en Hugging Face, la plataforma principal para compartir modelos de IA de código abierto, y la comunidad de código abierto casi con certeza producirá versiones aún más comprimidas en las próximas semanas.
¿Cuánto cuesta usarlo a través de la API?
Thinking Machines actualmente ofrece un descuento de lanzamiento, llevando el precio a $0,58 por millón de tokens de entrada y $1,44 por millón de tokens de salida para la versión estándar de contexto 64,000. Un token es aproximadamente tres cuartas partes de una palabra, así que un millón de tokens cubre un gran volumen de texto.
| Nivel de precios | Costo por millón de tokens |
|---|---|
| Entrada (prefill) | $0,58 |
| Salida (muestreada) | $1,44 |
| Entrenamiento | $1,73 |
| Entrada en caché | $0,116 |
Vale la pena señalar la licencia Apache 2.0 que cubre el modelo. Permite a las empresas usar, modificar, ajustar y crear productos comerciales sobre Inkling-Small sin los umbrales de ingresos o condiciones de marca que aparecen en algunas otras licencias de modelos de IA. Para equipos legales y de adquisiciones, esa es una simplificación significativa.
Preguntas comunes
¿"Código abierto" significa que cualquiera puede usar esto libremente?
Apache 2.0 es una de las licencias estándar más permisivas en software. Las empresas pueden usar, modificar y vender productos construidos sobre Inkling-Small, siempre que sigan las reglas de atribución de la licencia y revisen cualquier política de uso aceptable que Thinking Machines publique junto a ella.
¿Es este modelo seguro para confiar en decisiones importantes?
Las puntuaciones de conocimiento factual de Inkling-Small están por debajo del Inkling más grande, y su puntuación en un índice factual es negativa, lo que significa que cae por debajo de la línea de base en cobertura de conocimiento general. Cualquier organización que lo use para decisiones médicas, legales o financieras debe incorporar recuperación de fuentes verificadas y revisión humana de los resultados.


