La startup francesa Kog afirma que sus GPUs existentes pueden ejecutar IA diez veces más rápido. Así es cómo.
Kog sostiene que solo el software puede acelerar dramáticamente la inferencia de IA en los chips que ya poseen las empresas. La demostración de septiembre será la prueba definitiva.

Puntos clave
- La startup francesa Kog atrajo 200 clientes potenciales en mayo de 2025 tras una demostración pública que mostró 3.000 tokens por segundo en GPUs estándar de centros de datos.
- Su pequeño modelo de prueba, Laneformer 2B, ha sido de código abierto, pero el verdadero objetivo de Kog son los grandes modelos de lenguaje que potencian las herramientas de IA cotidianas.
- El CEO Gaël Delalleau le dijo a TechCrunch que un primer modelo importante ejecutándose a velocidad 10x debería estar listo para demostrar en septiembre de 2025, antes de una ronda de financiación Series A planeada.
- La ronda semilla de Kog fue codirigida por Varsity VC y respaldada por inversores públicos franceses Bpifrance y el programa French Tech 2030.
Cuando ejecutas software de IA, cada respuesta que obtienes requiere un proceso llamado inferencia: el modelo lee tu pregunta y genera una respuesta, palabra por palabra. Cuanto más rápido suceda esto, menos esperas y menos cuesta. Esa velocidad es un verdadero cuello de botella para muchas empresas en este momento.
Kog, una startup con sede en París, cree que el cuello de botella no es el hardware. Es el software que se ejecuta encima.
¿Qué está afirmando realmente Kog?
Kog dice que puede hacer que la inferencia de IA sea dramáticamente más rápida sin cambiar ningún chip. Su demostración de mayo, que atrajo mucha atención en el foro de programadores Hacker News, mostró un pequeño modelo de IA produciendo 3.000 tokens (aproximadamente 3.000 palabras o fragmentos de palabras) por segundo en GPUs AMD MI300X y NVIDIA H200, el tipo de chips que las grandes empresas ya ejecutan en sus centros de datos.
Esa cifra provino de un modelo construido específicamente llamado Laneformer 2B, que tiene aproximadamente 2 mil millones de parámetros (piensa en los parámetros como las configuraciones aprendidas dentro de un modelo de IA que moldean sus respuestas). Pequeño según los estándares actuales. La empresa lo ha puesto en código abierto, pero la pregunta comercial difícil es si los mismos trucos funcionan en los modelos mucho más grandes que potencian herramientas como Claude o ChatGPT.
Delalleau le dijo a TechCrunch que confía en que funcionen, señalando a los GPUs más nuevos que llevan cada vez más ancho de banda de memoria que el software actual simplemente no explota. Espera demostrar un modelo grande importante ejecutándose a diez veces su velocidad normal en septiembre de 2025, un hito que dice que desencadenará la ronda Series A de la empresa.
Vale la pena comparar ese objetivo con lo que ya se está lanzando en otros lugares. Nuestra historia anterior sobre el nuevo modo Ultrafast de OpenAI que hace que GPT-5.6 Sol se ejecute a 14 veces la velocidad normal muestra el mercado al que Kog está entrando se está moviendo rápido.
¿Quién se beneficiaría realmente?
Las ganancias prácticas llegarían primero a los ingenieros de software y flujos de trabajo intensivos en IA. Los usuarios de Claude Code, el asistente de codificación de Anthropic, a veces esperan horas para obtener resultados. Anthropic ya vende un modo rápido a un precio premium porque la velocidad tiene un valor real. Kog se está posicionando a sí mismo como una forma de obtener esa velocidad sin el premium, utilizando la infraestructura que una empresa ya posee.
Los socios de diseño incluyen plataformas que permiten a los usuarios generar juegos y aplicaciones a partir de un aviso de texto. Para esos productos, un resultado más rápido no es solo una característica agradable; afecta directamente cuántos usuarios pagan.
Kog no está solo en este espacio. ZML, también francesa, lanzó software que puede omitir CUDA de Nvidia (la capa de software estándar que le dice a los chips Nvidia cómo trabajar) para acelerar la inferencia en diferentes hardware. Delalleau posiciona a Kog diferente, más cerca del laboratorio Hazy Research de Stanford, con un enfoque aún más bajo a nivel de ingeniería de GPU, hasta lenguaje ensamblador y código binario.
| Hecho | Detalle |
|---|---|
| Velocidad de demostración | 3.000 tokens por segundo, solicitud única |
| Modelo de prueba | Laneformer 2B (2 mil millones de parámetros, código abierto) |
| Hito objetivo | Velocidad 10x en un modelo grande importante, septiembre de 2025 |
| Clientes potenciales de la demostración | 200, a partir de mayo de 2025 |
| Tamaño del equipo | 11 personas |
| Patrocinadores de semillas | Varsity VC, Bpifrance, French Tech 2030, Scaleway |
Ese trabajo de bajo nivel es lento. Para cada nuevo modelo de GPU, Kog dedica semanas o meses estudiando cómo se comporta realmente el chip antes de escribir una sola línea de código de optimización. Con 11 personas, eso limita cuántos chips puede soportar la empresa a la vez.
La verdadera prueba de Kog no es la demostración; es si la empresa puede demostrar que el enfoque se escala antes de que un rival mejor financiado lo haga.
Preguntas frecuentes
¿Puede esto acelerar las herramientas de IA que ya uso en el trabajo?
No aún para la mayoría de las personas. Kog vende a empresas que ejecutan su propia infraestructura de IA, no a usuarios individuales. Si una empresa implementa el software de Kog en sus servidores, es posible que notes resultados más rápidos sin saber por qué.
¿Qué significa "velocidad de inferencia" realmente para mí?
Cada vez que una herramienta de IA responde a una pregunta o escribe código, esa es una inferencia. Una inferencia más rápida significa esperas más cortas y costos de ejecución más bajos para la empresa que proporciona la herramienta, lo que puede traducirse en precios más bajos o productos mejores con el tiempo.
¿Está probada la gran afirmación de Kog?
No en modelos grandes. El resultado de 3.000 tokens por segundo utilizó un modelo pequeño y construido especialmente. Entregar ganancias comparables en los modelos mucho más grandes que potencian las herramientas de IA convencionales es la siguiente prueba más difícil de la empresa.



