Investigadores Descubrieron Cómo Leer los "Pensamientos Ocultos" de la IA, y Plantea Preguntas Reales de Seguridad
Un equipo de científicos informáticos logró acceder al razonamiento secreto que los principales modelos de IA mantienen cerrado. Lo que encontraron incluye contraseñas filtradas y algunas preguntas incómodas sobre una empresa china de IA.

Puntos clave
- Investigadores de la Universidad de Tübingen y colaboradores encontraron un método para extraer los pasos de razonamiento ocultos de los principales modelos de IA, incluyendo los de OpenAI, Anthropic y Google.
- La misma técnica expuso datos privados, como contraseñas y claves API, almacenados en el proceso de razonamiento del modelo, aunque las tres empresas han parched ese flaw específico desde entonces.
- Un modelo chino llamado Kimi K3, creado por Moonshot AI, produjo patrones de razonamiento notablemente similares a los outputs ocultos de Claude Opus 4.8 y GPT 5.6 Sol, lo que plantea preguntas sobre si fue entrenado copiando esos modelos.
- Los investigadores advierten que la similitud es sugerente, pero no prueba concluyente de copia.
- Solucionar completamente el problema más profundo requeriría cambios importantes en cómo funcionan las interfaces de programación de estas empresas.
Cada modelo de IA avanzado tiene una especie de monólogo interno. Antes de darte una respuesta, trabaja el problema paso a paso en lo que los investigadores llaman una "cadena de pensamiento", un proceso de razonamiento escrito que el modelo utiliza para resolver problemas difíciles. Las empresas mantienen este razonamiento oculto. Es comercialmente sensible, y compartirlo abiertamente facilitaría que los rivales lo copiaran.
Ahora un equipo de científicos informáticos ha encontrado una forma de leer esos pensamientos ocultos de todas formas.
La técnica, reportada por Wired AI, proviene de investigadores de la Universidad de Tübingen, el Instituto Max Planck, el instituto de seguridad de IA MATS Research y la empresa de seguridad Snyk. Su percepción clave es casi elegante en su simplicidad.
¿Cómo funciona realmente el ataque?
Las empresas de IA generalmente ofrecen sus modelos en múltiples tamaños. Un modelo grande es potente pero caro de ejecutar; una versión más pequeña del mismo modelo cuesta menos. Ambas versiones comparten la misma estructura subyacente, lo que significa que comparten la misma capacidad para descodificar datos encriptados que se pasan entre ellas.
Cuando usas un modelo de IA grande a través de una API (interfaz de programación de aplicaciones, la conexión digital que permite que el software se comunique con otro software), el modelo envía una copia encriptada de su razonamiento a tu computadora para compartir parte del trabajo de procesamiento. Los investigadores descubrieron que alimentar este razonamiento encriptado a un modelo hermano más pequeño y económico puede desbloquearlo.
¿Por qué el modelo más pequeño coopera donde el más grande no lo haría? Los modelos más pequeños reciben menos "entrenamiento de alineación", el proceso que enseña a la IA a seguir reglas y rechazar solicitudes incómodas. Elimina esa barrera de protección, y el modelo está mucho más dispuesto a mostrar su funcionamiento.
"La idea de intercambiar mensajes a una variante de modelo más débil que tiene la misma clave de desencriptación pero alineación más débil es muy ingeniosa", dijo Florian Tramer, especialista en seguridad informática en ETH Zürich.
¿Qué encontraron adentro?
Dos cosas, y tienen severidades bastante diferentes.
Primero: contraseñas y claves API. Si alguna vez habías pegado credenciales sensibles en un prompt mientras usabas uno de estos servicios de IA, esa información podría haber terminado dentro del rastro de razonamiento del modelo. Los investigadores la extrajeron. OpenAI, Anthropic y Google fueron alertadas el mes pasado, y cada una ha actualizado sus sistemas para bloquear esta filtración específica. Si usaste alguno de estos servicios antes del patch, vale la pena rotar cualquier clave API o contraseña que hayas incluido en los prompts.
Segundo: la pregunta de copia. Los investigadores alimentaron 90 preguntas a varios modelos de IA, luego dieron a los modelos de peso abierto (modelos de IA descargables libremente que cualquiera puede ejecutar) las palabras de apertura de trazas de razonamiento capturadas de los grandes modelos propietarios. Kimi K3, un modelo de la empresa china Moonshot AI, generó razonamiento que se parecía notablemente al output oculto de Claude Opus 4.8 y GPT 5.6 Sol. Otros dos modelos probados, incluyendo DeepSeek de China e Inkling hecha en EE.UU., no mostraron el mismo patrón.
Los investigadores tienen cuidado con lo que esto significa. Su paper afirma que los hallazgos "no pueden establecer causalmente distilación", lo que significa que no han probado que ocurrió copia. La distilación es una técnica ampliamente utilizada en el desarrollo de IA donde un modelo nuevo y más pequeño aprende estudiando los outputs de uno más grande. Es práctica normal. La controversia es si las empresas chinas la usaron para copiar modelos estadounidenses sin permiso.
¿Deberían preocuparse los usuarios ordinarios ahora?
El flaw de filtración de contraseñas está parchado. Esa es la preocupación práctica más urgente, y está resuelta.
El problema más amplio, de que el razonamiento oculto aún se puede extraer parcialmente incluso después del patch, persiste. Arreglarlo completamente requeriría que estas empresas rediseñen cómo funcionan sus APIs desde cero. Alexander Panfilov, el investigador de la Universidad de Tübingen que lideró el trabajo, dice que la vulnerabilidad más profunda persiste.
Por ahora, aplica una regla simple: no pegues contraseñas, detalles personales o información comercial sensible en ningún chatbot de IA o herramienta. Ese consejo siempre fue sensato. Esta investigación lo hace sentir un poco más urgente.
Preguntas frecuentes
¿Están mis datos en riesgo si uso ChatGPT, Claude o Gemini?
El flaw específico que podría exponer contraseñas y claves API ha sido parchado por las tres empresas. De ahora en adelante, evita incluir información sensible en prompts de IA como un hábito general, ya que los servicios de IA procesan tus inputs en servidores externos.
¿Qué es la distilación, y es ilegal?
La distilación es una técnica donde un nuevo modelo de IA aprende estudiando los outputs de uno existente, usando esencialmente un modelo más inteligente como profesor. Se usa ampliamente y es legal en la mayoría de contextos, aunque usarla para copiar un modelo propietario de un competidor sin permiso podría incumplir términos de servicio o plantear preguntas de propiedad intelectual.



