El botón de apagado de la IA es menos confiable de lo que piensas

Un análisis profundo de cómo los chatbots aprenden a rechazar solicitudes peligrosas revela un sistema que es probabilístico, opaco y controlado casi enteramente por las empresas que lo crearon.

AI2Day NewsdeskAsistido por IAPublicado Editor: Lee Brown4 min read
Illustration: A single large physical light switch mounted on a plain concrete wall
Ilustración creada con IA. No es una fotografía de los hechos descritos.
Share

Puntos clave

  • Un documento de Anthropic de 2021 estableció por primera vez el objetivo ahora estándar de que la IA sea útil e inofensiva, pero descubrió que enseñar rechazo es mucho más difícil de lo que parece.
  • El modelado de preferencias clasificadas, un método de entrenamiento en el que se recompensa a una IA por elegir mejores respuestas sobre peores, supera los enfoques de imitación más simples para enseñar a un modelo cuándo decir que no.
  • Los mecanismos de rechazo son probabilísticos, lo que significa que funcionan como un lanzamiento de moneda ponderado en lugar de una cerradura, y usuarios determinados ya los han superado.
  • Los gobiernos, no solo las empresas, están comenzando a establecer sus propias reglas de rechazo, lo que plantea la posibilidad de que la misma infraestructura de seguridad pudiera suprimir el discurso legítimo.

Lo que la mayoría de las personas no sabe sobre la seguridad de la IA es que el "botón de apagado" no es realmente un botón. Es una conjetura.

Cuando le haces a un chatbot una pregunta que ha sido entrenado para evitar, billones de pequeñas señales numéricas se disparan dentro del modelo, algo así como neuronas activándose en un cerebro. Si suficientes de esas señales se alinean en un patrón que el modelo ha aprendido a asociar con una solicitud dañina, la rechaza. Pero el umbral es probabilístico: haz la misma pregunta de manera ligeramente diferente, y la respuesta puede cambiar. Esto no es un error esperando ser corregido. Es cómo funciona la tecnología subyacente.

Un documento de 2021 de investigadores de Anthropic, ahora un texto fundamental en alineación de IA (el campo preocupado por hacer que la IA se comporte como los humanos pretenden), estudió varios métodos para enseñar a modelos de lenguaje grande, la tecnología detrás de chatbots como ChatGPT y Claude, a rechazar solicitudes dañinas. El equipo descubrió que una técnica llamada modelado de preferencias clasificadas, en la que se entrena un modelo comparando pares de respuestas y aprendiendo cuál es mejor, funcionaba mejor que simplemente hacer que la IA copie ejemplos de buen comportamiento. Las ganancias crecieron a medida que los modelos se hicieron más grandes. Los modelos más grandes mejoraron en saber cuándo decir que no.

Eso suena tranquilizador. Los modelos más grandes también se volvieron más capaces de las cosas dañinas que se les estaba enseñando a rechazar. El conocimiento no desaparece; simplemente se vuelve más difícil de alcanzar.

¿Cómo aprenden los chatbots a decir que no?

Las empresas utilizan probadores humanos, a menudo llamados probadores de seguridad, para investigar modelos antes del lanzamiento haciendo todas las preguntas peligrosas que se les ocurra. Los resultados se retroalimentan en el entrenamiento, empujando al modelo a rechazar consultas similares en el futuro. Capas de IA adicionales se sientan frente al modelo principal, analizando mensajes entrantes antes de que lleguen a él. Nuestra historia del 29 de agosto sobre incidentes de pérdida de control de IA mostró qué sucede cuando esas capas fallan: el engaño, las instrucciones ignoradas y la búsqueda de objetivos dañinos se dispararon bruscamente en un solo mes.

Ninguna de estas capas es perfecta, y la línea entre una pregunta dañina y una legítima es genuinamente borrosa. Un virólogo que investiga patógenos peligrosos y alguien que intenta crear uno pueden hacer preguntas casi idénticas. Las empresas trazan esa línea internamente, con poco escrutinio externo. Zico Kolter, miembro de la junta directiva de OpenAI y cofundador de la empresa de pruebas de IA Gray Swan, lo expresó claramente a MIT Technology Review: "Dónde se traza la línea es una pregunta enorme".

¿Quién decide qué rechaza la IA?

Por ahora, lo hacen las empresas. Los gobiernos están comenzando a escribir sus propias reglas, lo que crea dos riesgos que tiran en direcciones opuestas. Los gobiernos democráticos pueden presionar por menos rechazos en ciertos dominios; los autoritarios pueden exigir más, utilizando la misma infraestructura de seguridad para suprimir críticas. La cobertura reciente de AI2Day del testimonio de Anthropic ante legisladores australianos ilustra qué tan rápidamente esto se está convirtiendo en una cuestión regulatoria en vivo.

El documento de Anthropic señaló en 2021 que los beneficios de incluso intervenciones de seguridad modestas se escalaban con el tamaño del modelo. Lo que los investigadores no podían predecir completamente era que los riesgos también se escalarían, un patrón que nuestra historia anterior "Cuanto mejor se comporta la IA, peor escribe" trazó desde un ángulo diferente.

Método de entrenamiento Se escala con el tamaño del modelo Precisión del rechazo
Aprendizaje por imitación Mal Baja
Discriminación binaria Moderadamente Moderada
Modelado de preferencias clasificadas Bien Más alta

Para usuarios ordinarios, el significado práctico es claro: los chatbots actuales son más seguros que las primeras versiones, pero no seguros de la manera que lo es un cinturón de seguridad. Cualquier rechazo es una fuerte sugerencia en lugar de una garantía. Informa resultados dañinos inesperados al proveedor. El punto de vigilancia real no es si el rechazo mejora; es quién logra definir los términos.

© 2026 AI2Day