¿Realmente Necesitan los Modelos de IA Olvidarlo Todo? Investigadores de Apple Dicen que No

Un nuevo estudio descubre que gran parte de lo que pedimos que los modelos de IA "olviden" apenas importó en primer lugar, lo que podría reducir drásticamente el costo de las correcciones de privacidad.

AI2Day NewsdeskUpdated Editor: Lee Brown3 min read
Photoreal news-editorial 16:9 image of a large glowing data centre server room at night, rows of illuminated blue and white server racks receding into the dista
Share

Puntos clave

  • Los investigadores de Apple ML Research identificaron subconjuntos de datos de entrenamiento con tan poca influencia que su eliminación podría ser innecesaria.
  • Los métodos actuales de desaprendizaje de IA tratan todos los datos por igual, incluso cuando algunos apenas afectaron el comportamiento del modelo.
  • Omitir la eliminación de estos puntos de datos de bajo impacto podría reducir el tiempo de computación y el costo de las actualizaciones de modelos relacionadas con la privacidad.
  • Los hallazgos aplican tanto a modelos de lenguaje (los que potencian chatbots) como a modelos de visión (IA que analiza imágenes).

Cuando le pides a una empresa que elimine tus datos, probablemente asumes que la IA entrenada con ellos cambiará. Los investigadores de Apple ML Research ahora sugieren que esa suposición frecuentemente es incorrecta, y esa brecha podría ahorrar mucho dinero.

Los modelos de IA aprenden procesando enormes cantidades de datos. Después del entrenamiento, algunos de esos datos dejan una huella fuerte en cómo se comporta el modelo. Otros apenas se registran. Esta nueva investigación se enfoca en esa segunda categoría, y es la continuación del trabajo de Apple ML Research que hemos cubierto dos veces esta semana.

El desaprendizaje automático significa enseñar a un modelo de IA entrenado a comportarse como si nunca hubiera visto un dato específico. Las leyes de privacidad en varios países ya empujan a las empresas hacia esta capacidad. El problema es el costo: los métodos actuales de desaprendizaje tratan cada elemento de la lista de olvido de la misma manera, ya sea que ese elemento haya formado el modelo fuertemente o apenas lo haya tocado.

El equipo de Apple utilizó funciones de influencia, una técnica que mide cuánto cada ejemplo de entrenamiento individual realmente cambió el comportamiento final del modelo. Piénsalo como revisar recibos después de una fiesta: algunas compras movieron la aguja en la factura total, otras eran ruido. Una parte significativa de los datos de entrenamiento, encontraron los investigadores, cae en esa categoría de ruido.

Si un punto de datos tuvo un impacto negligible en el modelo, omitir su eliminación formal produce resultados casi idénticos a hacer la eliminación completa, a una fracción del costo de computación. Las GPU, los chips especializados que manejan el procesamiento numérico pesado de la IA, no son baratos de ejecutar. Menos horas de GPU significa dinero real ahorrado.

El hallazgo se mantuvo en tareas de lenguaje y reconocimiento de imágenes.

¿Significa esto que las empresas pueden ignorar las solicitudes de eliminación?

No. La investigación no le da a las empresas un permiso legal para ignorar las solicitudes de privacidad. Lo que sugiere es que los ingenieros que construyen herramientas de desaprendizaje podrían priorizar los puntos de datos de alto impacto y acelerar de forma segura los de bajo impacto, reduciendo costos sin dañar el resultado.

Para las personas ordinarias, la implicación honesta es incómoda: los datos que contribuyes a un sistema de IA no afectan ese sistema por igual. Tu interacción podría ser formativa, o podría ser ruido de fondo.

El sesgo de supervivencia vale la pena señalar aquí. Los investigadores identificaron los casos de bajo impacto, pero el trabajo costoso permanece para datos de alto impacto, precisamente los registros sensibles más probables de importar en una disputa de privacidad real.

La parte que se está sobrevalorado, en mi lectura, es la facilidad del triage en sí. Las funciones de influencia tampoco son un cálculo barato, y a escala el costo de clasificar datos en "importa" y "no importa" puede comerse los ahorros que este método promete. Observa si equipos independientes pueden replicar la reducción de costos en modelos de tamaño de producción.

Qué hacer ahora: Si tu empresa maneja modelos de IA y datos de usuarios, pregunta a tu equipo técnico qué datos en tu conjunto de entrenamiento realmente mueven la aguja. Podrías estar pagando para olvidar cosas que el modelo nunca realmente aprendió.

© 2026 AI2Day