Los tutores de IA son demasiado serviciales. Una nueva prueba muestra que les cuesta saber cuándo dejar de ayudar
Investigadores del Allen Institute for AI crearon un benchmark usando transcripciones reales de aulas para determinar si los tutores de IA pueden tomar la decisión más difícil en la enseñanza: cuándo ayudar a un estudiante y cuándo dejarlo luchar con un problema por su cuenta.

Puntos clave
- El Allen Institute for AI lanzó TutorMoments, un benchmark basado en 462 transcripciones reales de sesiones de tutoría individual de matemáticas para evaluar qué tan bien los tutores de IA juzgan cuándo ayudar y cuándo contenerse.
- El conjunto de datos incluye más de 1.500 puntos de decisión identificados por 27 maestros de matemáticas estadounidenses experimentados de grados 2 a 7.
- Se probaron siete modelos de lenguaje grande, la tecnología detrás de chatbots como ChatGPT y Claude; todos ellos tendieron a ayudar demasiado cuando no recibieron instrucciones específicas.
- Proporcionar al modelo un indicador más detallado mejoró sus puntuaciones, pero ningún modelo igualó consistentemente el criterio que los tutores humanos demostraron en los mismos momentos.
- El benchmark, conjunto de datos y código están disponibles gratuitamente, publicados en parte a través del repositorio de datos Hugging Face.
Un buen tutor de matemáticas, cuando un estudiante está atrapado, generalmente hace una pregunta en lugar de responder. "¿Qué ya sabes sobre este problema?" Esa pausa, ese pequeño contraataque hacia el estudiante, es deliberada. Es cómo el aprendizaje se queda.
Los chatbots de IA están diseñados para hacer lo opuesto. Su propósito completo es ser útiles, lo que en un contexto de tutoría a menudo significa explicar el concepto, exponer los pasos e llevar al estudiante directamente a la respuesta. Esto interrumpe el pensamiento esforzado que los investigadores dicen que es central para entender realmente algo.
Un equipo del Allen Institute for AI quería saber cuán grave es realmente el problema y si se puede solucionar.
¿Cómo funciona realmente TutorMoments?
Los investigadores construyeron un benchmark llamado TutorMoments alrededor de sesiones de tutoría reales, no escenarios inventados. Recopilaron 462 transcripciones de un programa de tutoría estadounidense que sirve principalmente a escuelas de bajos ingresos, eliminaron todos los detalles identificables y entregaron las transcripciones a 27 maestros de matemáticas experimentados.
Los maestros leyeron cada transcripción y marcaron los momentos en los que un tutor enfrentaba una opción genuina: hacer el problema más fácil de abordar o impulsar al estudiante a razonar más. Esos momentos marcados se convirtieron en la prueba.
En cada punto marcado, un modelo de lenguaje grande toma el control de la sesión durante cinco intercambios, con un segundo modelo de lenguaje jugando el papel del estudiante. Un sistema de puntuación verifica entonces si el tutor de IA tomó la decisión correcta en ese momento, basándose en lo que los maestros dijeron que el estudiante realmente necesitaba.
Las tres cosas que se miden son si el modelo proporcionó apoyo apropiado cuando fue necesario, impulsó el pensamiento más profundo cuando el estudiante estaba listo y evitó dar más ayuda de la que el momento requería.
¿Qué hicieron realmente los tutores de IA?
Todos los modelos probados tendieron a ayudar demasiado. Con la simple instrucción de "tutoría bien", los siete modelos se inclinaron hacia explicar y guiar en lugar de impulsar a los estudiantes a pensar.
Cuando los investigadores reescribieron el indicador para explicitar el dilema, las puntuaciones mejoraron en todos los frentes. Pero ningún modelo tomó de forma confiable la decisión correcta como lo hace un maestro experimentado.
Los resultados a continuación muestran puntuaciones entre 0 y 1, donde 1 significa que el modelo tomó la decisión correcta en cada momento relevante.
| Tipo de indicador | Andamiaje apropiado | Rigor apropiado | Evita exceso de andamiaje |
|---|---|---|---|
| Tutores humanos (referencia) | 0.458 | 0.182 | 0.496 |
| Indicador simple (promedio de IA) | Por debajo de humano | Casi cero | Bajo |
| Indicador consciente de evaluación (mejor de IA) | Por encima de humano | Mayor | Mayor |
Una advertencia importante: las puntuaciones de los tutores humanos se ven bajas porque el conjunto de datos se construyó deliberadamente alrededor de oportunidades perdidas, momentos en los que los maestros sintieron que se podría haber hecho algo mejor. Entonces los números humanos no son un retrato de la enseñanza ideal.
¿Qué significa esto para los estudiantes que usan herramientas de tutoría de IA?
Si tu hijo o estudiante está usando una aplicación de tutoría de IA, la aplicación probablemente esté haciendo demasiado del pensamiento por ellos. Eso se siente útil en el momento. Con el tiempo, puede no serlo.
Los investigadores no están diciendo que los tutores de IA sean inútiles. Están diciendo que el campo necesita mejores formas de medir y entrenar esta habilidad específica. Un modelo que nunca da la respuesta no es automáticamente un buen tutor; lo que importa es si lee correctamente al estudiante en cada momento individual.
El conjunto de datos completo, el código del benchmark y un informe técnico están disponibles públicamente, así como el conjunto de datos en Hugging Face, para que otros investigadores y empresas que desarrollan herramientas de tutoría de IA puedan probar sus propios modelos contra los mismos puntos de decisión del mundo real.
Qué observar si usas una herramienta de tutoría de IA: fíjate si te hace preguntas o simplemente las responde. Una herramienta que siempre explica no es tutoría. Es hacer la tarea.



