Los tutores de IA son demasiado útiles. Una nueva prueba muestra que luchan por saber cuándo retroceder
Investigadores del Allen Institute for AI crearon un benchmark utilizando transcripciones reales de aulas para determinar si los tutores de IA pueden tomar la decisión más difícil en la enseñanza: cuándo ayudar a un estudiante y cuándo dejar que luche con un problema.

Puntos clave
- El Allen Institute for AI lanzó TutorMoments, un benchmark que utiliza 462 transcripciones reales de sesiones de tutoría individual de matemáticas para probar qué tan bien los tutores de IA juzgan cuándo ayudar y cuándo contenerse.
- El conjunto de datos incluye más de 1.500 puntos de decisión marcados por 27 maestros de matemáticas estadounidenses experimentados de grados 2 a 7.
- Se probaron siete modelos de lenguaje grandes, la tecnología detrás de chatbots como ChatGPT y Claude; todos ellos tendieron a ayudar excesivamente a los estudiantes cuando no recibieron instrucciones específicas.
- Dar a un modelo una indicación más detallada mejoró sus puntuaciones, pero ningún modelo coincidió consistentemente con el juicio que los tutores humanos demostraron en los mismos momentos.
- El benchmark y el conjunto de datos están disponibles gratuitamente, publicados en parte a través del repositorio de datos de Hugging Face.
Un buen tutor de matemáticas, cuando un estudiante está atrapado, generalmente hace una pregunta en lugar de responder una. "¿Qué ya sabes sobre este problema?" Esa pausa, ese pequeño rechazo que devuelve el problema al estudiante, es deliberada. Es así como el aprendizaje perdura.
Los chatbots de IA están diseñados para hacer lo opuesto. Su propósito completo es ser útiles, lo que en un contexto de tutoría a menudo significa explicar el concepto, exponer los pasos y llevar al estudiante directamente a la respuesta. Esto elude el pensamiento esforzado que los investigadores dicen que es central para realmente comprender algo.
Un equipo del Allen Institute for AI quería saber cuán grave es realmente el problema. Hemos estado monitoreando de cerca el trabajo del instituto: su modelo de riesgo de incendios cubierto el 28 de julio mostró el mismo apetito de la organización por implementar IA en contextos del mundo real de alto riesgo.
¿Cómo funciona realmente TutorMoments?
Los investigadores construyeron un benchmark llamado TutorMoments alrededor de sesiones de tutoría reales, no escenarios inventados. Recopilaron 462 transcripciones de un programa de tutoría estadounidense que sirve principalmente a escuelas de bajos ingresos, eliminaron todos los detalles de identificación y las entregaron a 27 maestros de matemáticas experimentados.
Los maestros leyeron cada transcripción y marcaron los momentos donde un tutor enfrentaba una opción genuina: facilitar el problema para entrar, o empujar al estudiante a razonar más profundamente. Esos momentos marcados se convirtieron en la prueba.
En cada punto marcado, un modelo de lenguaje grande toma el control de la sesión durante cinco intercambios, con un segundo modelo de lenguaje jugando el papel del estudiante. Un sistema de puntuación verifica entonces si el tutor de IA tomó la decisión correcta, basándose en lo que los maestros dijeron que el estudiante realmente necesitaba.
Se miden tres cosas: si el modelo brindó apoyo apropiado cuando fue necesario, impulsó un pensamiento más profundo cuando el estudiante estaba listo, y evitó dar más ayuda de la que el momento requería.
¿Qué hicieron realmente los tutores de IA?
Todos los modelos probados tendieron a ayudar excesivamente. Con una instrucción simple de "tutorear bien", los siete modelos se inclinaron hacia explicar en lugar de empujar a los estudiantes a pensar.
Cuando los investigadores reescribieron la indicación para explicar claramente la compensación, las puntuaciones mejoraron. Pero ningún modelo tomó la decisión correcta de manera confiable como lo hace un maestro experimentado.
Los resultados a continuación muestran puntuaciones entre 0 y 1, donde 1 significa que el modelo tomó la decisión correcta en cada momento relevante.
| Tipo de indicación | Andamiaje apropiado | Rigor apropiado | Evita andamiaje excesivo |
|---|---|---|---|
| Tutores humanos (referencia) | 0.458 | 0.182 | 0.496 |
| Indicación simple (promedio de IA) | Por debajo de humano | Cerca de cero | Bajo |
| Indicación consciente de evaluación (mejor IA) | Por encima de humano | Más alto | Más alto |
Una advertencia importante: las puntuaciones de los tutores humanos se ven bajas porque el conjunto de datos fue construido deliberadamente alrededor de oportunidades perdidas, momentos donde los maestros sintieron que algo mejor podría haberse hecho. Los números humanos no son un retrato de la enseñanza ideal.
¿Qué significa esto para los estudiantes que utilizan herramientas de tutoría de IA?
Si tu hijo está usando una aplicación de tutoría de IA, probablemente está haciendo demasiada del pensamiento por él. Eso se siente útil en el momento. Con el tiempo, puede que no lo sea.
Los investigadores no están diciendo que los tutores de IA sean inútiles. Están diciendo que el campo necesita mejores formas de medir esta habilidad específica. Un modelo que nunca da la respuesta no es automáticamente un buen tutor; lo que importa es si lee correctamente al estudiante en cada momento individual.
El informe técnico y el conjunto de datos están disponibles públicamente a través de un informe técnico y el conjunto de datos en Hugging Face, para que investigadores y empresas que construyen herramientas de tutoría de IA puedan probar sus propios modelos contra los mismos puntos de decisión del mundo real.
Observa si la herramienta de tutoría de IA que usa tu estudiante hace preguntas o simplemente responde. Una herramienta que siempre explica no es tutoría. Es hacer la tarea.



