Tecnología
TutorMoments mide cuándo los LLM ayudan demasiado en contextos educativos
TutorMoments evalúa LLMs usando 462 transcripciones reales de sesiones de tutoría matemática uno a uno, anotadas por 27 docentes con experiencia. El sistema pausa la transcripción en momentos de decisión pedagógica, entrega la sesión al LLM durante cinco turnos con un estudiante simulado por otro modelo, y evalúa si el tutor aplicó andamiaje, presión cognitiva o sobre-andamiaje. Los modelos evaluados con un prompt neutro tienden a dar demasiada ayuda; especificar la tensión en el prompt mejora el rendimiento pero no cierra la brecha con tutores humanos. El dataset, el código y los replays están disponibles de forma abierta en Hugging Face y GitHub. Esto es relevante para equipos que construyen productos edtech o herramientas de aprendizaje asistido por IA.
Tu acción
Revisa el dataset de TutorMoments en Hugging Face y evalúa si el pipeline de scoring puede adaptarse para medir la calidad de respuestas en el dominio de tu producto educativo.