Diseño
NNgroup: una sola salida de IA no es evaluación, es un ejemplo
El artículo parte de un dato concreto: el mismo sistema de IA puede responder correctamente, omitir excepciones importantes o prometer algo incorrecto ante la misma pregunta, dependiendo de la ejecución. Esto invalida la práctica habitual de probar una herramienta una vez y declarar si funciona o no. NNgroup propone tratar la evaluación de IA como un estudio cuantitativo de UX: definir un conjunto de entradas representativas, ejecutar cada una varias veces y calcular promedios con variabilidad. El ejemplo concreto del artículo usa 10 preguntas × 5 ejecuciones = 50 respuestas evaluadas con criterios predefinidos. Para diseñadores que trabajan con prototipos o flujos impulsados por IA, esto cambia cómo se valida una decisión de producto.
Tu acción
Define un conjunto de 5 a 10 entradas representativas para la funcionalidad de IA que estés diseñando o evaluando, ejecuta cada una tres veces y documenta la variabilidad antes de recomendar su implementación.