// INTELIGENCIA ARTIFICIAL
Medir la alucinación: construir un conjunto de evaluación
7 min de lecturanijitech
«El modelo a veces se inventa cosas» es una observación, no una medida. No se puede afirmar haber arreglado un problema que no se mide. Una forma práctica de hacerlo.
Artículo completo
Una de las frases más repetidas en los proyectos de IA es esta: «el modelo a veces se inventa cosas». Eso es una observación, no una medida. No dice con qué frecuencia se lo inventa, en qué tipo de pregunta, ni si el cambio de ayer mejoró o empeoró las cosas.
Y no se puede afirmar haber arreglado un problema que no se sabe medir. Un conjunto de evaluación —un eval, para abreviar— cierra ese hueco: una batería de pruebas con preguntas conocidas y respuestas esperadas, que se ejecuta después de cada cambio.
1. Los ejemplos deben ser reales, no representativos
El primer error de un conjunto de evaluación suele cometerse aquí: las preguntas se inventan en el escritorio. Lo que corresponde al conjunto es la entrada que el sistema encuentra de verdad: preguntas reales que escribieron usuarios, documentos reales que llegaron, casos límite reales que ocurrieron.
Qué contiene un buen conjunto
- Casos corrientes y normales: ahí está el grueso del volumen
- Casos límite conocidos: campo ausente, formato inesperado, entrada muy larga
- Ejemplos que se sabe que fallaron antes: cada fallo corregido entra en el conjunto
- Preguntas cuya respuesta debería ser «no lo sé»
Ese último punto es el que más se salta y el más útil. Que un modelo sepa cuándo callar importa tanto como que dé la respuesta correcta.
2. La respuesta esperada hay que escribirla
Para cada ejemplo se escribe de antemano la respuesta correcta. En sistemas que producen texto libre esto parece difícil, pero en la mayoría de los casos lo que se puede definir no es la respuesta entera sino los elementos que debe y no debe contener: «debe dar esta cifra», «debe citar esta fuente», «no debe comprometer un precio».
3. La puntuación no debe reducirse a un solo número
Un único porcentaje de acierto es tranquilizador y engañoso. Un noventa por ciento no dice en qué tipos de pregunta se juntó el diez por ciento restante. Divida el conjunto en categorías y puntúe cada una por separado: se vuelve visible dónde se produjo la caída.
La alucinación pide una medida propia: ¿se produjo información sin fuente? Eso no es lo mismo que «la respuesta era incorrecta». Una respuesta incorrecta es un problema de precisión; una respuesta sin fuente es un problema de confianza.
4. El conjunto debe correr tras cada cambio
El valor real de un conjunto de evaluación no aparece en la primera pasada sino en la segunda. Cuando cambia el modelo, se actualiza la instrucción o se recorta el contexto, el conjunto vuelve a correr y le dice qué categoría empeoró.
Es lo mismo que las pruebas de regresión en software, con una diferencia: en software la misma entrada da la misma salida, y con un modelo puede que no. Así que el umbral debe mirar la media de varias pasadas, no una sola.
Por dónde empezar
Factible en la primera semana
- Reúna treinta entradas reales del último mes
- Para cada una, escriba qué debe y qué no debe contener la respuesta esperada
- Reparta los ejemplos en tres o cuatro categorías
- Ejecútelo una vez; ese número no es bueno ni malo, es su punto de partida
Treinta ejemplos parecen pocos, pero son infinitamente mejor que cero. La ganancia real empieza en la segunda pasada.
Productos mencionados en este artículo
Del glosario: Alucinación · Conjunto de evaluación (eval)