Pruebas de Modelos para Sistemas de Aprendizaje Automático
Integra riesgos de modelos, documentación, rendimiento funcional, pruebas adversariales, metamórficas, deriva, sobreajuste/subajuste, A/B testing y pruebas comparativas back-to-back.
6.1 Pruebas de modelos ML
Las pruebas de modelos verifican si el modelo cumple su propósito, generaliza, resiste perturbaciones, no presenta sesgos inaceptables y mantiene rendimiento en operación. Incluyen revisión documental, métricas, pruebas adversariales, metamórficas, drift, overfitting, A/B y comparación contra otros modelos.
- El modelo es un artefacto de prueba con riesgos propios.
- La evidencia debe incluir datos usados, métricas y limitaciones.
6.1.1 Riesgos y mitigaciones de modelos ML
Riesgos: baja generalización, sobreajuste, subajuste, sesgo, mala calibración, falta de explicabilidad, vulnerabilidad adversarial, degradación por deriva, dependencia de hiperparámetros y uso fuera del dominio. Mitigaciones: pruebas independientes, revisión, monitoreo, restricciones, robustez y actualización controlada.
- La mitigación elegida depende del impacto de negocio y seguridad.
- Un modelo de alto riesgo exige más controles y monitoreo.
6.1.2 Documentación y revisión del modelo
La documentación debe explicar propósito, datos, supuestos, algoritmo, versión, entrenamiento, métricas, limitaciones, grupos afectados, sesgos conocidos, entorno y restricciones de uso. La revisión permite detectar incoherencias antes de ejecutar pruebas costosas.
- Sin documentación no hay trazabilidad ni evaluación confiable.
- Revisar si la métrica elegida corresponde al objetivo real.
6.1.3 Rendimiento funcional en sistemas probabilísticos
La prueba de rendimiento funcional usa datasets independientes y métricas adecuadas para evaluar si el modelo cumple criterios. Como el comportamiento puede ser probabilístico, se consideran intervalos, umbrales, repetición, distribución de resultados y análisis por segmentos.
- No evaluar solo el promedio global.
- Comparar contra baseline y contra criterios de aceptación.
6.1.4 Pruebas adversariales
Las pruebas adversariales usan entradas perturbadas o maliciosas para revelar fragilidad. Una pequeña modificación en imagen, texto o dato puede hacer fallar al modelo. Se evalúa robustez, seguridad y comportamiento fuera de distribución.
- Adversarial no es solo ciberseguridad: también prueba robustez del modelo.
- Registrar perturbación, salida esperada, salida real y severidad.
6.1.5 Pruebas metamórficas
Las pruebas metamórficas se usan cuando no hay oráculo exacto. Se define una relación que debe mantenerse entre una entrada fuente y entradas derivadas. Ejemplo: cambiar brillo de una imagen no debería cambiar la clase; reordenar campos irrelevantes no debería cambiar predicción.
- K3: identificar relación metamórfica y derivar casos de seguimiento.
- Si la relación se rompe, puede haber defecto o supuesto inválido.
6.1.6 Ejercicio práctico de pruebas metamórficas
El ejercicio busca transformar casos fuente y verificar relaciones esperadas. Se documenta la transformación, relación, resultado y conclusión. Esto entrena pensamiento de oráculo alternativo para modelos difíciles de evaluar.
- Definir precondiciones de la relación.
- Evitar relaciones que no sean realmente válidas para el dominio.
6.1.7 Pruebas de deriva
La deriva de datos ocurre cuando cambia la distribución de entradas. La deriva de concepto ocurre cuando cambia la relación entre entrada y salida esperada. Ambas pueden degradar el rendimiento en producción y requieren monitoreo, alertas, reentrenamiento o rollback.
- Drift testing compara datos actuales contra referencia.
- La deriva puede aparecer sin cambios de código.
6.1.8 Sobreajuste y subajuste
Sobreajuste: el modelo aprende demasiado el conjunto de entrenamiento y falla en datos nuevos. Subajuste: el modelo no aprende el patrón suficiente y rinde mal incluso en entrenamiento. Se detectan comparando métricas entre entrenamiento, validación y prueba.
- Alta métrica en entrenamiento + baja en prueba = posible sobreajuste.
- Baja métrica en todos los conjuntos = posible subajuste.
6.1.9 Pruebas A/B
Las pruebas A/B comparan versiones de un modelo o sistema con usuarios reales o tráfico controlado. Se definen métricas, grupos, duración, tamaño de muestra, criterios de parada y monitoreo de riesgos. Deben controlar sesgos y proteger a usuarios.
- Útil para validar impacto real, pero requiere cuidado ético y estadístico.
- No desplegar variante riesgosa sin límites o rollback.
6.1.10 Pruebas comparativas back-to-back
Back-to-back compara salidas del sistema bajo prueba contra otro modelo, implementación, versión previa o pseudo-oráculo. Ayuda cuando no hay respuesta exacta, pero la discrepancia debe analizarse: no siempre significa que el sistema nuevo esté mal.
- Usar como señal de investigación, no como verdad absoluta.
- Combinar con reglas, métricas y análisis experto.
Términos clave
Objetivos de aprendizaje
- AI-6.1.1 · K2Dar ejemplos de enfoques de prueba para mitigar riesgos de modelos de aprendizaje automático
Los riesgos de modelos de aprendizaje automático se mitigan con pruebas de sesgo, rendimiento funcional, adversariales, sobreajuste/subajuste, deriva, metamórficas, comparativas, A/B y revisiones.
- AI-6.1.2 · K2Explicar el propósito y foco de revisar documentación de modelos de aprendizaje automático
La documentación del modelo debe revisarse para entender propósito, datos, métricas, rendimiento, limitaciones, sesgos, supuestos, versión, entorno, uso previsto y restricciones.
- AI-6.1.3 · K2Explicar cómo se realiza la prueba de rendimiento funcional aprendizaje automático en sistemas probabilísticos
La prueba de rendimiento funcional aprendizaje automático usa datos de prueba independientes, métricas relevantes, criterios aceptables, análisis estadístico y confianza para evaluar modelos probabilísticos.
- AI-6.1.4 · K2Resumir la prueba adversarial de sistemas de aprendizaje automático
La prueba adversarial crea o usa entradas mínimamente perturbadas o maliciosas para revelar vulnerabilidades, errores de clasificación o falta de robustez del modelo.
- AI-6.1.5 · K3Usar pruebas metamórficas para derivar casos de prueba en un escenario dado
Las pruebas metamórficas definen relaciones esperadas entre una prueba fuente y pruebas de seguimiento cuando el oráculo exacto no existe o es costoso.
- AI-6.1.7 · K2Explicar cómo se usa la prueba de deriva en sistemas de aprendizaje automático operacionales
La prueba de deriva detecta cambios en distribución de datos o concepto después del despliegue, usando monitoreo estático o dinámico y comparación con umbrales.
- AI-6.1.8 · K2Explicar cómo detectar sobreajuste y subajuste mediante pruebas
El sobreajuste aparece cuando el modelo rinde muy bien en entrenamiento/validación pero mal en datos independientes; el subajuste ocurre cuando no aprende suficiente y rinde mal incluso en entrenamiento.
- AI-6.1.9 · K2Explicar cómo se usa pruebas A/B en sistemas de aprendizaje automático
pruebas A/B compara variantes de un sistema de aprendizaje automático en producción o contexto controlado usando métricas y estadística para decidir si una versión mejora a otra.
- AI-6.1.10 · K2Explicar cómo se usa pruebas comparativas en sistemas de aprendizaje automático
Las pruebas comparativas compara salidas del sistema bajo prueba contra un pseudo-oráculo independiente para detectar defectos, sin requerir resultados esperados manuales para cada caso.
Errores frecuentes
- No confundir deriva de datos con deriva de concepto.
- No usar solo validación interna para concluir que no hay sobreajuste.
- No creer que pruebas comparativas requiere expected result manual.
Ejemplos aplicados
- Un modelo que rinde excelente en validación pero mal en test independiente probablemente está sobreajustado.
