ISTQB® Certificado en Pruebas de IA v2.0 (CT-AI)

Menú de estudio de ISTQB® Certificado en Pruebas de IA v2.0 (CT-AI): teoría, objetivos, práctica, flashcards, simulacro y examen final.

📘 7 capítulos 🧠 Preguntas: 133 ⏱️ Simulacro 60 min / aprueba 29/44
CT-AI 2.0 · Capítulo 3

Aprendizaje Automático

Desarrolla las formas de ML, el flujo de trabajo, modelos preentrenados, RAG, preparación de datos, conjuntos de entrenamiento/validación/prueba, métricas de clasificación, redes neuronales profundas y medidas de cobertura.

8 objetivos LO375 min17 términos clave

3.1 Introducción al aprendizaje automático

El aprendizaje automático crea modelos a partir de datos. En lugar de programar todas las reglas, se entrena un algoritmo para encontrar patrones y producir predicciones, clasificaciones, agrupamientos o acciones. Para probar ML se debe entender qué datos se usaron, qué objetivo se optimizó y qué métrica representa el riesgo de negocio.

  • El modelo no es solo código: también incluye datos, parámetros, hiperparámetros y entorno.
  • La calidad depende de generalizar a datos nuevos, no de memorizar entrenamiento.

3.1.1 Formas de aprendizaje automático

El aprendizaje supervisado usa datos etiquetados para clasificación o regresión. El no supervisado descubre patrones sin etiquetas, como clustering o asociación. El aprendizaje por refuerzo entrena un agente mediante recompensas y castigos en un entorno. Cada forma cambia el tipo de prueba, las métricas y el oráculo.

  • Clasificación: salida categórica.
  • Regresión ML: salida numérica o continua.
  • Clustering: agrupación por similitud.
  • Refuerzo: decisiones secuenciales orientadas a recompensa.

3.1.2 Flujo de trabajo ML

El flujo de trabajo ML incluye definir problema, adquirir datos, preparar datos, seleccionar características, elegir algoritmo, entrenar, validar, ajustar hiperparámetros, evaluar, probar, desplegar y monitorear. El tester debe verificar cada fase porque un defecto temprano en datos o preparación puede afectar todo el modelo.

  • No esperar al final: los datos se prueban antes de entrenar.
  • Versionar datos, código, modelo, métricas y configuración es clave.

3.1.3 Ejercicio práctico: crear un modelo ML

El objetivo práctico es experimentar el ciclo completo: preparar datos, entrenar un modelo, evaluar métricas y observar cómo cambian los resultados si cambian datos, algoritmo o parámetros. Esto ayuda a comprender por qué las pruebas de IA no se reducen a ejecutar casos funcionales tradicionales.

  • Observar impacto de datos incompletos, etiquetas erróneas o desbalance.
  • Comparar modelos y verificar si el rendimiento se sostiene fuera del entrenamiento.

3.1.4 Modelos preentrenados, ajuste fino y RAG

Un modelo preentrenado ya aprendió patrones generales en grandes datos y se reutiliza para tareas específicas. El ajuste fino lo adapta con datos del dominio. RAG recupera información externa al momento de generar una respuesta para mejorar actualidad y trazabilidad sin reentrenar todo el modelo.

  • Riesgos de preentrenado: sesgos heredados y desconocimiento de datos originales.
  • Riesgos de fine-tuning: sobreajuste al dominio o datos incorrectos.
  • Riesgos de RAG: fuentes incorrectas, recuperación incompleta y contexto mal usado.

3.2 Datos para aprendizaje automático

Los datos son parte central del sistema. Deben ser relevantes, representativos, suficientes, consistentes, etiquetados correctamente y adecuados para la población objetivo. La preparación incluye adquisición, limpieza, transformación, aumento, muestreo, ingeniería de características y separación de conjuntos.

  • Datos malos producen modelos malos aunque el algoritmo sea avanzado.
  • La fuga de datos entre entrenamiento y prueba invalida la evaluación.

3.2.1 Actividades de preparación de datos

La preparación convierte datos crudos en datos útiles: limpieza de valores faltantes, corrección de formatos, detección de outliers, normalización, codificación, aumento, muestreo, selección de características y etiquetado. Las pruebas revisan reglas, integridad, consistencia y trazabilidad.

  • EDA ayuda a descubrir patrones, anomalías y sesgos antes del entrenamiento.
  • La ingeniería de características puede mejorar rendimiento o introducir sesgo.

3.2.2 Ejercicio práctico de preparación de datos

El ejercicio práctico busca observar cómo la calidad de preparación afecta el resultado: limpiar datos, dividir conjuntos, revisar distribución, crear características y entrenar un modelo. Sirve para entender que una métrica alta puede ser falsa si los datos no representan el mundo real.

  • Probar división train/validation/test.
  • Revisar balance de clases y distribución por grupos relevantes.

3.3 Métricas de rendimiento funcional ML para clasificación

Para clasificación se usan métricas derivadas de la matriz de confusión: verdadero positivo, falso positivo, verdadero negativo y falso negativo. Exactitud, precisión, recobrado y F1 se interpretan según el riesgo. Por ejemplo, en fraude puede importar recobrado; en bloqueo de clientes puede importar precisión.

  • Exactitud puede engañar con clases desbalanceadas.
  • La métrica elegida debe reflejar impacto de errores.

3.3.1 Cálculo de métricas desde matriz de confusión

Precisión = TP/(TP+FP), recobrado = TP/(TP+FN), F1 = 2*(precisión*recobrado)/(precisión+recobrado), exactitud = (TP+TN)/(TP+FP+TN+FN). En preguntas K3, calcula con cuidado qué es positivo real y qué es positivo predicho.

  • FP: predijo positivo y era negativo.
  • FN: predijo negativo y era positivo.
  • F1 equilibra precisión y recobrado.

3.4 Redes neuronales

Una red neuronal tiene neuronas, pesos, sesgos, funciones de activación, capas y proceso de entrenamiento mediante pérdida y ajuste de pesos. Las redes profundas tienen varias capas y pueden aprender representaciones complejas. Son poderosas pero difíciles de explicar y vulnerables a datos sesgados o ataques.

  • Perceptrón: forma simple de neurona/modelo.
  • DNN: varias capas; CNN para patrones espaciales; RNN/transformers para secuencias y lenguaje.

3.4.3 Medidas de cobertura para redes neuronales

La cobertura de redes neuronales mide qué neuronas, rangos o secciones se activan durante pruebas. Ayuda a comparar conjuntos de prueba, pero no equivale a cobertura de código ni garantiza ausencia de defectos. Debe usarse junto con métricas, datos representativos y pruebas adversariales/metamórficas.

  • Neuron coverage y k-multisection coverage son indicadores, no garantía de calidad.
  • Alta cobertura neuronal no demuestra que el modelo generalice.

Términos clave

aprendizaje supervisadoaprendizaje no supervisadoaprendizaje por refuerzoclasificaciónregresión MLclusteringasociaciónflujo de trabajo MLmodelo preentrenadoajuste finoRAGmatriz de confusiónprecisiónrecobradoF1red neuronalcobertura neuronal

Objetivos de aprendizaje

  1. AI-3.1.1 · K2Distinguir entre las diferentes formas de aprendizaje automático

    El aprendizaje supervisado usa datos etiquetados para clasificación o regresión; el no supervisado descubre patrones como clustering o asociación; el aprendizaje por refuerzo aprende mediante recompensas y acciones.

  2. AI-3.1.2 · K2Resumir el flujo de trabajo usado para crear un sistema de ML

    El flujo de trabajo aprendizaje automático incluye definir el problema, preparar datos, seleccionar algoritmo, entrenar, validar, evaluar, probar, desplegar, monitorear y repetir de forma iterativa.

  3. AI-3.1.4 · K2Resumir el uso de modelos preentrenados, ajuste fino y generación aumentada por recuperación

    Un modelo preentrenado reutiliza conocimiento previo; el ajuste fino lo adapta con datos específicos; RAG recupera información externa relevante sin modificar necesariamente el modelo base.

  4. AI-3.2.1 · K2Explicar las actividades relacionadas con la preparación de datos

    La preparación de datos incluye adquisición, análisis exploratorio, preprocesamiento, limpieza, muestreo, aumento, etiquetado, división de conjunto de datos y control de calidad.

  5. AI-3.2.3 · K2Contrastar el uso de conjuntos de entrenamiento, validación y prueba en el desarrollo de un modelo de aprendizaje automático

    El conjunto de datos de entrenamiento crea el modelo, el de validación ajusta o selecciona configuraciones y el de prueba evalúa rendimiento final en datos no vistos.

  6. AI-3.3.1 · K3Calcular métricas comunes de rendimiento funcional de aprendizaje automático a partir de una matriz de confusión

    Las métricas como exactitud, precisión, recobrado y puntuación F1 se calculan desde TP, FP, FN y TN; la métrica adecuada depende del riesgo y del tipo de error que se desea controlar.

  7. AI-3.4.1 · K2Explicar la estructura y funcionamiento de una red neuronal profunda

    Una red neuronal profunda tiene capas de neuronas con pesos, sesgos y funciones de activación; durante el entrenamiento se calcula pérdida y se ajustan pesos para reducirla.

  8. AI-3.4.3 · K2Describir las diferentes medidas de cobertura para redes neuronales

    La cobertura de redes neuronales mide activación de neuronas o secciones, pero no garantiza que el modelo generalice ni que no use correlaciones espurias.

Errores frecuentes

  • No mezclar conjuntos de entrenamiento, validación y prueba.
  • No interpretar exactitud aislada cuando las clases están desbalanceadas.
  • No pensar que cobertura neuronal garantiza calidad real.

Ejemplos aplicados

  • En un clasificador de imágenes, precisión, recobrado y F1 se calculan con TP, FP, FN y TN de la matriz de confusión.