Sobre MíQué hagoProyectosLabContacto

Modelos de ML · Evaluación rigurosa · Madrid

Cómo entreno y evalúo modelos de machine learning

Estudio machine learning en Madrid y entreno modelos en proyectos personales con una regla: la evaluación manda. Pipeline sin fugas, validación cruzada, probabilidades calibradas y umbral de decisión por coste. Un modelo que pasa un test honesto es un modelo del que puedo fiarme.

Cómo entreno y evalúo modelos de machine learning

Validación sin fugas de datos

El preprocesado (escalado, encoding, imputación) vive dentro del pipeline, así que se ajusta solo con los datos de entrenamiento en cada partición de validación cruzada. La métrica que obtengo en validación es la que puedo esperar con datos nuevos, sin inflar.

Probabilidades calibradas

Si el modelo va a tomar decisiones basadas en la probabilidad, esa probabilidad tiene que ser fiable. Calibro el modelo (Platt scaling o isotónica) y lo compruebo con el Brier score y la curva de calibración. Un 0,7 tiene que significar de verdad un 70%.

El umbral importa tanto como el modelo

El umbral de decisión no es 0,5 por defecto. En mi proyecto de riesgo de crédito lo elijo minimizando el coste de cada tipo de error: cuánto cuesta un falso negativo frente a un falso positivo. Ese ajuste cambió más el resultado que cambiar de algoritmo.

Análisis de error por segmento

Las métricas globales ocultan problemas. Analizo el error por subgrupos relevantes para saber dónde falla el modelo y por qué. Es la parte del proyecto donde más he aprendido, porque los fallos casi nunca están donde esperaba.

¿Quieres revisar mi trabajo o contarme algo?

Cada modelo está en GitHub con su pipeline, su evaluación y sus decisiones documentadas. Si tienes feedback o una oportunidad, escríbeme.

Escríbeme

FAQ

  • ¿Qué tipo de modelos construyes?

    Principalmente modelos para datos tabulares: clasificación (impago, fuga de clientes) y regresión. También NLP con transformers para clasificación de texto, extracción y búsqueda semántica, y aplicaciones con LLMs. Todos como proyectos personales con el código en github.com/delcenjo.

  • ¿Qué significa que el modelo esté bien calibrado?

    Que cuando el modelo dice '70% de probabilidad de impago', el impago ocurre de verdad en alrededor del 70% de esos casos. Sin calibración, los scores son un ranking pero no probabilidades reales, y tomar decisiones con ellos es engañarse con números que parecen precisos.

  • ¿Por qué no usar siempre el umbral de 0,5?

    Porque el coste de equivocarse no es simétrico. En riesgo de crédito, un falso negativo (dar crédito a quien impaga) puede costar varias veces más que un falso positivo (rechazar a quien habría pagado). El umbral óptimo refleja esa asimetría, no una convención. Fue una de las primeras lecciones grandes de mi proyecto de crédito.

  • ¿Cómo sé que tus métricas no están infladas?

    Puedes comprobarlo: el código de cada proyecto es público, con el pipeline, los splits y la evaluación. Además construí herramientas para vigilarme a mí mismo: splitcheck detecta fugas y duplicados entre train y test, y evalgate compara evaluaciones en CI con tests de significancia.

  • ¿Puedo escribirte sobre esto?

    Claro. Feedback sobre la metodología, dudas, ideas o una oportunidad de prácticas o primer puesto junior en datos o ML. El formulario de contacto llega directo a mi correo y respondo siempre.

hola@jmwebsoluciones.com