Sobre MíQué hagoProyectosLabContacto

Ciencia de datos · ML · Madrid

Ciencia de datos, aprendida con proyectos

Estudio ciencia de datos y machine learning en Madrid, y la practico con proyectos completos: del análisis exploratorio y la definición del problema hasta el modelo servido. Datos tabulares y texto, intentando que la metodología sea sólida y la evaluación honesta en cada paso.

Ciencia de datos, aprendida con proyectos

El análisis que precede al modelo

Antes de entrenar nada, analizo la distribución de los datos, los valores ausentes, las correlaciones con la variable objetivo y los posibles sesgos. Aprendí por las malas que un modelo entrenado sobre datos mal entendidos no funciona aunque el algoritmo sea sofisticado.

Ingeniería de variables que aporta

Las variables que construyes a partir de los datos brutos suelen importar más que el algoritmo. Practico la ingeniería de variables con cuidado: ratios, agregaciones temporales y encodings que no filtren información del futuro al pasado.

Modelos con metodología

Validación cruzada estratificada, búsqueda de hiperparámetros con presupuesto fijo, comparación de modelos sobre el mismo conjunto de test, calibración de probabilidades y análisis de importancia de variables. Sin atajos que inflen los resultados, que es la trampa más fácil cuando nadie te revisa.

Resultados que se pueden usar

Los notebooks son para explorar, no para entregar. Intento que cada proyecto termine en un pipeline reproducible, una API o un README claro con las conclusiones. No un Jupyter que solo corre en mi máquina.

¿Feedback, una idea o una oportunidad?

Los proyectos están en GitHub con su evaluación y sus decisiones documentadas. Si quieres comentarme algo, escríbeme.

Escríbeme

FAQ

  • ¿Qué diferencia hay entre ciencia de datos y machine learning?

    La ciencia de datos es más amplia: incluye la exploración, el análisis estadístico, la visualización y la narrativa sobre los datos. El ML es una herramienta dentro de la ciencia de datos, la parte de construir modelos predictivos. En la práctica van juntos en casi todos mis proyectos.

  • ¿Con qué tipos de datos practicas?

    Principalmente datos tabulares (riesgo de crédito, fuga de clientes) y texto (clasificación, extracción, resumen, búsqueda semántica). Uso datasets públicos y datos sintéticos documentados en cada repositorio, para que cualquiera pueda reproducir los resultados.

  • ¿Cómo eliges qué proyecto hacer?

    Por lo que quiero aprender. Si leo sobre calibración de probabilidades, busco un problema donde la probabilidad importe (riesgo de crédito). Si quiero entender los transformers, implemento uno desde cero. El proyecto es la excusa para aterrizar la teoría.

  • ¿Dónde están los resultados?

    Cada proyecto está en github.com/delcenjo con su código, sus métricas y sus decisiones documentadas. Los aprendizajes más generales los escribo en el blog de esta web: fugas de datos, evaluación honesta, cuándo merece la pena un LLM.

  • ¿Puedo escribirte?

    Sí, por favor. Feedback sobre la metodología, ideas de proyectos, dudas o una oportunidad de prácticas o primer puesto junior en datos. El formulario de contacto llega directo a mi correo.

hola@jmwebsoluciones.com