LLMs · RAG · Agentes · Madrid
Aplicaciones con LLMs, sin fiarse de la demo
Estudio machine learning y construyo aplicaciones con modelos de lenguaje como proyectos personales: RAG sobre documentos, agentes que consultan datos y asistentes con herramientas. Lo que más me ha enseñado no es hacerlas funcionar, sino evaluarlas: saber si dan respuestas correctas o solo respuestas que suenan bien.

RAG: respuestas que citan la fuente
Indexado del corpus, recuperación semántica con embeddings y generación de respuestas que citan el fragmento del que salen. El objetivo es que cada respuesta sea verificable, no que suene bien. Con chunking para documentos largos y re-ranking si el corpus es grande.
Agentes con guardrails
Agentes que traducen lenguaje natural a consultas SQL y las ejecutan en modo solo lectura, con herramientas bien definidas. Útiles sin ser peligrosos: scope acotado, sin acceso de escritura por defecto y con registro de lo que hace el agente. Así construí llm-sql-agent.
Evaluación, no solo demo
El problema de los LLMs es que generan texto que siempre parece correcto. En mis proyectos evalúo las respuestas con métricas automáticas (ROUGE, BERTScore, faithfulness) y comparo contra baselines clásicos antes de dar nada por bueno. Un benchmark honesto dice más que una demo.
Fine-tuning cuando la API no basta
Para tareas muy específicas donde un modelo base no llega, practico fine-tuning supervisado con LoRA o QLoRA sobre modelos de HuggingFace. Con evaluación antes y después, porque si no se mide, no se sabe si mereció la pena.
¿Quieres ver el código, o contarme algo?
Los proyectos con LLMs están en mi GitHub con su evaluación incluida. Si tienes feedback, una duda o una oportunidad, escríbeme.
EscríbemeFAQ
¿Cuándo tiene sentido usar RAG en lugar de solo un LLM?
Cuando las respuestas tienen que venir de documentos concretos, no del conocimiento general del modelo. RAG es la diferencia entre 'el modelo sabe sobre esto en general' y 'el modelo busca en la documentación y cita de dónde saca la respuesta'. Siempre que las respuestas deban ser verificables y actualizables sin reentrenar.
¿Cómo se evalúa si un sistema RAG funciona bien?
Con un conjunto de preguntas con respuesta esperada y métricas de faithfulness (la respuesta viene del contexto recuperado) y relevancia (el contexto recuperado es el correcto). También hay que evaluar la recuperación por separado: que el sistema encuentre los fragmentos correctos antes de generar. Es lo que practico en rag-document-assistant y en llm-eval-harness.
¿Qué modelos uso?
Depende del proyecto. Las APIs de OpenAI y Anthropic para la mayoría de los experimentos, y modelos abiertos de HuggingFace (Llama, Mistral) cuando quiero practicar fine-tuning o ejecutar todo en local. Parte del aprendizaje es justo ese criterio: elegir el modelo por el problema y el coste, no por la moda.
¿Un LLM siempre es la respuesta?
No, y es de las lecciones que más me han costado. En llm-eval-harness comparo un LLM contra clasificadores baseline en la misma tarea: a veces el LLM gana con claridad y a veces un modelo clásico más barato lo iguala. Escribí sobre esto en el blog, en 'Cuándo vale la pena usar un LLM'.
¿Puedo preguntarte sobre esto o proponerte algo?
Claro. Si estás aprendiendo lo mismo, si tienes feedback sobre alguno de mis proyectos con LLMs, o si buscas a alguien junior para tu equipo, escríbeme por el formulario. Respondo siempre.