
INNOSFERA #24 | RAG, Fine-tuning y salida estructurada: la guía que faltaba | Pablo García
Sobre este episodio
Un modelo entrenado con medio internet no sabe absolutamente nada de tu empresa. RAG o fine-tuning: dos palabras que aparecen en todas las reuniones y que casi nadie sabe cuándo usar. Cerramos temporada con el primer invitado que repite en Innosfera para resolverlo de una vez.
Pablo García vuelve después del episodio 5, donde desmontamos los Transformers pieza a pieza, y esta vez bajamos del "cómo funciona" al "cómo se implementa". Recorremos RAG de principio a fin —embeddings de documento, chunking, bases vectoriales, búsqueda híbrida— y entramos en el fine-tuning por la puerta buena: qué descubrieron en el paper de LoRA al comparar las matrices de pesos antes y después de reentrenar.
También dedicamos un bloque a algo que se explica poco y resuelve muchísimo: la salida estructurada. Si alguna vez has hecho fine-tuning solo para que un modelo te devolviera un JSON válido, este tramo te va a doler. Cerramos con cuatro casos prácticos para decidir qué técnica usar y con una reflexión sobre por dónde debería empezar de verdad una empresa que quiere implementar IA. Spoiler: no es por el fine-tuning.
Un episodio técnico, sin humo, contado desde dentro por alguien que implementa esto a diario.
⏱️ Capítulos
- 00:00 — Avance
- 01:14 — Intro
- 01:50 — Vuelve Pablo García
- 03:57 — ¿Qué problema resuelven RAG y fine-tuning?
- 05:54 — Qué es RAG
- 08:45 — Embeddings de documento
- 10:50 — Chunking: trocear, solapar y no perder el contexto
- 12:46 — Estrategias avanzadas y GraphRAG
- 14:13 — Bases de datos vectoriales y búsqueda aproximada
- 18:58 — El pipeline completo, paso a paso
- 21:03 — Búsqueda híbrida: BM25 y fusión de rankings
- 23:17 — Datos frescos y trazabilidad
- 24:08 — Permisos: por qué no se los das nunca al LLM
- 27:12 — Fine-tuning: por qué nadie entrena desde cero
- 30:36 — LoRA: la aproximación por bajo rango
- 35:11 — ¿Cuánto cambia realmente un modelo?
- 39:03 — RAG vs Fine-tuning: cuándo usar cada uno
- 40:35 — Salida estructurada: el problema del JSON válido
- 43:31 — Compiladores, gramáticas y análisis sintáctico
- 46:22 — Cómo se bloquean los tokens inválidos
- 49:02 — El formato TOON
- 50:57 — Cuatro casos prácticos: ¿qué usarías tú?
- 53:37 — Cómo montar tu primer RAG gastando céntimos
- 55:56 — Reflexión final: los datos primero
- 58:11 — Cierre de temporada
🛠️ Recursos mencionados
- n8n — RAG sin escribir código
- LangChain y LangGraph
- Ollama — embeddings en local
- vLLM — motor de inferencia
- ChromaDB — vectorial en memoria
- pgvector — vectores en PostgreSQL
- FAISS y Pinecone
- Paper original de LoRA
- Innosfera #5 — Transformers: lo que hay detrás de ChatGPT. Encuéntralo en innosferapodcast.com.
👤 Invitado
Pablo García — Data Scientist e ingeniero de IA
LinkedIn
🎧 Innosfera
innosferapodcast.com
Sigue el hilo
Conexiones de este episodio
Conversaciones que comparten temas o enfoque dentro del mapa de Innosfera.


