RAG (Generación Aumentada por Recuperación)
RAG es una técnica que conecta un modelo como Claude con una base de conocimiento externa: recupera fragmentos relevantes en el momento de la consulta y los inserta en el prompt para que la respuesta se base en datos reales y actualizados.
RAG (Retrieval-Augmented Generation, o generación aumentada por recuperación) es una técnica que combina un modelo de lenguaje con un sistema de búsqueda sobre documentos propios. En lugar de confiar solo en lo que el modelo aprendió durante su entrenamiento, RAG recupera los fragmentos de información más relevantes para la pregunta y los inserta en el prompt, de modo que Claude genere la respuesta apoyándose en esos datos concretos.
Cómo funciona
El flujo típico de RAG tiene dos fases. En la fase de indexación, preparas tu conocimiento una sola vez:
- Divides los documentos en fragmentos (chunks) de tamaño manejable.
- Conviertes cada fragmento en un vector numérico mediante un modelo de embeddings.
- Guardas esos vectores en una base de datos vectorial (Pinecone, Weaviate, pgvector, etc.).
En la fase de consulta, por cada pregunta del usuario:
- Se genera el embedding de la pregunta.
- Se buscan los fragmentos más cercanos por similitud semántica.
- Se inyectan esos fragmentos en el prompt junto con la pregunta.
- Claude genera la respuesta usando ese contexto recuperado como base.
En la práctica con Claude, el patrón recomendado por Anthropic es situar los documentos recuperados en etiquetas XML dentro del prompt (por ejemplo <documentos>) e instruir al modelo para que responda solo a partir de ellos y cite la fuente. La amplia ventana de contexto de Claude permite además incluir varios fragmentos completos sin recortar demasiado.
Por qué importa
RAG resuelve tres problemas reales de trabajar con un LLM en producción:
- Conocimiento actualizado: el modelo tiene una fecha de corte de entrenamiento. RAG le da acceso a información posterior o privada sin reentrenar nada.
- Menos alucinaciones: al anclar la respuesta en documentos reales, Claude tiende a inventar menos, sobre todo si le pides que responda "no lo sé" cuando el contexto no contiene la respuesta.
- Trazabilidad: puedes citar de qué documento salió cada afirmación, algo imprescindible en soporte, legal o salud.
Es la forma más barata y rápida de especializar Claude en tu dominio, mucho más que el fine-tuning para la mayoría de casos. Si quieres montar este tipo de flujo, un buen punto de partida es aprender a construir aplicaciones sobre la API de Claude, donde el patrón RAG es uno de los primeros que se implementa.
RAG frente a otras técnicas
Conviene no confundir RAG con conceptos vecinos:
- Ventana de contexto grande: meter todo un manual en el prompt funciona para documentos pequeños, pero es caro en tokens y se degrada con volúmenes altos. RAG selecciona solo lo relevante.
- Fine-tuning: cambia los pesos del modelo para ajustar estilo o formato, pero no es fiable para inyectar hechos concretos y actualizables. RAG sí lo es.
- MCP y herramientas: permiten que Claude consulte sistemas en vivo. RAG y MCP se complementan: puedes usar un conector para recuperar el contexto que luego alimenta la generación.
Errores comunes
- Chunks mal dimensionados: fragmentos demasiado grandes diluyen la relevancia; demasiado pequeños pierden contexto. Suele funcionar solapar fragmentos.
- Confiar solo en la similitud vectorial: combinar búsqueda semántica con búsqueda por palabras clave (búsqueda híbrida) mejora mucho el recall.
- No instruir a Claude: sin decirle que use exclusivamente el contexto y que admita cuándo no sabe, seguirá tirando de su conocimiento interno y volverán las alucinaciones.
- Ignorar la evaluación: sin medir la calidad de la recuperación, no sabes si el problema está en la búsqueda o en la generación.
Preguntas frecuentes
¿RAG sustituye al fine-tuning en Claude?
No siempre. RAG es mejor para inyectar hechos actualizables y citables; el fine-tuning ajusta estilo y formato. Para la mayoría de casos de conocimiento empresarial, RAG es más barato y flexible.
¿Necesito una base de datos vectorial para hacer RAG con Claude?
Para volúmenes grandes sí conviene. Con pocos documentos puedes recuperar por palabras clave o incluso meterlos directamente en la ventana de contexto, pero el enfoque vectorial escala mejor y captura similitud semántica.
¿RAG elimina las alucinaciones por completo?
No, las reduce mucho. Si el contexto recuperado es incompleto o irrelevante, Claude puede seguir inventando. Instruirle para responder solo desde el contexto y admitir cuando no sabe es clave.
¿Cómo se relaciona RAG con MCP en Claude?
Se complementan. MCP permite que Claude acceda a fuentes de datos en vivo mediante conectores; puedes usar ese acceso para recuperar el contexto que luego alimenta la generación RAG.