Embedding
Un embedding es una representacion numerica de texto, imagen u otro dato como un vector de cientos de dimensiones, donde la cercania entre vectores refleja la similitud semantica del contenido original.
Un embedding es una representacion de un fragmento de informacion (una palabra, una frase, un documento o incluso una imagen) como un vector de numeros en un espacio de muchas dimensiones. La clave es que ese vector captura el significado: dos textos que hablan de lo mismo quedan cerca en el espacio, aunque no compartan ni una sola palabra. Es la pieza que permite que una maquina compare ideas por sentido y no por coincidencia literal de caracteres.
Como funciona
Un modelo de embeddings, entrenado sobre enormes cantidades de texto, aprende a proyectar cada entrada en un vector fijo, tipicamente de 256 a 3072 dimensiones segun el modelo. El entrenamiento ajusta esas coordenadas para que conceptos relacionados ("factura", "recibo", "comprobante de pago") acaben en zonas contiguas del espacio.
Para medir cuanto se parecen dos fragmentos se usa la similitud coseno: el coseno del angulo entre sus vectores. Un valor cercano a 1 indica significado casi identico; cercano a 0, temas sin relacion. Ese calculo es rapidisimo, lo que permite buscar entre millones de vectores en milisegundos usando una base de datos vectorial (Pinecone, Weaviate, pgvector, Qdrant).
Por que importa al construir con Claude
Claude es un modelo de lenguaje generativo: razona y escribe, pero no produce embeddings. Anthropic no ofrece un endpoint propio de embeddings y en su documentacion recomienda proveedores externos, con Voyage AI como opcion destacada. Esto significa que en una arquitectura real combinas dos piezas: un modelo de embeddings para indexar y recuperar, y Claude para generar la respuesta.
El patron que las une es RAG (generacion aumentada por recuperacion). Conviertes tus documentos en embeddings, los guardas en una base vectorial, y cuando llega una pregunta la conviertes tambien en embedding, recuperas los fragmentos mas cercanos y se los pasas a Claude como contexto. Asi Claude responde con informacion tuya, actualizada y verificable, sin necesidad de reentrenar nada. Esta tecnica es la base de casi cualquier asistente que consulta una base de conocimiento propia, algo que se trabaja a fondo en el curso de Claude API para Builders al montar tu primera aplicacion.
Ejemplo practico
Imagina un buscador interno de 10.000 articulos. Sin embeddings, buscar "como cancelar mi suscripcion" solo encuentra documentos que contengan esas palabras exactas. Con embeddings, un articulo titulado "Dar de baja tu plan mensual" aparece igual, porque su vector esta cerca del de la consulta pese a no compartir vocabulario.
- Dimensiones tipicas: entre 256 y 1536 en modelos comunes; mas dimensiones capturan mas matiz pero ocupan mas memoria.
- Chunking: los documentos largos se trocean en fragmentos de unos cientos de tokens antes de generar el embedding, para que cada vector represente una idea concreta.
- Coste: generar embeddings es mucho mas barato que una llamada generativa; se factura por tokens procesados.
Que NO es un embedding
Un embedding no es una respuesta ni texto generado: es solo la representacion numerica que hace posible la busqueda semantica. Tampoco es lo mismo que la ventana de contexto de Claude; el embedding vive fuera del modelo, en tu infraestructura de recuperacion. Y no reemplaza al fine-tuning: no modifica los pesos de ningun modelo, solo organiza tu informacion para poder recuperarla.
Otro error frecuente es pensar que embeddings de proveedores distintos son comparables. No lo son: los vectores de Voyage AI y los de otro modelo viven en espacios diferentes, asi que debes indexar y consultar siempre con el mismo modelo de embeddings.
Preguntas frecuentes
Claude puede generar embeddings directamente?
No. Claude es un modelo generativo y Anthropic no ofrece endpoint de embeddings propio; en su documentacion recomienda proveedores externos como Voyage AI para esta tarea, que luego combinas con Claude en un flujo RAG.
Que diferencia hay entre un embedding y RAG?
El embedding es la representacion vectorial de un texto. RAG es la tecnica completa que usa embeddings para recuperar fragmentos relevantes y pasarselos a Claude como contexto antes de generar la respuesta.
Cuantas dimensiones tiene un embedding?
Depende del modelo: suele ir de 256 a 3072 dimensiones. Mas dimensiones capturan mas matiz semantico pero aumentan el uso de memoria y el coste de almacenamiento en la base vectorial.
Puedo mezclar embeddings de distintos modelos?
No. Cada modelo genera vectores en un espacio propio y no son comparables entre si. Debes indexar y consultar siempre con el mismo modelo de embeddings para que la similitud tenga sentido.