Martes, 8 de septiembre de 2026  ·  LATAM / Español
arquitectura

Transformer

Un transformer es la arquitectura de red neuronal basada en mecanismos de atencion que procesa secuencias completas en paralelo y es la base sobre la que se construyen los grandes modelos de lenguaje actuales, incluido Claude.

También: transformer · arquitectura transformer · modelo transformer · transformer en IA · attention is all you need

Un transformer es una arquitectura de red neuronal, presentada por Google en 2017 en el paper Attention is All You Need, que procesa secuencias de datos (como texto) usando un mecanismo llamado atencion. En lugar de leer las palabras una a una en orden, evalua todas las relaciones entre los elementos de la secuencia a la vez, lo que permite entrenar modelos enormes de forma eficiente. Es la arquitectura sobre la que se construyen prácticamente todos los grandes modelos de lenguaje modernos, Claude incluido.

Cómo funciona

El componente central es el mecanismo de atencion (self-attention). Para cada token de la entrada, el modelo calcula cuánta relevancia tienen todos los demás tokens a la hora de interpretarlo. Así, en la frase "el banco estaba cerrado", la palabra "banco" se interpreta teniendo en cuenta "cerrado" para desambiguar entre asiento y entidad financiera.

El proceso se apoya en tres piezas:

Los modelos como Claude usan una variante decoder-only: predicen el siguiente token a partir de todos los anteriores, generando texto palabra a palabra. El poder de la arquitectura está en que escala muy bien: más parámetros y más datos producen capacidades emergentes sin cambiar el diseño de fondo.

Por qué importa

El transformer es la razón por la que Claude existe tal como lo conoces. Dos propiedades tienen consecuencias directas para quien construye:

El coste de la atencion crece de forma cuadrática con la longitud de la secuencia, y por eso el número de tokens que un modelo puede procesar tiene un límite y un precio. Entender esto ayuda a interpretar por qué las ventanas de contexto grandes son costosas y por qué técnicas como el prompt caching aportan valor.

Qué NO es

El transformer no es lo mismo que un LLM. El transformer es la arquitectura; un LLM como Claude es un modelo concreto entrenado con esa arquitectura sobre datos específicos y afinado con técnicas como RLHF y Constitutional AI. Tampoco es exclusivo del texto: hay transformers para imágenes, audio y código, lo que sustenta las capacidades multimodales.

Otro error frecuente es confundir atencion con memoria persistente. El transformer no "recuerda" conversaciones anteriores por sí solo: solo procesa lo que cabe en su ventana de contexto en cada llamada. Si quieres arrancar desde los fundamentos y ver cómo estos conceptos se aplican en la práctica, hay un curso para empezar con Claude desde cero que aterriza la teoría en uso real.

Ejemplo reconocible

Cuando escribes un prompt a Claude, la secuencia completa (system prompt, historial y tu mensaje) se convierte en tokens, se procesa a través de las capas del transformer y el modelo emite el siguiente token más probable, luego el siguiente, y así hasta completar la respuesta. Todo lo que percibes como "comprensión" es este cálculo de atencion repetido a gran escala.

Preguntas frecuentes

¿Claude usa la arquitectura transformer?

Sí. Como la mayoría de grandes modelos de lenguaje actuales, Claude se basa en la arquitectura transformer, en concreto en variantes decoder-only que generan texto prediciendo el siguiente token a partir del contexto.

¿Cuál es la diferencia entre un transformer y un LLM?

El transformer es la arquitectura de red neuronal. Un LLM es un modelo concreto entrenado con esa arquitectura sobre grandes volúmenes de datos. Todos los LLM modernos son transformers, pero el término transformer designa el diseño, no el modelo final.

¿Por qué el transformer permite ventanas de contexto tan grandes?

Su mecanismo de atencion relaciona cualquier token con cualquier otro dentro de la secuencia, lo que permite razonar sobre textos largos. El límite viene del coste cuadrático de la atencion respecto a la longitud, que encarece contextos muy extensos.

¿Quién inventó el transformer?

Fue presentado por investigadores de Google en 2017 en el paper Attention is All You Need. Desde entonces se convirtió en la base de casi toda la IA generativa de lenguaje, incluida la familia de modelos Claude de Anthropic.

Términos relacionados

Fuentes