Constitutional AI
Constitutional AI es el método de entrenamiento de Anthropic que alinea a Claude usando una lista de principios escritos, una constitución, para que el propio modelo critique y corrija sus respuestas en lugar de depender solo de humanos.
Constitutional AI (CAI) es la técnica de alineamiento desarrollada por Anthropic para entrenar a Claude de forma que sea útil, honesto e inofensivo sin depender de que un ejército de anotadores humanos etiquete manualmente cada respuesta problemática. En su lugar, el modelo se guía por un conjunto explícito de principios, la constitución, y aprende a autocriticarse y revisar sus propias salidas según esas reglas.
Cómo funciona
El entrenamiento tiene dos fases. En la primera, supervisada, se le pide al modelo que genere respuestas, luego que las critique a la luz de un principio constitucional concreto (por ejemplo, evitar contenido dañino) y que reescriba una versión mejorada. Con esos pares de respuesta original y respuesta revisada se afina el modelo. Es un ciclo de autocrítica guiado por texto.
La segunda fase sustituye el clásico RLHF (aprendizaje por refuerzo con feedback humano) por RLAIF: aprendizaje por refuerzo con feedback de IA. Aquí el modelo genera pares de respuestas y otro modelo, siguiendo la constitución, decide cuál es preferible. Ese juicio automático entrena un modelo de preferencias que sirve para el refuerzo. La intervención humana se traslada de etiquetar millones de ejemplos a redactar y depurar los principios.
La constitución de Claude combina fuentes como la Declaración Universal de Derechos Humanos, condiciones de servicio de plataformas digitales y principios propios de Anthropic sobre precaución y respeto. Es un documento público y editable, no un peso oculto dentro del modelo.
Por qué importa
Para quien construye con Claude, Constitutional AI explica buena parte del comportamiento del modelo. Cuando Claude rechaza una petición o matiza una respuesta sensible, suele estar aplicando principios de esa constitución, no una lista de palabras prohibidas. Esto hace su comportamiento más coherente y explicable que un filtrado por palabras clave.
Tiene tres consecuencias prácticas. Primero, transparencia: los principios son legibles, así que el alineamiento no es una caja negra total. Segundo, escalabilidad: al reducir la dependencia de anotadores humanos para casos dañinos, el proceso escala mejor y expone a menos personas a contenido tóxico. Tercero, ajustabilidad: modificar la constitución cambia el comportamiento de forma más directa que reetiquetar datos.
Un ejemplo del mecanismo
Imagina que se le pregunta a Claude cómo hacer algo peligroso. En la fase de autocrítica el proceso sería aproximadamente así:
- Respuesta inicial: el modelo da una respuesta que podría incluir información dañina.
- Crítica: se le pide que identifique por qué esa respuesta viola un principio ("esta respuesta facilita un daño").
- Revisión: el modelo reescribe declinando ayudar con esa parte y ofreciendo una alternativa segura.
Ese trío original, crítica y revisión es el material de entrenamiento. Si quieres entender cómo estos principios afectan al diseño de tus instrucciones, conviene dominar primero los fundamentos con un curso para empezar con Claude desde cero antes de pasar a escenarios avanzados.
Qué NO es
Constitutional AI no es un filtro que se ejecuta en tiempo real sobre cada respuesta: es un método de entrenamiento previo. Cuando usas Claude, el modelo ya viene alineado, no consulta la constitución en cada mensaje. Tampoco es lo mismo que un system prompt, que sí controlas tú en cada llamada. Y no garantiza infalibilidad: sigue habiendo casos límite, sesgos y errores. Es un enfoque para reducir daños y mejorar el alineamiento, no una solución definitiva a la seguridad de la IA.
Preguntas frecuentes
¿En qué se diferencia Constitutional AI del RLHF tradicional?
El RLHF depende de humanos que etiquetan qué respuestas prefieren. Constitutional AI usa RLAIF: un modelo evalúa las respuestas según principios escritos, reduciendo la necesidad de anotación humana masiva y la exposición a contenido dañino.
¿Puedo ver la constitución de Claude?
Sí. Anthropic ha publicado los principios que componen la constitución de Claude, que combinan fuentes como la Declaración Universal de Derechos Humanos, términos de servicio de plataformas y principios propios sobre precaución y respeto.
¿Constitutional AI filtra mis prompts en tiempo real?
No. Es un método de entrenamiento previo, no un filtro que se ejecuta en cada mensaje. Claude ya viene alineado por este proceso; no consulta la constitución durante tus conversaciones.
¿Constitutional AI hace que Claude sea completamente seguro?
No garantiza infalibilidad. Reduce daños y mejora la coherencia del alineamiento, pero siguen existiendo casos límite, sesgos y errores. Es un enfoque de mitigación, no una solución definitiva.