RLHF (Aprendizaje por Refuerzo con Feedback Humano)
RLHF es una tecnica de entrenamiento que ajusta un modelo de lenguaje usando preferencias humanas: las personas puntuan respuestas y un modelo de recompensa guia al sistema hacia respuestas mas utiles y seguras.
RLHF (Reinforcement Learning from Human Feedback) es una tecnica de entrenamiento que alinea un modelo de lenguaje con las preferencias humanas. En lugar de limitarse a predecir el siguiente token a partir de texto masivo, el modelo aprende de juicios de personas sobre que respuesta es mejor, y esos juicios se convierten en una senal de recompensa que orienta el comportamiento del sistema hacia respuestas mas utiles, honestas y seguras.
Como funciona
El proceso clasico tiene tres fases encadenadas:
- Fine-tuning supervisado (SFT). Se parte de un modelo base preentrenado y se afina con ejemplos de conversaciones de alta calidad escritos o revisados por humanos. Aqui el modelo aprende el formato de respuesta deseado.
- Modelo de recompensa. Se generan varias respuestas a un mismo prompt y anotadores humanos las ordenan de mejor a peor. Con esas comparaciones se entrena un segundo modelo, el reward model, que aprende a puntuar respuestas imitando el criterio humano.
- Optimizacion por refuerzo. El modelo de lenguaje se ajusta con un algoritmo de refuerzo (habitualmente PPO) para maximizar la puntuacion del modelo de recompensa, con una penalizacion que evita que se aleje demasiado del modelo original.
El resultado es un modelo que no solo sabe hablar, sino que prioriza lo que las personas consideran una buena respuesta.
Por que importa
RLHF es lo que convierte un LLM crudo en un asistente conversacional utilizable. Un modelo base preentrenado puede completar texto, pero tiende a divagar, ignorar instrucciones o producir contenido problematico. El feedback humano es lo que hace que siga instrucciones, admita cuando no sabe algo y rechace peticiones daninas. Para quien construye con Claude, esto significa que el comportamiento del modelo no es un accidente del preentrenamiento, sino algo moldeado deliberadamente.
RLHF y Constitutional AI en Claude
Anthropic usa RLHF, pero lo combina con su propio enfoque: Constitutional AI (CAI) y RLAIF (refuerzo con feedback de IA). La idea es reducir la dependencia de anotadores humanos para las decisiones de seguridad. En lugar de que las personas etiqueten cada respuesta danina, el modelo critica y revisa sus propias salidas siguiendo un conjunto de principios escritos (la constitucion). Ese feedback generado por IA alimenta la fase de refuerzo. RLHF sigue presente para la utilidad general, pero la capa de valores y seguridad se apoya en gran medida en CAI, lo que hace el proceso mas escalable y transparente.
Errores comunes
- Creer que RLHF ensena conocimiento nuevo. No lo hace. El conocimiento viene del preentrenamiento; RLHF ajusta el comportamiento y las preferencias, no los datos que el modelo sabe.
- Confundir RLHF con el system prompt. El RLHF se aplica una vez durante el entrenamiento y queda fijado en los pesos del modelo. El system prompt configura cada conversacion en tiempo de inferencia.
- Pensar que elimina las alucinaciones. RLHF puede reducir errores y hacer que el modelo admita incertidumbre, pero no garantiza veracidad.
- Suponer que Claude usa solo RLHF. Su alineamiento combina RLHF con Constitutional AI.
Entender esta capa de alineamiento es fundamental para sacarle partido a Claude, y es uno de los conceptos que se abordan en un curso para empezar con Claude desde cero antes de pasar a usos mas avanzados.
Preguntas frecuentes
Que diferencia hay entre RLHF y Constitutional AI?
RLHF usa preferencias humanas para entrenar un modelo de recompensa. Constitutional AI reemplaza gran parte de ese feedback humano por feedback generado por la propia IA siguiendo principios escritos, lo que hace la seguridad mas escalable. Claude combina ambos.
RLHF le ensena nuevos datos al modelo?
No. El conocimiento proviene del preentrenamiento. RLHF ajusta el comportamiento y las preferencias del modelo: como responde, que instrucciones sigue y que peticiones rechaza, no la informacion que contiene.
Elimina RLHF las alucinaciones?
No las elimina. RLHF puede reducirlas y ensenar al modelo a admitir cuando no esta seguro, pero no garantiza que las respuestas sean factualmente correctas.
Que algoritmo de refuerzo se usa en RLHF?
El mas habitual es PPO (Proximal Policy Optimization), que optimiza el modelo para maximizar la puntuacion del modelo de recompensa mientras evita alejarse demasiado del modelo de partida.