Jueves, 10 de septiembre de 2026  ·  LATAM / Español
tecnica

RLHF (Aprendizaje por Refuerzo con Feedback Humano)

RLHF es una tecnica de entrenamiento que ajusta un modelo de lenguaje usando preferencias humanas: las personas puntuan respuestas y un modelo de recompensa guia al sistema hacia respuestas mas utiles y seguras.

También: RLHF · Reinforcement Learning from Human Feedback · aprendizaje por refuerzo con retroalimentacion humana · feedback humano en IA

RLHF (Reinforcement Learning from Human Feedback) es una tecnica de entrenamiento que alinea un modelo de lenguaje con las preferencias humanas. En lugar de limitarse a predecir el siguiente token a partir de texto masivo, el modelo aprende de juicios de personas sobre que respuesta es mejor, y esos juicios se convierten en una senal de recompensa que orienta el comportamiento del sistema hacia respuestas mas utiles, honestas y seguras.

Como funciona

El proceso clasico tiene tres fases encadenadas:

  1. Fine-tuning supervisado (SFT). Se parte de un modelo base preentrenado y se afina con ejemplos de conversaciones de alta calidad escritos o revisados por humanos. Aqui el modelo aprende el formato de respuesta deseado.
  2. Modelo de recompensa. Se generan varias respuestas a un mismo prompt y anotadores humanos las ordenan de mejor a peor. Con esas comparaciones se entrena un segundo modelo, el reward model, que aprende a puntuar respuestas imitando el criterio humano.
  3. Optimizacion por refuerzo. El modelo de lenguaje se ajusta con un algoritmo de refuerzo (habitualmente PPO) para maximizar la puntuacion del modelo de recompensa, con una penalizacion que evita que se aleje demasiado del modelo original.

El resultado es un modelo que no solo sabe hablar, sino que prioriza lo que las personas consideran una buena respuesta.

Por que importa

RLHF es lo que convierte un LLM crudo en un asistente conversacional utilizable. Un modelo base preentrenado puede completar texto, pero tiende a divagar, ignorar instrucciones o producir contenido problematico. El feedback humano es lo que hace que siga instrucciones, admita cuando no sabe algo y rechace peticiones daninas. Para quien construye con Claude, esto significa que el comportamiento del modelo no es un accidente del preentrenamiento, sino algo moldeado deliberadamente.

RLHF y Constitutional AI en Claude

Anthropic usa RLHF, pero lo combina con su propio enfoque: Constitutional AI (CAI) y RLAIF (refuerzo con feedback de IA). La idea es reducir la dependencia de anotadores humanos para las decisiones de seguridad. En lugar de que las personas etiqueten cada respuesta danina, el modelo critica y revisa sus propias salidas siguiendo un conjunto de principios escritos (la constitucion). Ese feedback generado por IA alimenta la fase de refuerzo. RLHF sigue presente para la utilidad general, pero la capa de valores y seguridad se apoya en gran medida en CAI, lo que hace el proceso mas escalable y transparente.

Errores comunes

Entender esta capa de alineamiento es fundamental para sacarle partido a Claude, y es uno de los conceptos que se abordan en un curso para empezar con Claude desde cero antes de pasar a usos mas avanzados.

Preguntas frecuentes

Que diferencia hay entre RLHF y Constitutional AI?

RLHF usa preferencias humanas para entrenar un modelo de recompensa. Constitutional AI reemplaza gran parte de ese feedback humano por feedback generado por la propia IA siguiendo principios escritos, lo que hace la seguridad mas escalable. Claude combina ambos.

RLHF le ensena nuevos datos al modelo?

No. El conocimiento proviene del preentrenamiento. RLHF ajusta el comportamiento y las preferencias del modelo: como responde, que instrucciones sigue y que peticiones rechaza, no la informacion que contiene.

Elimina RLHF las alucinaciones?

No las elimina. RLHF puede reducirlas y ensenar al modelo a admitir cuando no esta seguro, pero no garantiza que las respuestas sean factualmente correctas.

Que algoritmo de refuerzo se usa en RLHF?

El mas habitual es PPO (Proximal Policy Optimization), que optimiza el modelo para maximizar la puntuacion del modelo de recompensa mientras evita alejarse demasiado del modelo de partida.

Términos relacionados

Fuentes