Fine-tuning (ajuste fino)
El fine-tuning o ajuste fino es el proceso de reentrenar un modelo de lenguaje ya preentrenado con un conjunto de datos propio para especializarlo en una tarea, dominio o estilo concretos.
El fine-tuning (ajuste fino) es el proceso de tomar un modelo de lenguaje ya preentrenado y continuar su entrenamiento con un conjunto de datos específico, ajustando sus pesos internos para que rinda mejor en una tarea, dominio o estilo determinados. En lugar de entrenar un modelo desde cero, se parte del conocimiento general que ya tiene y se lo especializa con ejemplos etiquetados de tu caso concreto.
Cómo funciona
Un modelo como Claude pasa primero por un preentrenamiento masivo sobre grandes volúmenes de texto y luego por fases de alineamiento (como RLHF y Constitutional AI). El fine-tuning es un paso adicional y opcional: se le presentan cientos o miles de pares entrada-salida que ejemplifican el comportamiento deseado, y mediante descenso de gradiente se actualizan los parámetros del modelo para minimizar el error sobre esos ejemplos.
Existen variantes según cuánto se modifica el modelo:
- Fine-tuning completo: se ajustan todos los pesos. Es costoso y requiere mucha infraestructura.
- Fine-tuning eficiente en parámetros (PEFT): técnicas como LoRA congelan la mayor parte del modelo y entrenan solo pequeñas matrices añadidas. Mucho más barato y rápido.
Un matiz importante con Claude: Anthropic no ofrece fine-tuning abierto de sus modelos de la misma forma que otros proveedores. Históricamente, el ajuste fino de modelos Claude ha estado disponible en plataformas como Amazon Bedrock para modelos concretos (por ejemplo, versiones de Haiku), y suele estar sujeto a disponibilidad y a acuerdos empresariales. Comprueba siempre la documentación vigente antes de asumir que puedes afinar un modelo Claude concreto.
Por qué importa
Para quien construye con Claude, el fine-tuning cambia la ecuación de coste y control. Un modelo afinado puede seguir un formato de salida muy estricto, adoptar el tono de una marca o dominar una jerga técnica sin necesidad de explicárselo en cada prompt. Eso reduce el número de tokens de instrucción y, potencialmente, la latencia y el gasto por llamada.
Pero también añade fricción: hay que recopilar y limpiar datos, gestionar versiones del modelo afinado y volver a entrenar cuando cambian los requisitos. Antes de llegar ahí, la mayoría de casos se resuelven con ingeniería de prompts o con recuperación de contexto.
Fine-tuning frente a las alternativas
La regla práctica: empieza por lo más barato y sube solo si hace falta.
- Prompt engineering: instrucciones claras y ejemplos en el propio prompt. Cero coste de entrenamiento.
- RAG: inyectar conocimiento externo actualizado en el contexto. Ideal cuando el problema es "el modelo no sabe algo", no "el modelo no se comporta como quiero".
- Fine-tuning: cuando necesitas un comportamiento consistente que el prompt no logra de forma fiable, y tienes datos suficientes.
Si tu objetivo es lanzar producto rápido, aprender a construir sobre la API de Claude suele darte más recorrido que afinar un modelo desde el primer día.
Errores comunes
- Usar fine-tuning para añadir conocimiento factual: para eso suele ser mejor RAG. El ajuste fino cambia comportamiento y estilo, no es una base de datos.
- Datos escasos o sesgados: unos pocos ejemplos ruidosos degradan el modelo en lugar de mejorarlo.
- Olvidar que envejece: un modelo afinado queda anclado a sus datos y hay que mantenerlo.
- Confundirlo con RLHF: el RLHF es una fase de alineamiento con feedback humano que aplica el proveedor; el fine-tuning supervisado que tú haces es distinto en objetivo y método.
Preguntas frecuentes
¿Se puede hacer fine-tuning de Claude?
Anthropic no ofrece fine-tuning abierto de forma general. El ajuste fino de modelos Claude ha estado disponible en plataformas como Amazon Bedrock para modelos concretos y bajo condiciones específicas. Consulta la documentación oficial vigente antes de planificarlo.
¿Cuándo conviene fine-tuning en lugar de prompt engineering?
Cuando necesitas un comportamiento muy consistente que el prompt no consigue de forma fiable y dispones de suficientes ejemplos de calidad. Para la mayoría de casos, un buen prompt o RAG resuelven el problema sin coste de entrenamiento.
¿Fine-tuning o RAG?
Usa RAG cuando el problema es que el modelo no conoce cierta información, ya que inyecta datos actualizados en el contexto. Usa fine-tuning cuando el problema es el comportamiento, el formato o el estilo de las respuestas.
¿Qué diferencia hay entre fine-tuning y RLHF?
El RLHF es una fase de alineamiento con feedback humano que aplica el proveedor del modelo durante su desarrollo. El fine-tuning supervisado que hace un cliente parte de ejemplos entrada-salida propios para especializar el modelo en una tarea.