Procesamiento por lotes (Batch)
El procesamiento por lotes agrupa muchas peticiones a una API de IA en un único envío asíncrono que se procesa en segundo plano, a cambio de un descuento sobre el precio estándar por token.
El procesamiento por lotes (batch) es un modo de uso de una API de IA en el que envías un gran número de peticiones juntas y el proveedor las procesa de forma asíncrona, sin garantizar respuesta inmediata. A cambio de renunciar a la latencia baja, pagas menos por token. En Claude esto se implementa mediante la Message Batches API de Anthropic, pensada para cargas de trabajo masivas que no necesitan resultado en tiempo real.
Cómo funciona
En lugar de llamar al endpoint de mensajes una vez por cada solicitud, construyes un fichero con muchas peticiones independientes, cada una con su propio custom_id, y lo envías en una sola llamada. El sistema encola el lote y lo procesa en segundo plano. Cuando termina, recuperas los resultados asociando cada respuesta a su custom_id.
Características clave del batch en Claude:
- Cada lote admite un gran volumen de peticiones (del orden de decenas de miles) y un tamaño máximo por envío.
- El objetivo de procesamiento es completar el lote dentro de una ventana de 24 horas, aunque en la práctica suele terminar mucho antes.
- El descuento es del 50% sobre el precio estándar tanto en tokens de entrada como de salida.
- Cada petición del lote es independiente: puede usar distinto modelo, system prompt, herramientas o parámetros.
El batch es compatible con otras optimizaciones. Puedes combinarlo con prompt_caching para abaratar aún más los prefijos repetidos entre peticiones del mismo lote.
Por qué importa
Para quien construye con Claude, el batch cambia la economía de las tareas de alto volumen. Si necesitas clasificar un millón de reseñas, generar resúmenes de un archivo documental o etiquetar un dataset entero, hacerlo petición a petición en tiempo real es caro y choca con los límites de tasa. El batch reduce el coste a la mitad y desacopla tu proceso del rate limit síncrono.
La contrapartida es la latencia: no sirve para un chatbot ni para nada que un usuario espere en pantalla. Es una herramienta de backend, para procesos programados o pipelines de datos. Aprender a construir sobre la API de Claude, incluidos estos modos de ejecución, es justo el terreno de un curso para empezar a construir con la API de Claude.
Ejemplo y cifras
Imagina que tienes 200.000 tickets de soporte y quieres categorizarlos con Claude. En modo síncrono pagarías el precio completo por token y tendrías que gestionar reintentos y límites de tasa durante horas. En batch envías todo en uno o pocos lotes, pagas la mitad y recoges los resultados cuando estén listos, normalmente en cuestión de horas.
{"custom_id": "ticket-001", "params": {"model": "claude-sonnet-4", "max_tokens": 256, "messages": [...]}}
{"custom_id": "ticket-002", "params": {...}}Cada línea es una petición autónoma. Recuperas cada resultado buscando su custom_id.
Errores comunes
- Usarlo para tiempo real. El batch no acelera nada; su ventaja es el precio, no la velocidad. Para respuestas inmediatas usa llamadas síncronas o streaming.
- Confundirlo con streaming. El streaming devuelve tokens de una petición según se generan; el batch procesa muchas peticiones en diferido. Son conceptos opuestos.
- Asumir orden garantizado. Los resultados no vienen necesariamente en el orden de envío; por eso el
custom_ides imprescindible. - Ignorar el manejo de errores parciales. Dentro de un lote, algunas peticiones pueden fallar mientras otras tienen éxito. Debes revisar el estado de cada una.
Preguntas frecuentes
¿Cuánto se ahorra usando el procesamiento por lotes en Claude?
La Message Batches API de Anthropic aplica un 50% de descuento sobre el precio estándar por token, tanto en entrada como en salida, respecto a las llamadas síncronas.
¿Cuánto tarda en procesarse un lote?
El objetivo es completar cada lote dentro de una ventana de 24 horas, aunque en la práctica suele terminar mucho antes. No es apto para tareas que necesiten respuesta inmediata.
¿En qué se diferencia el batch del streaming?
El streaming devuelve los tokens de una sola respuesta a medida que se generan, para baja latencia. El batch procesa muchas peticiones de forma asíncrona y diferida a cambio de un menor coste.
¿Puedo combinar batch con prompt caching?
Sí. Puedes usar prompt caching dentro de las peticiones de un lote para abaratar los prefijos repetidos, acumulando ambos ahorros.