Viernes, 11 de septiembre de 2026  ·  LATAM / Español
Concepto

Coste por token (input y output)

El coste por token es el modelo de precios de la API de Claude: pagas por cada token que envías (input) y por cada token que el modelo genera (output), con tarifas distintas para cada uno.

También: coste por token · precio por token · cost per token · input tokens · output tokens · precio de la API de Claude · token pricing

El coste por token es la forma en que Anthropic factura el uso de la API de Claude: no pagas por petición ni por suscripción, sino por la cantidad de tokens procesados. El precio se divide en dos tarifas separadas: los tokens de entrada (input), que son todo lo que envías al modelo, y los tokens de salida (output), que son lo que Claude genera como respuesta. El output casi siempre cuesta bastante más que el input.

Cómo funciona

Cada vez que llamas a la API, Anthropic cuenta los tokens en dos direcciones:

El precio se expresa habitualmente por millón de tokens (MTok). Cada modelo de la familia Claude tiene su propia tarifa: los modelos más capaces (tipo Opus) cuestan más por token que los más rápidos y económicos (tipo Haiku), con los intermedios (Sonnet) en medio. La asimetría clave es que generar un token cuesta varias veces más que leerlo: en la práctica el output suele valer entre 4 y 5 veces el input, según el modelo.

Como referencia mental, un token equivale aproximadamente a 4 caracteres en inglés, algo menos en español. Unas 750 palabras rondan los 1.000 tokens.

Por qué importa

Entender esta división cambia cómo diseñas cualquier aplicación sobre Claude. Dos decisiones tienen impacto directo en la factura:

Para quien construye productos, el coste por token es lo que determina el margen unitario. Si aprendes a construir sobre la API de Claude con estas variables en mente, puedes estimar el coste por usuario antes de escalar y evitar sorpresas.

Ejemplo práctico

Imagina una llamada con 10.000 tokens de input y 500 de output. Si el modelo cuesta 3 USD por MTok de input y 15 USD por MTok de output:

input:  10.000 / 1.000.000 x 3  = 0,030 USD
output:    500 / 1.000.000 x 15 = 0,0075 USD
total por llamada ≈ 0,0375 USD

Multiplica eso por miles de llamadas diarias y verás por qué optimizar contexto y longitud de respuesta no es un detalle menor. Los precios exactos dependen del modelo y cambian con el tiempo, así que consulta siempre la página oficial de precios de Anthropic.

Errores comunes

Preguntas frecuentes

¿Por qué el output cuesta más que el input?

Generar tokens es computacionalmente más caro que leerlos: el modelo debe ejecutar una pasada completa por cada token que produce, mientras que el input se procesa de forma más eficiente. Por eso el output suele valer entre 4 y 5 veces más.

¿El system prompt cuenta como tokens de input?

Sí. El system prompt, el historial de la conversación, los documentos adjuntos y las definiciones de herramientas se envían en cada llamada y cuentan como tokens de input facturables.

¿Cómo puedo reducir el coste por token en Claude?

Usa prompt caching para reutilizar contexto repetido, limita max_tokens, pide respuestas concisas, elige el modelo más económico que cumpla la tarea y evita reenviar historiales innecesariamente largos.

¿Cuántas palabras hay en un millón de tokens?

Aproximadamente 750.000 palabras en inglés, algo menos en español porque este idioma genera más tokens por palabra. Como regla, 1.000 tokens rondan las 750 palabras.

Términos relacionados

Fuentes