Coste por token (input y output)
El coste por token es el modelo de precios de la API de Claude: pagas por cada token que envías (input) y por cada token que el modelo genera (output), con tarifas distintas para cada uno.
El coste por token es la forma en que Anthropic factura el uso de la API de Claude: no pagas por petición ni por suscripción, sino por la cantidad de tokens procesados. El precio se divide en dos tarifas separadas: los tokens de entrada (input), que son todo lo que envías al modelo, y los tokens de salida (output), que son lo que Claude genera como respuesta. El output casi siempre cuesta bastante más que el input.
Cómo funciona
Cada vez que llamas a la API, Anthropic cuenta los tokens en dos direcciones:
- Input: tu prompt completo, el system prompt, el historial de la conversación, los documentos adjuntos y las definiciones de herramientas. Todo lo que ocupa la ventana de contexto entrante cuenta.
- Output: el texto que el modelo devuelve, incluido el razonamiento visible en modos como extended thinking.
El precio se expresa habitualmente por millón de tokens (MTok). Cada modelo de la familia Claude tiene su propia tarifa: los modelos más capaces (tipo Opus) cuestan más por token que los más rápidos y económicos (tipo Haiku), con los intermedios (Sonnet) en medio. La asimetría clave es que generar un token cuesta varias veces más que leerlo: en la práctica el output suele valer entre 4 y 5 veces el input, según el modelo.
Como referencia mental, un token equivale aproximadamente a 4 caracteres en inglés, algo menos en español. Unas 750 palabras rondan los 1.000 tokens.
Por qué importa
Entender esta división cambia cómo diseñas cualquier aplicación sobre Claude. Dos decisiones tienen impacto directo en la factura:
- Cuánto contexto mandas. Reenviar un historial largo o documentos enteros en cada llamada infla el input. Aquí es donde entra el prompt caching, que permite reutilizar bloques de contexto repetidos a una fracción del coste.
- Cuánto pides que genere. Como el output es lo caro, limitar la longitud de la respuesta con
max_tokensy pedir salidas concisas reduce el gasto de forma notable.
Para quien construye productos, el coste por token es lo que determina el margen unitario. Si aprendes a construir sobre la API de Claude con estas variables en mente, puedes estimar el coste por usuario antes de escalar y evitar sorpresas.
Ejemplo práctico
Imagina una llamada con 10.000 tokens de input y 500 de output. Si el modelo cuesta 3 USD por MTok de input y 15 USD por MTok de output:
input: 10.000 / 1.000.000 x 3 = 0,030 USD
output: 500 / 1.000.000 x 15 = 0,0075 USD
total por llamada ≈ 0,0375 USDMultiplica eso por miles de llamadas diarias y verás por qué optimizar contexto y longitud de respuesta no es un detalle menor. Los precios exactos dependen del modelo y cambian con el tiempo, así que consulta siempre la página oficial de precios de Anthropic.
Errores comunes
- Pensar que solo se paga por la respuesta. El input siempre cuenta, y en aplicaciones con contexto largo suele ser el grueso del gasto.
- Confundir tokens con palabras o caracteres. La tokenización no es exacta: nombres propios, código y otros idiomas generan más tokens de lo esperado.
- Ignorar el system prompt y las herramientas. Se envían en cada llamada y consumen input aunque no los veas en la conversación.
- Asumir tarifa única. Input y output tienen precios distintos, y cada modelo de la familia tiene los suyos.
Preguntas frecuentes
¿Por qué el output cuesta más que el input?
Generar tokens es computacionalmente más caro que leerlos: el modelo debe ejecutar una pasada completa por cada token que produce, mientras que el input se procesa de forma más eficiente. Por eso el output suele valer entre 4 y 5 veces más.
¿El system prompt cuenta como tokens de input?
Sí. El system prompt, el historial de la conversación, los documentos adjuntos y las definiciones de herramientas se envían en cada llamada y cuentan como tokens de input facturables.
¿Cómo puedo reducir el coste por token en Claude?
Usa prompt caching para reutilizar contexto repetido, limita max_tokens, pide respuestas concisas, elige el modelo más económico que cumpla la tarea y evita reenviar historiales innecesariamente largos.
¿Cuántas palabras hay en un millón de tokens?
Aproximadamente 750.000 palabras en inglés, algo menos en español porque este idioma genera más tokens por palabra. Como regla, 1.000 tokens rondan las 750 palabras.