Jueves, 10 de septiembre de 2026  ·  LATAM / Español
tecnica

Extended Thinking

Extended Thinking es la capacidad de Claude de generar un bloque de razonamiento paso a paso antes de responder, dedicando tokens y tiempo de cómputo extra a resolver problemas complejos con mayor precisión.

También: extended thinking · pensamiento extendido · razonamiento extendido Claude · thinking mode · modo de razonamiento

Extended Thinking es un modo de Claude en el que el modelo produce un bloque de razonamiento interno explícito antes de dar la respuesta final. En lugar de contestar de inmediato, Claude piensa en voz alta durante un presupuesto de tokens configurable, explorando pasos intermedios, verificando su lógica y corrigiéndose. Está disponible en los modelos de la familia Claude que lo soportan (a partir de Claude 3.7 Sonnet y en la serie 4) y se activa desde la API o la interfaz.

Cómo funciona

Cuando activas Extended Thinking, Claude genera primero un bloque thinking separado de la respuesta visible. En ese bloque desarrolla el razonamiento: descompone el problema, prueba enfoques, descarta caminos erróneos y llega a una conclusión antes de redactar la respuesta al usuario.

En la API controlas cuánto puede razonar mediante un parámetro de presupuesto de tokens (budget_tokens). Cuantos más tokens le asignes, más profundo puede ser el análisis, a costa de mayor latencia y coste. El razonamiento consume tokens de salida, así que un problema con presupuesto de 10.000 tokens de thinking factura esos tokens aunque no aparezcan en la respuesta final.

{
  "model": "claude-sonnet-4",
  "thinking": {
    "type": "enabled",
    "budget_tokens": 10000
  },
  "messages": [...]
}

El bloque de pensamiento es visible en la respuesta de la API, lo que aporta transparencia sobre cómo el modelo llegó a su conclusión. En algunos contextos ese razonamiento se resume por motivos de seguridad.

Por qué importa

Extended Thinking mejora de forma medible el rendimiento en tareas que requieren varios pasos: matemáticas, programación compleja, planificación de agentes, análisis lógico y problemas donde una respuesta rápida suele fallar. En la práctica, para quien construye con Claude significa poder subir la calidad de las respuestas en los casos difíciles sin cambiar de modelo, simplemente asignando más presupuesto de razonamiento.

También cambia el diseño de aplicaciones. En un flujo de agente, el thinking permite que Claude planifique qué herramientas invocar y en qué orden antes de actuar, lo que reduce errores encadenados. Si te interesa este tipo de flujos, conviene aprender a orquestar agentes e integraciones con MCP para sacarle partido en escenarios reales.

Cuándo usarlo y cuánto cuesta

No todo se beneficia de Extended Thinking. Para preguntas simples, resúmenes o respuestas directas, activarlo solo añade latencia y coste sin mejorar el resultado. Reserva el razonamiento extendido para:

El coste práctico es que los tokens de thinking se facturan como tokens de salida. Un presupuesto generoso puede multiplicar el gasto por consulta, así que conviene ajustarlo al tipo de tarea.

Errores comunes

El primer malentendido es pensar que Extended Thinking siempre da mejores respuestas: en tareas triviales solo introduce ruido y coste. El segundo es confundir el bloque de pensamiento con la respuesta final; son partes separadas y no debes mostrar el thinking crudo al usuario final sin tratarlo. El tercero es olvidar que el razonamiento consume presupuesto de tokens de salida, lo que puede agotar la ventana disponible en conversaciones largas. Por último, no confundas Extended Thinking con la cadena de pensamiento que pides por prompt: aquí es una capacidad nativa del modelo, con su propio canal y presupuesto controlado, no un truco de redacción del system prompt.

Preguntas frecuentes

¿Extended Thinking está disponible en todos los modelos de Claude?

No. Es una capacidad de los modelos más recientes que la soportan, a partir de Claude 3.7 Sonnet y la serie Claude 4. Los modelos anteriores no ofrecen el modo de razonamiento extendido.

¿Los tokens de razonamiento se cobran?

Sí. El bloque de thinking consume tokens de salida y se factura como tal, aunque no forme parte de la respuesta visible. Por eso conviene ajustar el presupuesto al tipo de tarea.

¿Cuándo NO conviene usar Extended Thinking?

En tareas simples como resúmenes cortos, respuestas directas o preguntas factuales, el razonamiento extendido solo añade latencia y coste sin mejorar la calidad del resultado.

¿Es lo mismo que pedir cadena de pensamiento en el prompt?

No exactamente. La cadena de pensamiento por prompt es una técnica de redacción; Extended Thinking es una capacidad nativa del modelo con su propio canal separado y un presupuesto de tokens configurable desde la API.

Términos relacionados

Fuentes