
Claude Opus 5: qué cambia respecto a Opus 4.8

Imagen: Anthropic — documentación oficial de Claude. Reproducida bajo fair use con fines de comentario crítico.
Anthropic publicó Claude Opus 5 como modelo sucesor de Opus 4.8, orientado a “codificación agéntica compleja y trabajo empresarial”. El lanzamiento trae varias novedades que cambian cómo se invoca el modelo — y al menos un cambio incompatible que rompe comportamiento que existía en Opus 4.8. Si hay integraciones en producción, conviene leer antes de migrar.
Lo que pasó
Anthropic liberó claude-opus-5 con tres cambios de comportamiento que importan a quien ya invoca la familia Opus desde código:
- Pensamiento activado por defecto. En Opus 4.8, las requests corrían sin pensamiento salvo que se indicara
thinking: {"type": "adaptive"}. En Opus 5 la misma request corre con el modelo decidiendo cuándo y cuánto pensar por turno, controlado por el parámetroeffort. max_tokensahora es límite estricto sobre pensamiento + texto de respuesta. Aplicaciones ajustadas finamente en Opus 4.8 a la salida esperada pueden empezar a truncarse porque el pensamiento consume parte del presupuesto.- Desactivar el pensamiento requiere effort
higho inferior. Combinarthinking: {"type": "disabled"}conxhighomaxdevuelve HTTP 400. Es un cambio incompatible: en Opus 4.8 ambas opciones eran independientes.
Anthropic también incorporó cuatro funciones nuevas relevantes para integraciones largas o de varios turnos:
- Cambios de herramientas a mitad de conversación (beta). Se pueden agregar o quitar tools entre turnos preservando la caché de prompts. Header beta:
mid-conversation-tool-changes-2026-07-01. - Modo de fallbacks
"default". El servicio elige los modelos de respaldo por categoría de rechazo. Header beta:server-side-fallback-2026-07-01. - Mínimo de caché de prompts reducido a 512 tokens (antes 1024). Prompts que no calificaban para caché ahora califican sin tocar el código.
- Modo rápido (vista previa de investigación). $10/M tokens de entrada y $50/M de salida. Solo en la API de Claude; no disponible todavía en Bedrock, Google Cloud ni Microsoft Foundry.
Por qué importa para quien desarrolla agentes
El cambio de comportamiento más disruptivo es el pensamiento por default. Para el desarrollador significa tres cosas concretas:
Presupuesto de tokens. Si la integración actual asume que max_tokens es espacio de respuesta, ahora es espacio total. Para prompts que requieren cadenas largas de razonamiento antes de responder, hay que revisar el límite o aceptar truncado.
Decisión de effort. El nuevo rango completo — low, medium, high, xhigh, max — convierte a effort en el control principal. Anthropic recomienda default high y ajustar según evaluaciones: bajar donde la calidad se mantenga para ahorrar tokens y latencia, subir para trabajo exigente. En xhigh o max recomienda un max_tokens grande para que el modelo tenga espacio de pensar y orquestar subagentes y herramientas.
Compatibilidad con thinking: disabled. Quien hoy desactiva el pensamiento con effort alto tiene dos caminos: mantener el pensamiento desactivado y bajar effort a high o inferior, o mantener el effort alto y eliminar el campo thinking para que el modelo piense por default. Hay además un efecto secundario a tener en cuenta: con el pensamiento desactivado, Opus 5 puede emitir llamadas a herramientas dentro del texto en lugar de bloques tool_use, o filtrar etiquetas XML internas al mensaje visible.
Mid-conversation tool changes: el cambio silencioso más útil
La posibilidad de agregar o quitar herramientas entre turnos preservando la caché de prompts es, en la práctica, el cambio que más impacta workflows agénticos largos. Antes, descubrir una nueva tool a mitad de sesión significaba reenviar la lista actualizada y pagar la invalidación de caché — costo en dinero y latencia. Con Opus 5 la caché sobrevive, la latencia no se penaliza.
Para quien construye agentes que descubren capabilities en tiempo de ejecución (research, navegación web bajo demanda, ejecución de código condicional, RAG sobre fuentes heterogéneas), es un antes y un después. Sigue en beta, pero la categoría de problema que resuelve es concreta.
Para quién tiene sentido migrar ya
Sí, migrar:
- Quien usa Opus 4.8 para coding agéntico y tareas empresariales largas.
- Quien mantiene prompts medianos que no entraban en la caché por el umbral de 1024 tokens. Ahora entran desde 512.
- Quien orquesta agentes con listas de tools dinámicas que pagaban el costo de la caché invalidada.
Esperar:
- Quien ya ajustó
max_tokensfino para Opus 4.8 esperando la salida exacta. La nueva contabilidad de pensamiento + texto puede romper assumptions. - Quien depende de
thinking: disabledcon effort alto. Hay que tomar una decisión explícita (bajar effort o aceptar el pensamiento). - Quien opera exclusivamente sobre Bedrock, Google Cloud o Microsoft Foundry. El modo rápido no está disponible todavía; el resto de las funciones sí.
Lo que conviene recordar
- Pensamiento por default cambia la economía de tokens. Auditar
max_tokensantes de migrar. effortes ahora el control principal, nothinking. Mover el dial por evaluación, no por intuición.- Mid-conversation tool changes es el cambio que más impacta arquitectura de agentes, aunque esté en beta.
- Mínimo de caché a 512 tokens es un upgrade silencioso para integraciones con prompts medianos.
Fuente
- Novedades en Claude Opus 5 — Anthropic, documentación oficial, julio 2026.
- Documentación relacionada: effort, pensamiento, caché de prompts, cambios de herramientas a mitad de conversación.

