El gran salto de la programación en el mundo real con Opus 4.7
Anthropic acaba de lanzar opus 4.7, y no se trata de otra actualización incremental. Si has tenido problemas con modelos de IA que pierden el hilo a mitad de una solicitud de extracción compleja, esto te interesa. Es una mejora directa respecto a la versión 4.6 anterior, dirigida específicamente a las tareas más difíciles de ingeniería de software.
La cuestión es que llevábamos tiempo esperando un modelo que no necesitara supervisión constante. Aunque 4.6 era bueno, opus 4.7 introduce un nivel de autonomía que cambia la forma de gestionar las tareas a largo plazo. No se limita a sugerir código: empieza a comportarse como un ingeniero sénior que realmente comprende la arquitectura.
Los primeros comentarios de equipos como GitHub y Cursor muestran un enorme salto en fiabilidad. De hecho, muchos usuarios informan de que el modelo opus 4.7 estándar resuelve tareas que ni siquiera los modelos más capaces de la generación anterior podían abordar. Se trata de perseverar durante horas sin abandonar el problema.
Y hablemos de cifras, porque son difíciles de ignorar. No estamos viendo mejoras del 2% o el 3%. Estamos observando avances de dos dígitos en todos los ámbitos dentro de entornos de producción reales. Esto no consiste solo en superar benchmarks sintéticos, sino en resolver tareas reales en repositorios reales.
Cómo resuelve Opus 4.7 los desafíos de la programación autónoma
Uno de los mayores puntos débiles de la programación con IA ha sido el síndrome del «modelo perezoso». Ya conoces el procedimiento: el modelo te entrega un envoltorio genérico y te dice que «completes el resto». Con opus 4.7, ese comportamiento se reduce considerablemente. Escribe la implementación real, no solo la estructura básica.
En las pruebas internas de Rakuten, opus 4.7 resolvió tres veces más tareas de producción que la versión anterior. Eso supone un aumento del 300% en utilidad. Es especialmente visible al comparar escenarios de bajo y alto esfuerzo. Una ejecución de opus 4.7 con bajo esfuerzo ahora iguala lo que antes requería un esfuerzo medio del modelo antiguo.
- Coherencia a largo plazo: Mantiene la coherencia durante sesiones de varias horas.
- Menos errores de herramientas: Notion informó de que los errores al llamar a herramientas disminuyeron a un tercio.
- Correcciones autónomas: El modelo identifica sus propios errores y los corrige durante el proceso.
- Comprensión implícita de requisitos: Es el primer modelo que supera la prueba de «requisitos ocultos» de Notion.
«Opus 4.7 no solo escribe código; razona sobre las implicaciones de ese código dentro de un sistema más amplio y cambiante».
Incluso Cognition, el equipo responsable de Devin, señaló que opus 4.7 no se queda atascado ante los problemas difíciles ni abandona. Itera. Si estás creando flujos de trabajo agénticos en los que el modelo debe explorar un sistema de archivos y ejecutar comandos de terminal, opus 4.7 es ahora tu referencia.
Conceptos de visión y seguridad en Opus 4.7
Aunque el salto en programación es la principal noticia, la mejora de visión de opus 4.7 es posiblemente más impresionante para el trabajo diario. Ahora el modelo puede manejar imágenes con un lado largo de hasta 2.576 píxeles. Es más del triple de la resolución de los modelos Claude anteriores.
Esto no consiste solo en «ver» mejor, sino en extraer datos de alta densidad. Si alguna vez has intentado proporcionar a una IA un gráfico financiero denso o un plano arquitectónico complejo, sabrás que normalmente alucina los detalles pequeños. Con opus 4.7, esos píxeles se procesan realmente en lugar de reducirse a una imagen borrosa.
Más allá de la visión, debemos hablar de seguridad. Anthropic utiliza opus 4.7 como primer banco de pruebas público para nuevas medidas de seguridad de ciberseguridad. Esto forma parte del Project Glasswing, una enorme colaboración en la que participan AWS, Apple y Google para evitar que la IA se convierta en una herramienta de hacking automatizado.
Es una tensión extraña. El modelo interno Mythos Preview es tan bueno encontrando vulnerabilidades de día cero que Anthropic tuvo que limitar intencionadamente algunas de esas capacidades en opus 4.7. Intentan crear un modelo «seguro» que pueda seguir ayudando a los investigadores, pero que no permita a un aficionado derribar una red eléctrica.
Gestión de entradas de mayor resolución con Opus 4.7
Para sacar el máximo partido a las funciones de análisis de archivos de opus 4.7, debes comprender cómo gestiona las cargas de alta resolución. No existe un interruptor de API para activarlo; las propias capas del modelo se volvieron a entrenar para aceptar dimensiones mayores. Solo tienes que enviar la imagen original.
Sin embargo, vigila tus tokens. El cálculo es aproximadamente (ancho × alto) / 750. Una imagen de 1 megapíxel te costará unos 1.334 tokens. Si subes 20 imágenes a la interfaz web o 600 mediante la API, los costes aumentan rápidamente con opus 4.7.
| Función |
Claude antiguo (4.6) |
Nuevo Opus 4.7 |
| Resolución máxima |
~1,1 MP |
~3,75 MP |
| Lado más largo |
~1.568 px |
2.576 px |
| Benchmarks de visión |
54,5% (XBOW) |
98,5% (XBOW) |
| Coste en tokens |
Igual por token |
Igual por token |
Este aumento de resolución cambia las reglas del juego para los agentes de uso informático. Si quieres que opus 4.7 observe una captura de un monitor 4K y haga clic en un icono específico de 16x16 píxeles, ahora puede «ver» realmente ese icono. Los modelos anteriores básicamente entrecerraban los ojos ante un JPEG borroso.
Guía paso a paso para migrar a Opus 4.7
¿Listo para migrar tu stack? Buenas noticias: opus 4.7 es un reemplazo directo. El ID del modelo es claude-opus-4-7. Ya está disponible en Amazon Bedrock, Google Vertex AI y Microsoft Foundry. Pero no actives el cambio y te desentiendas; hay algunos obstáculos técnicos que superar.
Primero, revisa tus prompts. Una de las cosas más sorprendentes de opus 4.7 es su capacidad para seguir instrucciones. Ahora es mucho más literal. Si escribiste prompts «flexibles» para modelos antiguos con el fin de darles margen creativo, opus 4.7 podría seguirlos de forma demasiado estricta y producir resultados rígidos.
Segundo, hablemos de la API. Si sigues utilizando los antiguos encabezados beta para funciones como el pensamiento extendido o el streaming de herramientas, es hora de poner orden. La mayoría de esas funciones ya son nativas en opus 4.7. También deberías pasar a modos de pensamiento adaptativo en lugar de tokens de presupuesto codificados.
Un consejo para usuarios intensivos: GPT Proto ofrece una API unificada que permite acceder a opus 4.7 junto con modelos de OpenAI y Google. Esto no solo simplifica el código, sino que a menudo permite ahorrar hasta un 70% en los costes de las API de IA más utilizadas. Es una forma más inteligente de gestionar una arquitectura multimodelo.
Integración del modelo de razonamiento Opus 4.7
Si tu aplicación depende del razonamiento profundo, querrás explorar específicamente la integración del modelo de razonamiento opus 4.7. No se trata solo de generar texto, sino de la «cadena de pensamiento» que tiene lugar antes de la respuesta. En opus 4.7, este proceso está más refinado y es menos propenso a entrar en bucles.
Para utilizarlo eficazmente, debes abandonar la sintaxis obsoleta thinking: {type: "enabled"}. En su lugar, usa thinking: {type: "adaptive"} junto con los nuevos parámetros de esfuerzo. Esto permite que el modelo decida cuánta «capacidad mental» dedicar según la dificultad de tu solicitud específica.
- Actualiza la cadena del modelo a
claude-opus-4-7.
- Elimina los encabezados beta antiguos, como
effort-2025-11-24.
- Establece el nivel de esfuerzo (empieza con
high para programación).
- Prueba tus prompts actuales para detectar sesgos de interpretación literal.
- Supervisa el uso de tokens con el nuevo tokenizador.
Y no olvides el nuevo comando /ultrareview si utilizas Claude Code. Es una sesión especializada diseñada para detectar errores que incluso el opus 4.7 estándar podría pasar por alto en una primera revisión. Es una excelente forma de aprovechar tus créditos Pro o Max.
Errores comunes y dificultades de Opus 4.7
La mayor trampa en la que cae la gente con opus 4.7 es ignorar los cambios del tokenizador. Anthropic actualizó el tokenizador para hacerlo más eficiente con la lógica, pero el efecto secundario es que el mismo bloque de texto ahora produce más tokens. Espera un aumento de entre 1,0 y 1,35 veces en el recuento de tokens para la misma entrada.
¿Otro error? Suponer que «mejor» siempre significa «más fácil». Como opus 4.7 piensa más —especialmente en flujos de trabajo agénticos—, genera más tokens de salida. Si no tienes cuidado con tus límites, tu factura de API podría aumentar aunque el precio por millón de tokens siga siendo de 5/25 dólares.
También he visto desarrolladores utilizar el análisis de archivos de opus 4.7 sin tener en cuenta la nueva resolución. Envían archivos enormes y reciben cargos elevados por tokens porque no se dieron cuenta de que el modelo ahora «ve» tres veces más detalles. Incluso podrías querer reducir manualmente la resolución de las imágenes si no necesitas ese nivel de detalle.
Por último, está el problema de las medidas de seguridad. Como opus 4.7 está entrenado para ser más prudente con la ciberseguridad, en ocasiones podría rechazar una solicitud legítima si se parece demasiado a un intento de «hackeo». Si eres investigador de seguridad ofensiva ética, debes solicitar acceso al Cyber Verification Program para eliminar esas restricciones.
Cómo evitar que se rompan los prompts durante la transición a Opus 4.7
Un problema concreto es la «expansión de instrucciones». Como opus 4.7 sigue las instrucciones con tanta precisión, si tienes un prompt largo, divagante y con objetivos contradictorios, el modelo podría priorizar la parte equivocada. En los modelos antiguos, normalmente ganaban las «sensaciones»; en opus 4.7, gana el texto literal.
Pero esto también tiene una ventaja. Ahora puedes utilizar lógica más compleja en tus prompts sin que el modelo se confunda. La clave es ser explícito. Si quieres un formato específico, defínelo con precisión. No dependas de que el modelo «capte la idea» a partir de tus ejemplos.
- Revisa tus prompts de sistema: Asegúrate de que sean concisos y no contengan comandos contradictorios.
- Prueba los casos límite: Comprueba cómo gestiona el modelo las solicitudes ambiguas en comparación con 4.6.
- Usa el parámetro de esfuerzo: No utilices el esfuerzo
max para tareas sencillas; es un desperdicio de tokens.
- Verifica las llamadas a herramientas: El modelo es mejor al llamar a herramientas, pero asegúrate de que tus esquemas estén actualizados.
Entonces, ¿qué ocurre con esos rechazos extraños? Si opus 4.7 marca una solicitud como «perjudicial» porque le pides analizar código C++ antiguo en busca de desbordamientos de búfer, no te frustres. Es la nueva capa de seguridad en acción. Reformular el prompt para enfatizar el contexto defensivo y educativo suele ayudar.
Consejos de expertos y mejores prácticas para Opus 4.7
Si quieres ser un usuario avanzado, debes dominar los nuevos niveles de esfuerzo. Anthropic añadió un nuevo nivel xhigh entre high y max. Para programar, high o xhigh deberían ser tu punto de partida predeterminado. max queda reservado para esos momentos de «no tengo ni idea de por qué esto no funciona».
Otra función avanzada son los presupuestos de tareas. Es una función de la API en beta pública que permite establecer un límite de tokens para una única tarea de larga duración. Permite que opus 4.7 gestione sus propias prioridades. Dedicará más tokens a la lógica difícil y será más conciso en las partes triviales para mantenerse dentro del presupuesto.
Para quienes gestionan una escala masiva, considera utilizar las herramientas de búsqueda web de opus 4.7 mediante la programación inteligente de GPT Proto. Su plataforma puede cambiar automáticamente entre los modos «prioridad al rendimiento» (usando opus 4.7 para todo) y «prioridad al coste» (enviando las consultas sencillas a modelos más económicos), sin que tengas que reescribir tu lógica.
Presta atención también a las funciones de memoria. Las pruebas internas de Anthropic muestran que opus 4.7 es mucho mejor utilizando memoria basada en el sistema de archivos. Recuerda notas entre distintas sesiones y rondas de una tarea. Esto significa que puedes proporcionar menos contexto en los prompts posteriores y ahorrar tokens de entrada con el tiempo.
Uso del esfuerzo Xhigh y los presupuestos de tareas en Opus 4.7
El nivel de esfuerzo xhigh es el punto óptimo para la mayoría de los trabajos complejos de ingeniería. Ofrece un aumento significativo en profundidad de razonamiento respecto a high sin el consumo extremo de tokens de max. De hecho, el esfuerzo predeterminado de Claude Code ahora está configurado como xhigh porque ofrece el mejor equilibrio para los desarrolladores.
Cuando combinas xhigh con el razonamiento de opus 4.7 con búsqueda web, obtienes un modelo capaz de investigar una biblioteca, analizar una implementación y después escribir el código, todo ello respetando un presupuesto estricto. Es la forma más eficiente de crear herramientas agénticas hoy.
«Establecer un presupuesto para una tarea no consiste solo en ahorrar dinero; también obliga al modelo a ser más estratégico con sus ciclos de razonamiento».
Veamos las cifras. En Rakuten-SWE-Bench, el opus 4.7 de «bajo esfuerzo» rindió tan bien como el 4.6 de «esfuerzo medio». Esto sugiere que puedes reducir los niveles de esfuerzo para muchas tareas y aun así obtener mejores resultados que el mes pasado. Así es como optimizas el retorno de la inversión.
Mi recomendación es la siguiente: audita tus cargas de trabajo actuales. Todo lo que fuera límite en 4.6 debería trasladarse a opus 4.7 con esfuerzo medium al principio. Podrías descubrir que ni siquiera necesitas los ajustes de gama alta para conseguir un enorme aumento de rendimiento.
El rendimiento competitivo de Opus 4.7
¿Cómo se compara opus 4.7 con los titanes? En los benchmarks más recientes de GDPval-AA —que evalúan el valor económico en el mundo real, como la creación de hojas de cálculo y presentaciones— opus 4.7 es ahora el modelo de última generación. Superó a GPT-5.4 xhigh y Gemini 3.1 Pro y ocupó el primer puesto.
Es importante señalar que, aunque opus 4.7 es increíble, todavía no es tan potente como el Mythos Preview interno de Anthropic. Sin embargo, Mythos cuesta cinco veces más. A 5 dólares por millón de tokens de entrada, opus 4.7 es fácilmente el modelo con mejor relación calidad-precio del mercado para el razonamiento avanzado.
En las tareas de análisis financiero, opus 4.7 muestra una cohesión entre tareas mucho mayor. No olvida las suposiciones realizadas en la hoja de cálculo cuando pasa a redactar el informe resumido. Esta coherencia es lo que separa un juguete de una herramienta profesional. Por eso tantas empresas están trasladando sus procesos de producción a este modelo específico.
Si quieres explorar todos los modelos de IA disponibles, opus 4.7 debería estar entre los primeros de tu lista. Puedes consultar todos los modelos Claude y otros modelos de IA destacados en el panel de GPT Proto para comparar su latencia y rendimiento en tiempo real. Es la mejor forma de comprobar cómo se traducen los benchmarks teóricos en tu región real.
Valor económico real de Opus 4.7 frente a sus competidores
Uno de los logros más impresionantes es la forma en que opus 4.7 gestiona la «coherencia a largo plazo». En un benchmark de Imbue, el modelo construyó desde cero un motor TTS completo en Rust. Esto incluía el modelo neuronal, los kernels SIMD y una demostración para navegador. Después verificó su propio trabajo mediante un reconocedor de voz. Es un nivel de lógica de varios pasos que a GPT-5.4 le costó completar sin intervención humana.
Veamos la realidad económica. Si un ingeniero cuesta 150 dólares por hora y opus 4.7 puede automatizar una tarea que antes tardaba tres horas, el retorno de la inversión es astronómico incluso teniendo en cuenta los costes de los tokens. Como opus 4.7 comete menos errores al llamar a herramientas, pasas menos tiempo depurando el agente y más tiempo lanzando funcionalidades.
| Métrica |
GPT-5.4 xhigh |
Opus 4.7 Max |
Gemini 3.1 Pro |
| Puntuación ELO de GDPval |
1677 |
1698 |
1642 |
| Programación (SWE-bench) |
Muy alto |
Última generación |
Alto |
| Coste de API (entrada/salida) |
$15/$75 |
$5/$25 |
$1.25/$5 |
| Claridad visual |
Excelente |
Superior |
Buena |
Y no olvides la flexibilidad del modelo de pago por uso. Puedes gestionar la facturación de tu API y escalar durante los ciclos de desarrollo intensivo o reducirla durante el mantenimiento. Con una ventaja de precio de entre 3 y 5 veces frente a modelos como Mythos, opus 4.7 es la opción práctica para las startups en expansión.
El futuro del trabajo no consiste simplemente en «usar IA», sino en utilizar la IA adecuada para cada tarea. Ahora mismo, para todo lo relacionado con código, visión o documentos complejos, opus 4.7 es el claro ganador. Es más que una actualización: es el nuevo estándar de oro de lo que debe ser un modelo profesional de trabajo.
Escrito por: GPT Proto
«Desbloquea los principales modelos de IA del mundo con la plataforma de API unificada de GPT Proto».