<\!-- wp:group {"className":"tldr-box","backgroundColor":"pale-cyan-blue"} -->
<\!-- wp:heading {"level":3} -->

📌 Resumen rápido (TL;DR)

<\!-- /wp:heading --> <\!-- wp:list -->
  • Este análisis examina GPT-5.4, el modelo frontera de OpenAI, repasando sus mejoras en razonamiento, contexto y uso de herramientas. Una guía para entender qué cambia respecto a versiones previas y su papel en los agentes IA de 2026.
<\!-- /wp:list -->
<\!-- /wp:group -->
ℹ️ Portal independiente: AgentesAutonomosIA.com es un sitio divulgativo independiente sobre agentes de IA y automatización empresarial. El contenido es informativo y no constituye asesoramiento técnico, legal ni empresarial profesional.

💡 ¿Para qué sirven los agentes autónomos de IA?

Los agentes autónomos ejecutan tareas complejas de forma independiente: navegan por internet, escriben código, gestionan archivos y coordinan flujos de trabajo completos.

📋 Resumen ejecutivo: GPT-5.4 fue lanzado el 5 de marzo de 2026 por OpenAI. Es el primer modelo mainline con computer use nativo, integra las capacidades de codificación de GPT-5.3-Codex, soporta 1M tokens de contexto, introduce Tool Search y es el modelo de razonamiento más eficiente en tokens de OpenAI a la fecha. Precio API: 2,50$/15$ por millón de tokens.

Qué es GPT-5.4 y cuándo llegó

El 5 de marzo de 2026, OpenAI lanzó GPT-5.4, su modelo frontier más reciente, apenas 2 días después de haber publicado GPT-5.3 Instant. La velocidad del lanzamiento refleja la carrera que vive la industria: ese mismo 5 de febrero, cuando Anthropic lanzó Opus 4.6, OpenAI respondió con GPT-5.3 Codex 20 minutos después. GPT-5.4 consolida todos esos avances en 1 solo modelo.

OpenAI lo describe como su modelo más capaz y eficiente para trabajo profesional. GPT-5.4 es genuinamente diferente a GPT-5.2 en 3 dimensiones que importan: consolida las capacidades de codificación de la línea Codex en el modelo principal, añade computer use nativo por primera vez en un modelo mainline, y mejora radicalmente la eficiencia en el uso de tokens para razonamiento.

La disponibilidad es inmediata en todos los canales: ChatGPT (como GPT-5.4 Thinking para usuarios Plus, Team y Pro), API de OpenAI (gpt-5.4), y Codex (app nativa para macOS y Windows). GPT-5.4 Pro llega simultáneamente para usuarios Pro y Enterprise.

Computer Use nativo: el gran salto de GPT-5.4

Este es el cambio más estructuralmente significativo. Por primera vez, un modelo mainline de OpenAI tiene capacidades nativas de uso de ordenador. Esto significa que el modelo puede operar directamente con software, navegar interfaces, completar formularios, verificar resultados y corregir errores en un ciclo build-run-verify-fix.

La implementación tiene 2 dimensiones complementarias. Por un lado, GPT-5.4 es excelente escribiendo código que opera ordenadores mediante librerías como Playwright. Por otro lado, puede emitir comandos directos de ratón y teclado en respuesta a capturas de pantalla. No son capacidades separadas: se integran en 1 mismo flujo de trabajo donde el modelo elige el método más apropiado para cada subtarea.

🖥️ Qué permite esto en práctica: Flujos de automatización que antes requerían RPA especializada ahora pueden describirse en lenguaje natural. El modelo opera aplicaciones legacy, procesa documentos, mueve datos entre sistemas y verifica el resultado. Para empresas con sistemas internos no APIzados, esto abre casos de uso que antes eran inviables con IA.

En benchmarks de computer use (OSWorld-Verified y WebArena Verified), GPT-5.4 logra resultados competitivos. Claude Opus 4.6 tenía ventaja antes de este lanzamiento; GPT-5.4 acorta esa brecha de forma significativa.

Codificación: GPT-5.4 hereda lo mejor de GPT-5.3-Codex

GPT-5.4 absorbe las capacidades de codificación de GPT-5.3-Codex, el modelo especializado en programación que OpenAI lanzó semanas antes. Esto significa que el modelo principal ahora tiene el mismo nivel de competencia en código que el modelo especializado, sin necesidad de elegir entre capacidades de razonamiento general y de codificación.

En SWE-bench Verified, GPT-5.4 alcanza aproximadamente un 74-75% de resolución de issues reales de GitHub, competitivo con Sonnet 4.6 (79.6%) pero por debajo de Opus 4.6 (80.8%). Donde GPT-5.4 destaca especialmente es en contextos donde el razonamiento y la codificación se mezclan: análisis de código con explicación de negocio, generación de modelos financieros, creación de scripts de automatización con documentación integrada.

En Codex, el modelo corre en modo /fast a 1,5 veces la velocidad estándar manteniendo la misma inteligencia. Para iteraciones rápidas de debugging y refactorización esto es una ventaja práctica relevante. Internamente, OpenAI usó GPT-5.4 para identificar bugs en sus propios runs de entrenamiento y gestionar su propio despliegue.

Benchmarks y métricas clave de GPT-5.4

BenchmarkGPT-5.2GPT-5.4GPT-5.4 Pro
GDPval (trabajo profesional)70.9%83%
Spreadsheet modelling68.4%87.3%
ARC-AGI-2 Semi-Private74.0%83.3%
Alucinaciones (vs GPT-5.2)base-33% afirmaciones
Errores por respuesta completabase-18%

El benchmark de spreadsheet modelling (87.3% vs 68.4% de GPT-5.2) es la mejora más llamativa para usuarios de negocio. Un salto de casi 19 puntos porcentuales en tareas de Excel que se nota inmediatamente. Para analistas financieros y equipos de operaciones que viven en hojas de cálculo, este es posiblemente el benchmark más relevante de toda la tabla.

En ARC-AGI-2, GPT-5.4 Pro alcanza un 83.3% a 16,41 dólares por tarea, mientras que GPT-5.4 estándar logra un 74% a 1,52 dólares por tarea. La diferencia de rendimiento es real pero el tradeoff de coste (10x más caro por 9 puntos) hay que evaluarlo según el caso de uso concreto.

La mejora en alucinaciones merece destacarse: afirmaciones individuales un 33% menos propensas a ser falsas, respuestas completas con un 18% menos de errores frente a GPT-5.2. En contextos donde la precisión factual es crítica (legal, médico, financiero), esta mejora tiene impacto directo en fiabilidad del sistema.

Diferencias entre GPT-5.4 Thinking y GPT-5.4 Pro

OpenAI lanza GPT-5.4 en 2 variantes diferenciadas. GPT-5.4 Thinking es el modelo de razonamiento estándar que reemplaza a GPT-5.2 Thinking (el cual se retirará el 5 de junio de 2026). Disponible para usuarios Plus, Team y Pro. En ChatGPT, Thinking proporciona un plan de acción antes de generar la respuesta, permitiendo al usuario corregir el rumbo durante el proceso si ve que el modelo va en una dirección incorrecta.

GPT-5.4 Pro es la variante de máximo rendimiento, solo disponible para planes Pro y Enterprise, y también en la API. Según los benchmarks de ARC-AGI-2, Pro supera a Thinking en aproximadamente 9 puntos porcentuales pero a un coste 10 veces mayor en API (30$/180$ por millón vs 2,50$/15$).

💡 Cuándo usar cada variante: GPT-5.4 Thinking cubre el 90% de los casos de uso profesionales con una fracción del coste de Pro. La versión Pro tiene sentido para tareas de máxima complejidad donde cada error tiene consecuencias significativas: due diligence crítica, análisis regulatorio complejo, sistemas de alta disponibilidad. Para el resto, Thinking ofrece la mejor relación rendimiento/coste.

1 de las innovaciones más relevantes de GPT-5.4 para desarrolladores de agentes es Tool Search. A medida que los sistemas agenticos escalan, el número de herramientas disponibles puede crecer hasta cientos. El problema: pasarle todas las definiciones de herramientas al modelo en cada llamada consume muchos tokens y degrada el rendimiento.

Tool Search resuelve esto. El modelo puede buscar y seleccionar las herramientas relevantes de un repositorio grande sin necesidad de recibirlas todas en el contexto. Esto permite construir ecosistemas de herramientas que escalen a cientos de conectores sin pagar un coste de tokens proporcional ni perder inteligencia en la selección.

Para sistemas de automatización enterprise con docenas de integraciones (CRM, ERP, comunicaciones, bases de datos, APIs externas), Tool Search es la diferencia entre un agente eficiente y uno que se ahoga en su propio contexto.

Contexto 1M y eficiencia en tokens

En la API, GPT-5.4 soporta hasta 1 millón de tokens de contexto, en línea con Claude Opus 4.6 y Sonnet 4.6. Esto permite a los agentes planificar, ejecutar y verificar tareas a lo largo de horizontes largos sin perder el hilo de lo que han hecho antes.

GPT-5.4 es también el primer modelo mainline de OpenAI entrenado con soporte nativo de compactación (compaction). Le permite mantener contexto relevante en trayectorias de agente largas sin que el contexto crezca linealmente con el tiempo de ejecución. La eficiencia en tokens de razonamiento también mejora: GPT-5.4 llega a las mismas conclusiones que GPT-5.2 usando significativamente menos tokens internos.

GPT-5.4 para trabajo profesional: finanzas, legal, documentos

El benchmark de spreadsheet modelling (87.3%) es la cifra más llamativa para usuarios de negocio. GPT-5.4 no solo genera código para analizar datos: genera modelos financieros completos en Excel, lee templates existentes, añade fórmulas, crea tablas dinámicas y produce análisis estructurados que siguen las convenciones del sector.

Para usuarios enterprise, la integración con ChatGPT for Excel (también lanzado el 5 de marzo) es directamente relevante. El modelo puede operar dentro de Excel como copiloto nativo, generando y ejecutando código de análisis, interpretando datos y produciendo visualizaciones sin salir de la aplicación.

En el sector legal, la mejora en comprensión de documentos es especialmente notable. El modelo lee contextos muy largos de forma coherente (briefs legales completos, registros de litigios extensos, contratos complejos) y sintetiza con una precisión que antes requería modelos Opus-class.

GPT-5.4 vs Claude Opus 4.6: comparativa directa

DimensiónClaude Opus 4.6GPT-5.4
Codificación (SWE-bench)80.8% ✓~74-75%
GDPval trabajo profesional1606 Elo ✓83% (escala diferente)
Computer use (OSWorld)72.7% ✓Competitivo (nuevo)
Spreadsheet modelling87.3% ✓
Horizonte tarea autónoma14.5h ✓~10h
Agent Teams nativosSí ✓No (aún)
Tool Search ecosistemas grandesNoSí ✓
Precio API (input/output)5$/25$ MTok2,50$/15$ MTok ✓

La conclusión práctica: para flujos agenticos complejos de larga duración y codificación en bases de código grandes, Claude Opus 4.6 sigue siendo la elección más sólida. Para análisis de datos en Excel, flujos con muchos tools y sensibilidad al coste de API, GPT-5.4 tiene argumentos reales.

Que GPT-5.4 cueste la mitad en API (2,50$/MTok vs 5$/MTok de entrada) es relevante a escala. Para un sistema que procesa millones de tokens al día, esa diferencia puede ser determinante en la viabilidad económica del proyecto.

Precio y planes disponibles

En la API: 2,50 dólares por millón de tokens de entrada y 15 dólares por millón de tokens de salida para GPT-5.4 estándar. GPT-5.4 Pro: 30$/180$ por millón. En ChatGPT: GPT-5.4 Thinking para Plus (20$/mes), Team y Pro (200$/mes) desde el lanzamiento. GPT-5.2 Thinking seguirá disponible en el picker hasta el 5 de junio de 2026.

Conclusión: GPT-5.4 completa la convergencia entre razonamiento y codificación

GPT-5.4 representa un momento de madurez para la línea GPT-5. OpenAI ha conseguido integrar las capacidades especializadas de su línea Codex en el modelo principal sin sacrificar rendimiento general, mientras añade computer use nativo y mejoras sustanciales en eficiencia de tokens.

Para los profesionales que trabajan con agentes autónomos, la respuesta a la pregunta Opus 4.6 vs GPT-5.4 depende del caso de uso: codificación y tareas de larga duración favorecen a Opus 4.6; análisis de datos y ecosistemas con muchos tools favorecen a GPT-5.4. Lo que está claro es que la competencia entre Anthropic y OpenAI está elevando rápidamente el nivel de lo que es posible automatizar con IA.

Artículo relacionado: Claude Opus 4.6 y Agent Teams: Análisis Completo (2026)

Publicado el 6 de marzo de 2026. GPT-5.4 fue lanzado el 5 de marzo de 2026. Consulta la documentación oficial de OpenAI para los datos más actualizados.

Daniel Bellido

Consultor IA y automatizacion. Sobre nosotros

<\!-- wp:html --> <\!-- /wp:html -->

Autor

· Creador y editor de AgentesAutonomosIA. Análisis basado en documentación oficial de Anthropic, OpenAI y fuentes académicas como arXiv y Stanford HAI.

Última revisión: junio de 2026. Contenido divulgativo sobre inteligencia artificial; las herramientas y sus funciones evolucionan rápido, verifica siempre en la documentación oficial de cada plataforma.

Sigue aprendiendo sobre agentes IA

author avatar
Daniel Bellido
Consultor de inteligencia artificial especializado en agentes autónomos y automatización empresarial. Ayudo a pymes y empresas españolas a implementar soluciones de IA agentica con herramientas como n8n, Make, LangChain y AutoGPT. Analizo plataformas, flujos de trabajo y casos de uso reales para que cualquier empresa pueda dar el salto a la IA en 2026.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *