OpenAI Codex ha tenido dos vidas muy distintas. La primera fue como una API de generación de código que alimentaba en silencio a GitHub Copilot y entusiasmó a millones de desarrolladores con la idea de escribir software en lenguaje natural. La segunda vida está ocurriendo ahora mismo y es bastante más ambiciosa. Hoy, Codex ya no es solo un modelo al que llamas desde una API. Es un agente de programación con IA en la nube, integrado directamente en ChatGPT, capaz de leer tu repositorio, escribir nuevas funciones, corregir errores y ejecutar pruebas, todo sin que tengas que tocar el teclado.
Si buscaste "qué es OpenAI Codex hoy" esperando la antigua API de completado, este artículo te pondrá al día por completo.

OpenAI Codex, antes y ahora
El modelo de 2021 que lo empezó todo
Cuando OpenAI lanzó Codex en agosto de 2021, se presentó como GPT-3 entrenado específicamente con código. El modelo se entrenó con miles de millones de líneas de código fuente público, sobre todo de GitHub, y podía generar Python, JavaScript, TypeScript, Ruby y Go que funcionaban a partir de descripciones en lenguaje natural.
Los resultados eran realmente impresionantes para 2021. Podías escribir "escribe una función que ordene una lista de diccionarios por una propiedad anidada" y obtener algo que de verdad funcionaba. Los desarrolladores lo integraban a través de la API de OpenAI y creaban desde herramientas de autocompletado hasta generadores de documentación y redactores automáticos de pruebas.
Lo más conocido construido sobre Codex fue GitHub Copilot, la herramienta de sugerencias de código en línea que Microsoft lanzó en 2022 tras adquirir GitHub. Durante mucho tiempo, Codex y Copilot fueron prácticamente sinónimos en la comunidad de desarrolladores.
Por qué OpenAI lo dio de baja en 2023
En marzo de 2023, OpenAI dejó en desuso los endpoints originales de la API de Codex. El motivo era sencillo: los modelos GPT más nuevos habían superado a Codex en prácticamente todos los benchmarks relevantes para la generación de código. GPT-3.5 Turbo y, después, GPT-4 simplemente escribían mejor código que un modelo especializado entrenado únicamente para eso.
Es un patrón que se repite en la industria de la IA. Los modelos especializados con ajuste fino tienden a ser absorbidos con el tiempo por modelos generales más grandes. Los endpoints de la API de Codex se retiraron y se redirigió a los desarrolladores a usar la API de chat completions con GPT-4.
Durante unos dos años, "Codex" como nombre de producto quedó inactivo.
Qué es Codex de verdad en 2027

Un agente de programación, no un modelo
En mayo de 2025, OpenAI recuperó el nombre Codex con un producto completamente distinto. El nuevo Codex no es un modelo. Es un agente de programación en la nube que funciona en su propio entorno aislado, puede acceder a tu código y realiza acciones de varios pasos para completar tareas de ingeniería de software.
El cambio de arquitectura es importante. El Codex original era un modelo al que le lanzabas un prompt una sola vez y recibías el completado. El nuevo Codex es un agente que:
- Lee los archivos reales de tu repositorio y la estructura de tu proyecto
- Divide una tarea en subtareas más pequeñas y las resuelve en orden
- Escribe código, lo ejecuta, revisa el resultado y vuelve a intentarlo cuando algo falla
- Envía pull requests con el trabajo terminado para que lo revises
- Puede gestionar varias tareas en paralelo, de forma asíncrona
Esto no es autocompletado. Se parece más a un desarrollador junior al que asignas tareas y al que consultas al final del día.
Cómo encaja dentro de ChatGPT
El nuevo Codex vive como una función dentro de ChatGPT, accesible para los suscriptores de Plus y Pro. Interactúas con él a través de un panel lateral donde asignas tareas en lenguaje natural. No necesitas estar en el mismo editor ni siquiera en la misma aplicación.
Cuando asignas una tarea a Codex, se crea un entorno aislado con una copia nueva de tu repositorio, realiza el trabajo en ese entorno y después propone cambios o los envía para tu revisión. El entorno se ejecuta en la nube, lo que significa que no usa los recursos de tu equipo y no depende de que tu terminal esté abierta.
💡 Conviene saberlo: El entorno se reinicia entre tareas. Codex no conserva una memoria persistente de sesiones de programación anteriores más allá del estado del propio repositorio.
El modelo que impulsa el nuevo agente Codex se basa en o3, la familia de modelos de razonamiento de OpenAI. Esto explica por qué funciona bastante mejor que un modelo de completado directo en tareas de programación de varios pasos. La arquitectura de razonamiento le permite recorrer cadenas complejas de lógica antes de comprometerse con una implementación.
Qué hace Codex en la práctica

Escribir código a partir de lenguaje natural
El caso de uso principal sigue siendo el mismo de siempre: describes lo que quieres y Codex lo escribe. Pero la implementación es muy distinta a la de 2021.
En lugar de completar una sola función, Codex ahora puede:
- Implementar una función completa en varios archivos a la vez
- Seguir las convenciones de código existentes leyendo primero tu código
- Añadir las importaciones adecuadas, actualizar las definiciones de tipos y escribir las pruebas que correspondan
- Hacer un commit con un mensaje coherente que describa con precisión el cambio
- Señalar ambigüedades en tu petición antes de escribir una sola línea
Por ejemplo, podrías pedirle a Codex: "Añade limitación de tasa al endpoint /api/upload. Permite 10 solicitudes por minuto y por IP de usuario, devuelve un estado 429 con un encabezado Retry-After cuando se supere el límite y añade una prueba para el comportamiento de la limitación." Codex leerá el código de tu endpoint actual, averiguará qué middleware o biblioteca usa ya tu proyecto e implementará una solución que encaje con tu stack concreto en lugar de una plantilla genérica.
Esto es cualitativamente distinto a recibir un fragmento de código en una ventana de chat. Codex lee el contexto real de tu proyecto antes de escribir un solo carácter.
Depurar sin que te lo pidan
Uno de los comportamientos más sorprendentes es la detección proactiva de errores. Cuando Codex implementa algo, ejecuta tu batería de pruebas (si está configurada) y detecta los fallos antes de mostrarte el resultado.
Si las pruebas fallan, Codex itera. No te entrega código roto con una explicación de lo que hay que arreglar. Lee el error, ajusta su implementación y vuelve a ejecutar las pruebas. Este ciclo puede repetirse varias veces antes de que veas ningún resultado. Ves el trabajo terminado, no el ensayo y error.
Esto es lo que hace que el enfoque de agente sea preciso. Una herramienta de autocompletado te da el código. Un agente de programación se hace responsable de que el código funcione de verdad.
Ejecutar código en un entorno aislado
La arquitectura del entorno aislado importa por tres razones distintas:
- Seguridad: Codex no puede afectar por accidente a tus archivos locales. Todo ocurre en un entorno contenido que se reinicia después de cada tarea.
- Repetibilidad: El entorno está limpio y es coherente, así que los resultados no varían según el estado de tu equipo.
- Concurrencia: Puedes asignar varias tareas al mismo tiempo y Codex trabaja en ellas en paralelo, procesando una cola de tickets mientras tú te centras en otra cosa.
💡 Consejo práctico: Codex funciona mejor cuando tu repositorio tiene un script de configuración claro (como un Makefile o scripts de package.json) y pruebas que funcionan. El agente los usa para verificar su propio resultado. Un proyecto sin pruebas no le da a Codex nada contra lo que validar, así que su confianza en su propio resultado baja de forma notable.
Codex frente a GitHub Copilot

La pregunta obvia cuando OpenAI anunció el nuevo Codex fue: ¿en qué se diferencia de GitHub Copilot? La confusión es comprensible. Copilot se construyó sobre el Codex original. Ambas son herramientas de IA que escriben código. Las dos están conectadas con OpenAI a través de distintas relaciones organizativas. Pero a estas alturas son productos realmente distintos, que sirven a partes diferentes del flujo de trabajo de desarrollo.
Dónde coinciden las dos
- Ambas pueden generar código a partir de descripciones en lenguaje natural
- Ambas funcionan con varios lenguajes de programación y frameworks
- Ambas pueden sugerir pruebas, documentación y definiciones de tipos
- Ambas tienen en cuenta el contexto de tu código existente
Dónde gana cada una
| Capacidad | GitHub Copilot | OpenAI Codex (2025) |
|---|
| Sugerencias en línea en tiempo real | Sí | No |
| Integración con el IDE | Profunda (VS Code, JetBrains, etc.) | Limitada |
| Tareas autónomas de varios archivos | Limitadas | Sí |
| Ejecuta y prueba su propio código | No | Sí |
| Funciona sin tener abierto tu IDE | No | Sí |
| Tareas asíncronas y en paralelo | No | Sí |
| Acceso al modelo | Suscripción de GitHub | ChatGPT Plus o Pro |
La forma más sencilla de verlo: Copilot te ayuda a escribir código más rápido mientras trabajas. Codex toma una tarea y la completa mientras tú haces otra cosa por completo.
Copilot es una herramienta potente en tus manos. Codex es un agente en el que delegas.
El flujo de trabajo del desarrollador con Codex

Tareas que gestiona sin ti
Existe una categoría concreta de trabajo de ingeniería de software que es a la vez realmente tediosa y bien definida: la clase de tarea en la que sabes exactamente qué hay que hacer, pero llevarla a cabo cuesta una hora de escritura mecánica, buscar los archivos adecuados, actualizar pruebas y crear un PR. Codex está especialmente bien adaptado a esta categoría.
Las buenas tareas para Codex incluyen:
- Añadir nuevos endpoints de API con operaciones CRUD estándar cuando el patrón ya está establecido
- Escribir pruebas unitarias para funciones existentes que no tienen cobertura
- Migrar una base de código de una versión de biblioteca a otra, incluyendo la actualización de importaciones obsoletas
- Corregir un error concreto y bien descrito cuando la causa se entiende y la solución es clara
- Añadir instrumentación de registros o de observabilidad a funciones existentes
- Generar tipos de TypeScript a partir de un esquema JSON o de un conjunto de ejemplos de respuestas de API
- Actualizar la documentación para reflejar cambios recientes en el comportamiento del código
Estas tareas comparten un rasgo común: para una persona son tediosas, pero están bien delimitadas y se pueden verificar con pruebas. Codex destaca aquí precisamente porque puede definir criterios de éxito (pruebas que pasan, resultado correcto) e iterar hacia ellos de forma sistemática.
Cuándo sigues teniendo que tomar el control
Codex no sustituye el criterio de ingeniería. Hay categorías de trabajo en las que entregar una tarea a un agente es la decisión equivocada, sin importar lo capaz que sea ese agente.
Las decisiones de arquitectura siguen siendo cosa de personas. ¿Esto debería ser un microservicio o un monolito? Codex hará lo que le digas, pero no notará que todo tu enfoque es incorrecto para el problema que tienes entre manos.
Los requisitos ambiguos producen resultados irregulares. Si no puedes describir con precisión cómo es el resultado terminado, Codex producirá algo, pero probablemente no lo que necesitas. Se aplica el viejo principio de la informática: basura entra, basura sale, solo que ahora más rápido.
Los cambios sensibles desde el punto de vista de la seguridad necesitan revisión humana, sea quien sea el autor del primer borrador. Los flujos de autenticación, los modelos de permisos y las implementaciones criptográficas merecen una inspección cuidadosa incluso cuando la IA ha escrito bien la implementación.
La optimización del rendimiento basada en datos de perfilado requiere entender qué parte del sistema es realmente lenta, algo que Codex no puede determinar sin acceso a la instrumentación en tiempo de ejecución.
El modelo mental que mejor funciona es tratar a Codex como a un contratista experimentado que necesita especificaciones claras. Cuanto más precisamente definas la tarea, mejor será el resultado.
Otras herramientas de programación con IA que vale la pena conocer

Alternativas de código abierto y gratuitas
El terreno de la programación con IA no es un juego de dos jugadores. Existen varias alternativas sólidas, muchas accesibles sin una suscripción de pago a una sola plataforma.
DeepSeek v3 se ha convertido en una opción seria para tareas de generación de código. Este modelo de pesos abiertos obtiene resultados competitivos frente a modelos de clase GPT-4 en benchmarks de programación y puede ejecutarse en tu equipo o usarse a través de plataformas como Picasso IA. Su sucesor, DeepSeek v3.1, mejora aún más el rendimiento y destaca especialmente en tareas de refactorización en varios lenguajes, donde el contexto entre archivos importa.
Kimi K2 Instruct, de Moonshot AI, es otra opción sólida, diseñada desde el principio con la programación agéntica como prioridad. Maneja bien el análisis de código con contexto largo, algo que importa cuando le pides a un modelo que razone sobre un repositorio grande con muchos archivos interdependientes. Kimi K2.6 continúa esa trayectoria con capacidades ampliadas de uso de herramientas para agentes.
Granite 8B Code Instruct 128K y Granite 20B Code Instruct 8K de IBM son modelos de código diseñados específicamente para bases de código empresariales, con licencias permisivas adecuadas para uso comercial.
Dónde encajan GPT-5 y Claude
Si ya estás en el ecosistema de ChatGPT, los modelos más nuevos de OpenAI manejan el código con una capacidad real. GPT-5 razona sobre varios archivos a la vez con soltura y es el modelo al que más recurren los desarrolladores cuando una tarea es demasiado grande o matizada para una herramienta más limitada. GPT-4.1 sigue siendo una opción práctica para las tareas de programación cotidianas a un costo menor.
Por el lado de Anthropic, Claude 4 Sonnet se ha ganado una gran reputación entre los desarrolladores por producir código limpio y bien estructurado. Muchos lo prefieren expresamente para tareas de refactorización porque tiende a conservar la intención original mientras mejora la legibilidad y la estructura. Claude 4.5 Sonnet amplía esto con capacidades agénticas más sólidas, lo que lo convierte en una alternativa atractiva para equipos que quieren integrarlo a través de la API en lugar de usar ChatGPT directamente.
Para tareas que exigen mucho razonamiento, o4-mini y DeepSeek R1 son los modelos destacados. Estos modelos analizan un problema antes de dar una respuesta, lo que reduce de forma notable los errores en tareas complejas de algoritmos o depuración en las que el enfoque correcto no es evidente de entrada.
💡 Para equipos que desarrollan aplicaciones con IA: todos estos modelos están disponibles en la colección de LLM de Picasso IA, lo que significa que puedes probarlos en una sola interfaz sin crear cuentas de API separadas para cada proveedor.
Qué significa esto para el desarrollo de software

El cambio que ya está ocurriendo
El modelo Codex original hizo que los desarrolladores individuales fueran más rápidos. El nuevo Codex hace algo estructuralmente distinto: separa el acto de escribir código de la decisión sobre qué código escribir.
Cuando un desarrollador asigna una tarea a Codex y revisa el resultado en lugar de escribir cada línea, su papel cambia. Dedica más tiempo a la especificación, la revisión y el criterio arquitectónico, y menos a la implementación mecánica. No es un cambio menor. Afecta a cómo los equipos delimitan el trabajo, cómo estiman el esfuerzo y qué habilidades generan más valor.
Los desarrolladores que más se benefician de este cambio son los que pueden actuar como revisores técnicos eficaces: hacer las preguntas adecuadas sobre los casos límite, detectar errores sutiles en la lógica y saber cuándo oponerse a una implementación propuesta que funciona técnicamente pero crea problemas a largo plazo.
Velocidad y el nuevo cuello de botella
Hay un aspecto que el nuevo Codex cambia de forma decisiva: el cuello de botella del desarrollo de software se está desplazando de escribir a revisar. Cuando generar código es rápido, la limitación pasa a ser tu capacidad para evaluar si el código generado es correcto, mantenible y seguro.
Esto da más valor a la comprensión lectora, a la disciplina en las pruebas y a las habilidades de revisión de código. También crea nuevos patrones de colaboración. En lugar de que dos desarrolladores escriban código juntos, puede que haya un desarrollador y un agente que escribe código mientras el desarrollador revisa y marca la dirección. Los equipos todavía están averiguando cómo hacer que esto funcione bien en distintos tipos de proyectos y composiciones de equipo.

Algunas organizaciones ya informan de que tareas bien delimitadas que antes ocupaban un día completo de un desarrollador se completan en menos de una hora con flujos de trabajo asistidos por agentes. Esa mejora no se reparte por igual. Depende en gran medida de la calidad de la base de código, de la cobertura de pruebas y de lo precisa que sea la especificación de la tarea. Pero la tendencia general es lo bastante constante como para tomarla en serio.
Lo que no desaparece en este modelo es la necesidad de personas que entiendan el software a nivel de sistemas. Codex puede escribir una función, pero no puede decirte que tu modelo de datos está fundamentalmente mal, ni que la funcionalidad que acabas de pedirle creará una condición de carrera a gran escala. El criterio a ese nivel sigue en manos de personas.
Empieza a crear con IA ahora mismo

Codex es una pieza de un panorama mucho más amplio. La misma ola de capacidades de IA que convirtió una API de autocompletado en un agente de programación autónomo también ha transformado la generación de imágenes, la producción de video, la síntesis de voz y el trabajo creativo de todo tipo.
Si quieres experimentar con los modelos de IA que definen 2027 sin gestionar una docena de cuentas distintas, Picasso IA los reúne en un solo lugar. Desde modelos de lenguaje (LLM) como GPT-5 y Claude 4 Sonnet hasta generadores de imágenes con más de 91 modelos entre los que elegir, pasando por herramientas de texto a video, superresolución, generación de música con IA y sincronización labial, la plataforma te permite moverte entre capacidades sin cambiar de herramienta ni de contexto.
Los desarrolladores, diseñadores y creadores que más partido le están sacando a este momento son los que están adquiriendo soltura con varias capacidades de IA, no solo los que saben pedir cosas a un asistente de programación. Elige un modelo. Genera algo. Comprueba lo que estas herramientas hacen de verdad cuando las llevas más allá de los usos obvios.
Pruébalo en Picasso IA y mira lo que creas.