GPT-6 Astra, el modelo de OpenAI que opera la computadora

El 3 de septiembre de 2026 OpenAI presentó GPT-6 Astra. El modelo opera el navegador, las hojas de cálculo, los formularios y otras aplicaciones de principio a fin. Se le delega una tarea completa y la ejecuta en la computadora, con más velocidad que una persona.
El despliegue empezó con organizaciones seleccionadas. Luego llegará a los planes Plus, Pro, Business y Enterprise de ChatGPT, a la API y a AWS.

Las cifras que reportó OpenAI
La comparación es contra GPT-5.6 Sol, el modelo anterior. Todas las cifras son las del anuncio; todavía no hay replicación independiente.
| Evaluación | Qué mide | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|
| FrontierMath Tier 4 | Matemáticas de frontera; contribuyó a resolver problemas abiertos | 98 % | — |
| ARC-AGI-3 | Razonamiento en situaciones nuevas (66 % con el harness estándar) | 99.9 % | 7.8 % |
| ExploitBench | Ciberseguridad ofensiva y defensiva | 100 % | 78.5 % |
| OSWorld 2.0 (subconjunto) | Uso de computadora, tareas reales | 72.6 % | 65.7 % |
| Sobrepaso de alcance | Alineación: hacer más de lo pedido (evaluación post-incidente de Hugging Face) | 0 % | 48 % sin salvaguardas |
En ARC-AGI-3, Sol obtenía 7.8 %. El 99.9 % de Astra corresponde a una configuración específica; con el harness estándar baja a 66 %, que sigue siendo un salto de un orden de magnitud.
En OSWorld Astra resuelve más tareas y lo hace en aproximadamente la mitad del tiempo.
El 0 % de sobrepaso de alcance es la métrica que habilita la delegación. Un agente que ejecuta más de lo pedido no se puede poner a trabajar sin supervisión. En la evaluación reportada esa cifra bajó de 48 % a 0 %.
Nivel crítico en ciberseguridad
Astra es el primer modelo de OpenAI en alcanzar el nivel «Crítico» de capacidad en ciberseguridad bajo su Preparedness Framework. Con las herramientas adecuadas puede descubrir vulnerabilidades desconocidas y desarrollar exploits sin guía humana paso a paso.
La versión pública rechazará tareas avanzadas de ciberseguridad. Las capacidades completas quedan restringidas a organizaciones verificadas. OpenAI reforzó el aislamiento interno, el cifrado de checkpoints y el monitoreo de trayectorias completas, incluidas las cadenas de razonamiento.
Quien integre el modelo tiene que diseñar contra la versión a la que realmente tendrá acceso: el producto público no se comporta como la versión completa. Un agente que opera la computadora tiene el mismo alcance que el usuario que lo ejecuta: permisos, sesiones abiertas y credenciales. La superficie de riesgo son las acciones que toma, no solo el texto que genera.
Lectura para América Latina
Greg Brockman, presidente de OpenAI, enmarcó el lanzamiento como el inicio de la «era de la AGI». Es una afirmación comercial. No hay consenso académico sobre esa definición. Lo verificable es otra cosa: los modelos pasan de asistentes conversacionales a agentes que ejecutan flujos de trabajo completos, y eso mueve dónde está el valor.
Para fundadores, desarrolladores y equipos de producto el trabajo está en rediseñar procesos alrededor de la delegación supervisada. Captura de datos, conciliaciones, formularios, reportes recurrentes: tareas con entrada y salida claras, donde el agente ahorra horas. Cada tarea delegada necesita una verificación barata y objetiva. Si el resultado no se puede verificar, no se debe delegar. El criterio humano se concentra en qué automatizar, con qué límites, y qué hacer con el tiempo que queda libre.
Quienes trabajan con blockchain tienen un requisito extra. Un agente que ejecuta acciones necesita identidad, límites de gasto y un registro verificable de lo que hizo. Esa es la infraestructura que ya resuelven los contratos inteligentes y las credenciales verificables.
Una prueba concreta: tomar un proceso operativo, medible y de bajo riesgo; documentar cómo se ejecuta hoy; definir qué evidencia confirma que quedó bien hecho; probarlo con la versión pública, en una cuenta con permisos acotados; medir tiempo, tasa de error y costo frente al proceso manual.
Fuentes: openai.com/index/gpt-6-astra · deploymentsafety.openai.com · Fortune · VentureBeat. Las cifras de desempeño son las reportadas por OpenAI en el anuncio.