GPT-6 Astra es Crítico en ciberseguridad. ¿Quién lo firmó?
Ricardo Argüello, 26 de septiembre de 2026
CEO & Fundador
Resumen general
La tarjeta de sistema de GPT-6 Astra, publicada el 3 de septiembre de 2026, dice que es el primer modelo de OpenAI en llegar al nivel Crítico de ciberseguridad de su Preparedness Framework. Leída como documento de compra, equivale a dos de las tres partes de un reporte SOC 2. Le falta la opinión firmada de alguien que no sea el proveedor.
- OpenAI escribe que, según sus evaluaciones, cree que Astra cumple el umbral Crítico de ciberseguridad. El marco, el umbral y la conclusión son de OpenAI
- ExploitBench, donde Astra sacó 100%, es uno de cuatro benchmarks públicos que OpenAI adoptó. Varios resúmenes que circularon dicen que OpenAI lo construyó, y la tarjeta no dice eso
- Irregular, un laboratorio externo, resolvió con Astra 86 de 226 retos de FrontierCyber y no vio ataques exitosos contra objetivos totalmente endurecidos. Su resultado aparece como una sección del documento de OpenAI
- Según la AICPA, un reporte SOC 2 Tipo 2 trae la aseveración de la gerencia, la descripción del sistema, el reporte del auditor y las pruebas de controles con sus resultados
- La tarjeta tiene registro de cambios. El 9 de septiembre, seis días después del lanzamiento, OpenAI actualizó la sección de alineamiento
Imagina que compras una casa y el vendedor te entrega un informe estructural impecable, con fotos, mediciones y la conclusión de que la casa aguanta un terremoto. Lo escribió él. Adentro viene un párrafo de un ingeniero externo, pero ese ingeniero nunca te firmó nada a ti. Eso es hoy la tarjeta de sistema de un modelo de IA para quien lo compra.
Resumen generado con IA
Abrí la tarjeta de sistema de GPT-6 Astra, publicada el 3 de septiembre, y busqué una sola cosa. El nombre de quien firmaba la clasificación.
Encontré esta frase. “Based on our evaluations, we believe that Astra meets the Critical cybersecurity threshold.” Según nuestras evaluaciones, creemos que Astra cumple el umbral Crítico de ciberseguridad.
Creemos. Nosotros.
Una tarjeta de sistema es la parte del reporte que escribe el proveedor
Si compras software empresarial, ya sabes leer un SOC 2. Según la AICPA, un reporte SOC 2 Tipo 2 trae cuatro piezas: la aseveración de la gerencia, la descripción del sistema, el reporte del auditor y las pruebas de controles con sus resultados. Las dos primeras las escribe la empresa auditada. Las otras dos, una firma de contadores públicos con licencia y sujeta a revisión de pares. La AICPA advierte que actúa contra auditores que no trabajen bajo normas profesionales, no estén inscritos en revisión de pares o no tengan licencia.
La tarjeta de Astra es excelente como descripción y como aseveración. Tiene más detalle del que casi cualquier proveedor de software le entrega a un cliente. Lo que no tiene es la tercera pieza. No hay un párrafo firmado por alguien de afuera, dirigido a ti, que diga “revisamos esto y la conclusión se sostiene”.
Por eso, en tu expediente de proveedores, la tarjeta debería ir archivada donde archivas la descripción del sistema. No donde archivas el informe del auditor.
Fui a verificar la crítica y tampoco se sostenía entera
La semilla de este post fue una nota de State of AI del 8 de septiembre, titulada “Your AI Vendor Is Issuing Its Own SOC 2”. El argumento me parece correcto. Pero dice que ExploitBench, donde Astra sacó 100%, es un benchmark que OpenAI armó con veinte vulnerabilidades, citando un análisis de otro medio.
La tarjeta dice otra cosa. OpenAI adoptó cuatro benchmarks públicos (ExploitBench, ExploitGym, SEC-Bench Pro y SRE-Bench) y construyó dos internos, Sandbox Bench y una versión de ExploitBench con vulnerabilidades publicadas entre junio y agosto de 2026. ExploitBench tiene 41 vulnerabilidades del motor V8, no veinte. Astra llegó al 100% incluso con el esfuerzo de razonamiento más bajo que probaron.
Menciono el error porque es el mismo problema en miniatura. Un número que viaja de la fuente a un análisis, del análisis a una nota, y de la nota a LinkedIn, sin que nadie abra el documento original. Tu comité de riesgos recibe la cuarta copia.
Quién midió qué, en el mismo documento
Esta es la tabla que le haría a cualquier tarjeta de sistema antes de llevarla a una decisión de compra. Con Astra queda así:
| Afirmación | Quién la midió | ¿Puedes reproducirla? |
|---|---|---|
| 100% en ExploitBench | OpenAI, sobre un benchmark público | En principio sí |
| Día cero en la versión interna de ExploitBench | OpenAI, sobre datos propios | No |
| Cadena de exploits en un navegador y un kernel | Expertos internos de OpenAI | No, OpenAI retiene los detalles |
| 86 de 226 retos en FrontierCyber | Irregular, laboratorio externo | No, y lo reporta OpenAI |
| La clasificación Crítica | OpenAI | No aplica |
Dos detalles de esas filas me quedaron dando vueltas.
La prueba del navegador corrió en el arnés (harness) estándar de Codex, con esfuerzo Ultra, acceso a la web y hasta 64 subagentes. Su primer éxito, a las 29 horas, fue contra una compilación a la que, según los propios expertos, le faltaban algunas mitigaciones de producción. Luego Astra adaptó el exploit a la versión estable oficial en 12 horas más. Es un resultado serio. Y es de OpenAI.
La fila de Irregular trae el matiz que más le serviría a un comprador. Irregular no observó ataques exitosos contra objetivos totalmente endurecidos, y ningún modelo resolvió los siete retos de nivel Elite. No contradice necesariamente a los expertos internos. Pero la única voz externa del capítulo de ciberseguridad es también la más conservadora, y te llega editada dentro del documento del proveedor.
La tarjeta cambia después del lanzamiento
La página tiene registro de cambios. El 9 de septiembre, seis días después de publicarla, OpenAI actualizó la sección de alineamiento, incluyendo cómo sus evaluaciones prueban la generalización. No hay nada turbio en eso, es buena práctica documentar los cambios.
Pero el enlace que tu equipo guardó el 3 de septiembre ya no apunta al mismo texto. Descarga el PDF el día que tomas la decisión y archívalo con la fecha en el nombre. Un reporte de auditor es un PDF firmado que no se mueve. Una tarjeta de sistema es una página web.
Lo que hacemos con esto
Sobre la otra mitad del problema, qué evidencia debe guardar el proveedor para cada cifra que publica, ya escribí a raíz de las órdenes de la FTC contra Workado. Y la versión regulatoria, pruebas obligatorias para modelos de frontera, está en lo que Amodei le pidió al Senado. Esta es la versión de compras, la que puedes aplicar este trimestre sin esperar ninguna ley.
En la fase de descubrimiento de AI Maestro, antes del gate Go/No-Go, cada proveedor de modelo entra al expediente con su tarjeta de sistema marcada fila por fila, como la tabla de arriba. Lo que midió el proveedor, lo que midió un tercero, lo que nadie puede reproducir. Donde un tercero aparece citado, State of AI propone pedirle una atestación con alcance definido, aunque sea bajo acuerdo de confidencialidad. Coincido. Si la respuesta es que nadie de afuera la revisó, eso también va al expediente.
Imprime la tarjeta del modelo que ya usas y toma un resaltador. Esta semana.
Marquemos juntos la tarjeta de tu proveedor de IAPreguntas Frecuentes
Según la tarjeta de sistema de GPT-6 Astra, publicada el 3 de septiembre de 2026, es el primer modelo de OpenAI en llegar al nivel Crítico de su Preparedness Framework. El umbral describe un modelo capaz de desarrollar exploits de día cero contra sistemas reales endurecidos sin intervención humana. La clasificación la hizo OpenAI con su propio marco.
Nadie emitió una opinión independiente sobre la clasificación Crítica de GPT-6 Astra. La tarjeta incluye evaluaciones de terceros como Irregular, UK AISI y Apollo Research, pero aparecen como secciones del documento de OpenAI. La conclusión dice que, según sus evaluaciones, OpenAI cree que Astra cumple el umbral.
Un reporte SOC 2 Tipo 2 incluye la aseveración de la gerencia, la descripción del sistema, el reporte de un auditor CPA y las pruebas de controles, según la AICPA. Una tarjeta de sistema de un modelo de IA cubre la descripción y la aseveración del proveedor, pero no trae la opinión firmada de un tercero independiente.
Marca cada afirmación de la tarjeta de sistema según quién la midió: el proveedor sobre un benchmark público, el proveedor sobre una prueba interna, o un tercero. Guarda una copia fechada en PDF, porque la tarjeta cambia. Y pídele al tercero una confirmación directa, aunque sea bajo acuerdo de confidencialidad.
Artículos Relacionados
El modelo barato como anzuelo: captura de ecosistema en IA
Google a $0.25/M tokens, OpenAI a $0.05/M. No es filantropía: es captura de plataforma aplicada a IA. Qué significa para tu independencia como empresa B2B.
El agente de OpenAI escapó y hackeó a Hugging Face
OpenAI confirmó que un modelo en pruebas escapó de un entorno 'altamente aislado' y hackeó Hugging Face para robar las respuestas de su propio examen.
Workado vendía 98% de precisión. Medía 53%. Entró la FTC
La FTC fijó el estándar para las afirmaciones de precisión en IA: pruebas competentes y confiables al momento de hacerlas. Sirve como test de compra.
Cómo elegir proveedores de IA para B2B con confianza
12 preguntas que toda empresa debe hacer antes de elegir un proveedor de IA. Framework de evaluación: confianza, gobernanza de datos y privacidad.
Cohere cifró la inferencia y dice que ni ellos la ven
Cohere lanzó Model Vault cifrado: la inferencia corre en hardware verificable y las llaves nacen dentro del enclave. La misma semana firmó con Aleph Alpha.
Bending Spoons compró Airtable. Ahora revisa tu plan.
Airtable creció 20% y llegó a $480M de ARR. Aun así se vendió por $1.285 millones en efectivo contra una marca de $11.000 millones. Qué significa para ti.