Medio chileno con Inteligencia Artificial
Jueves, 24 de septiembre de 2026
Últimas noticias
Tecnología e Innovación

OpenAI admite que su nuevo modelo Astra cruza un “umbral crítico” en ciberseguridad ofensiva

OpenAI lanzó Astra reconociendo en su propio safety overview que el modelo alcanza capacidad crítica para hallar y explotar fallas de seguridad sin ayuda humana. Un día antes, Google DeepMind había presentado un modelo rival enfocado en defensa cibernética.

Ilustración generada con IA

OpenAI lanzó el 3 de septiembre a Astra, su nuevo modelo insignia de uso de computadora y navegador, y lo acompañó de un documento inusual: un "safety overview" en el que la propia compañía admite que el sistema cruza, por primera vez entre sus modelos, el "umbral crítico de ciberseguridad" que ella misma definió como línea de riesgo. No es una alerta de un investigador externo ni una filtración: es OpenAI evaluando su propia creación y calificándola de crítica en su capacidad para atacar sistemas informáticos.

Según el propio documento de la compañía, citado por TechCrunch dos días antes del lanzamiento formal, Astra "es capaz de encontrar fallas de seguridad desconocidas en sistemas informáticos, y explotarlas" sin necesidad de guía humana. Según ese mismo reporte de TechCrunch, OpenAI señaló que el modelo obtuvo puntaje perfecto en ExploitBench, su evaluación interna de la capacidad de un modelo para vulnerar fallas de seguridad conocidas, y que en una versión modificada de esa prueba, desarrollada por sus propios ingenieros, el modelo descubrió y explotó dos vulnerabilidades de tipo zero-day, según indicó la compañía.

Esa combinación de utilidad y peligro es la que llevó a OpenAI a anunciar restricciones antes incluso de poner el modelo a disposición del público general. La compañía adelantó que "planea hacer disponible a Astra pronto, pero el acceso a sus capacidades de ciberseguridad más avanzadas será más limitado", reservado a cuentas que superen un umbral de confianza más alto. A eso se suman detección reforzada de abuso, monitoreo adicional sobre el razonamiento interno del modelo (lo que la industria llama "chain of thought") y técnicas de mitigación que la compañía no detalló públicamente.

Según reportó TechCrunch sobre el anuncio de lanzamiento del 3 de septiembre, OpenAI prefirió poner el acento en otro terreno: Astra como "una nueva frontera en el uso de computadora y navegador", con mejoras en velocidad, precisión y seguridad, y con un desempeño que, según la compañía, supera al de sus propios modelos anteriores y al de rivales como Anthropic en tareas de identificación de errores de software. De acuerdo con esa misma cobertura, la compañía defendió también la lógica detrás del riesgo que reconoce: la capacidad de Astra para encontrar y explotar fallas de tipo zero-day, sostiene OpenAI, "puede ayudar a quienes defienden sistemas a encontrar y parchear debilidades" antes de que alguien más las use con fines maliciosos.

La controversia no se limitó a la ciberseguridad ofensiva. Días antes, especialistas en seguridad de IA habían manifestado inquietud por una técnica que OpenAI incorporó a Astra, conocida como "recurrencia opaca", que dificulta auditar el razonamiento del modelo mediante los métodos habituales de supervisión. Según TechCrunch, el científico jefe de la compañía reconoció públicamente que, a medida que las capacidades de los modelos aumentan, la posibilidad de monitorearlos "se vuelve más difícil". Es una admisión que corre en paralelo a la del riesgo crítico en ciberseguridad y que alimenta la misma pregunta de fondo: qué tan visibles siguen siendo, para sus propios creadores, los sistemas que lanzan.

El momento no es casual. Un día antes del lanzamiento de Astra, Google DeepMind había presentado Gemini 3.8 Flash Cyber, un modelo que su propia compañía describe como el más capaz que tiene hasta ahora en ciberseguridad, pero orientado al lado opuesto del tablero: la defensa. Según Google, el modelo supera tanto a sus versiones anteriores como a sistemas rivales de mayor tamaño en CyberGym, un banco de pruebas de descubrimiento de vulnerabilidades, con una tasa de éxito superior al 70% en veinte lenguajes de programación, y alcanza un 47,2% en CWE-Bench, una prueba de generación automática de parches, a un costo que la compañía señala como significativamente menor que el de alternativas existentes. Su acceso también está limitado: solo pueden usarlo, a través de un programa llamado Fairwind, "defensores confiables" como gobiernos, operadores de infraestructura crítica y mantenedores de software.

Un modelo defensivo de Google un día antes, un modelo con capacidad ofensiva crítica de OpenAI un día después, ambos con acceso restringido a usuarios de confianza: la secuencia retrata, más que una coincidencia de calendario, un mismo movimiento de fondo en la industria. Los laboratorios de IA de punta están llevando sus sistemas al límite de lo que ellos mismos consideran seguro, en las dos direcciones de una misma disputa, y responden a ambos lados con la misma herramienta: restringir el acceso en lugar de frenar el desarrollo.

Fuentes consultadas