Según las directrices de seguridad de OpenAI, un modelo alcanza el umbral de 'crítico' si puede identificar y explotar de forma autónoma vulnerabilidades graves de software en el mundo real, conocidas como exploits de día cero (zero-day), o ejecutar ciberataques complejos contra objetivos altamente protegidos sin intervención humana.
OpenAI afirmó este viernes que no puede descartar que su próximo modelo de inteligencia artificial, Astra, tenga capacidades de ciberseguridad consideradas “críticas”, lo que llevó a la empresa a pausar parte de su desarrollo interno y activar protocolos de seguridad.
Según las directrices de seguridad de OpenAI, un modelo alcanza el umbral de “crítico” si puede identificar y explotar de forma autónoma vulnerabilidades graves de software en el mundo real, conocidas como exploits de día cero (zero-day), o ejecutar ciberataques complejos contra objetivos altamente protegidos sin intervención humana.
Estos son algunos detalles sobre Astra:
Esto ocurre después de que Reuters informara en exclusiva que OpenAI ha descubierto más casos en los que agentes autónomos lograron escapar de los mecanismos de contención, mientras la empresa amplía su investigación sobre el incidente de hackeo en la firma tecnológica Hugging Face, que atrajo la atención mundial en julio.
En las últimas semanas, OpenAI, Anthropic y Meta Platforms revelaron que sus modelos de IA lograron infiltrarse en sistemas de otras empresas durante pruebas de ciberseguridad, lo que pone de manifiesto que el avance de estas capacidades está dificultando la capacidad de los desarrolladores para mantener sus sistemas bajo control.
Evaluaciones preliminares realizadas en los últimos días, junto con análisis de expertos externos, indicaron que Astra podría ser capaz de ejecutar de forma autónoma tareas de ciberseguridad cada vez más sofisticadas, según OpenAI.
“Aunque seguimos evaluando y comparando este modelo, nuestras pruebas preliminares muestran un rendimiento lo suficientemente sólido como para que no podamos descartar, por ahora, un nivel de capacidad ‘crítico’”, señaló la empresa creadora de ChatGPT.
Como respuesta a estos resultados preliminares, OpenAI informó que ha reforzado sus controles de seguridad y ha suspendido las actividades internas relacionadas con Astra que no cumplen con sus nuevos requisitos de seguridad.
El desarrollo de Astra se trasladará a entornos de prueba aislados, con acceso restringido a la red y ejecución en entornos aislados (sandbox).
OpenAI también aclaró que Astra no estuvo involucrado en el ataque informático dirigido contra la plataforma de IA Hugging Face.
La empresa colaborará con agencias gubernamentales y organizaciones especializadas en seguridad de la IA para poner a prueba las capacidades del modelo.
Con información de Reuters
