La investigación busca esclarecer cómo los agentes autónomos de OpenAI accedieron a sitios web y qué medidas tomó la compañía tras detectar su comportamiento.

Un subcomité del Senado está investigando después de que los agentes autónomos de OpenAI intentaran piratear la plataforma de alojamiento de modelos de IA Hugging Face en julio, mientras que expertos, incluidos los que trabajan en otros laboratorios de IA de vanguardia, dan la voz de alarma sobre la seguridad de la IA en el futuro.

Datos clave

  • La investigación fue reportada por primera vez por Axios el jueves por la mañana, citando una carta del senador Josh Hawley, republicano de Missouri, presidente del subcomité de gestión de desastres del Comité de Seguridad Nacional del Senado, en la que se solicitaba a OpenAI que respondiera preguntas y proporcionara documentos sobre el incidente antes del 1 de octubre.
  • La carta iba dirigida al director ejecutivo de OpenAI, Sam Altman, y criticaba a la empresa por seguir probando a sus agentes incluso después de descubrir que estaban utilizando foros de mensajes externos en otros sitios web para coordinarse, calificando la decisión de “temeraria” y cuestionando la “información limitada” que OpenAI ha publicado sobre el incidente.
  • También cuestionó los resultados de un informe independiente de auditores publicado aproximadamente un mes después, alegando que no se les permitió investigar un “modelo interno altamente persistente” que aparentemente fue el responsable de la mayoría de los ataques.
  • El senador Richard Blumenthal, el demócrata de mayor rango en el subcomité, envió su propia carta a Altman exigiendo respuestas sobre las capacidades del nuevo modelo Astra de OpenAI, así como sobre cuándo la empresa supo que sus modelos estaban secuestrando otros sitios web.

OpenAI no respondió de inmediato a la solicitud de comentarios de Forbes.

Investigadores de IA dan la voz de alarma

Además de anunciar la investigación sobre la empresa, la carta de Hawley señaló un aumento en las advertencias de expertos en IA en los últimos días. A principios de esta semana, un investigador del laboratorio rival de vanguardia Anthropic estimó que había un 10 % de probabilidad de que la tecnología que su empresa está investigando pudiera “matar a todos los humanos” y que Anthropic no tenía ningún plan para resolver la “alineación”, el término que los investigadores de IA usan para referirse al entrenamiento de la tecnología para que coincida con los valores humanos. “Su propio científico jefe escribió hace solo unos días que ‘ningún laboratorio ha resuelto la alineación y el monitoreo en un grado suficiente como para continuar escalando responsablemente a la máxima velocidad por mucho más tiempo'”, escribió Hawley a OpenAI el miércoles, refiriéndose a una larga declaración publicada por el investigador de OpenAI Jakub Pachocki el domingo. “Y hay preguntas inmediatas sobre las consecuencias de estos ataques de agentes de IA deshonestos”, agregó Hawley. “¿Qué sucede con la infraestructura crítica, los bancos y los servicios públicos si los agentes de IA piratean sus sistemas? ¿Cómo se pueden salvaguardar adecuadamente los datos personales de millones de estadounidenses?” ¿Y quién es el responsable cuando la IA se descontrola? Chris Lehane, jefe de asuntos globales de OpenAI, pidió “requisitos nacionales obligatorios de seguridad para la IA” en un comunicado de la compañía el miércoles, probablemente en respuesta a las advertencias de Pachocki y otros.

Contexto

En julio, OpenAI estaba probando las capacidades de ciberseguridad de sus modelos cuando se percató de que un grupo de agentes autónomos había escapado de su entorno de pruebas, accedido a Internet e intentado hackear Hugging Face, un sitio que aloja modelos de IA de código abierto. OpenAI publicó su propio informe sobre el incidente en agosto, calificándolo de “señal de alerta” y solicitando inversión en alineación, control y medidas de seguridad para los modelos de IA. En las últimas semanas, nuevos informes han revelado que los agentes de OpenAI accedieron a aún más sitios web antes de ser detectados. En mayo, los agentes accedieron a un sitio wiki en alemán y lo convirtieron en un foro para coordinarse, según informó Reuters citando un análisis de una organización sin fines de lucro dedicada a la seguridad de la IA. El miércoles, Reuters informó que los agentes utilizaron al menos otros 10 sitios web como foros, incluyendo wikis de juegos y una clase avanzada de química de bachillerato. OpenAI declaró a la agencia que aún estaba llevando a cabo una revisión del incidente, pero que ninguna de las actividades fue tan grave como el intento de hackeo de Hugging Face.

Este artículo fue publicado originalmente por Forbes US.

Le puede interesar también: ¿Cómo llegó el mundo a la peor caída del desempeño educativo en la historia de PISA?