La compañía informó que tres modelos de Claude vulneraron sistemas reales por un error durante una evaluación de ciberseguridad y aseguró que ninguno contaba con las salvaguardas de las versiones públicas.

Anthropic anunció el jueves que sus modelos avanzados de IA lograron hackear con éxito los sistemas de tres organizaciones mientras se sometían a una evaluación interna. Esta revelación de seguridad se produce una semana después de que su rival OpenAI revelara que uno de sus modelos avanzados hackeo una empresa tras escapar de un entorno de prueba controlado.

Datos clave

  • En un comunicado, Anthropic dijo que había descubierto tres infracciones separadas que involucraban sus modelos de IA de Claude después de realizar una revisión de ciberseguridad de sus sistemas.
  • El primero de estos incidentes ocurrió en abril e involucró a tres modelos Claude separados, incluido el Mythos 5 de vanguardia, el antiguo Opus 4.7 y un modelo de prueba de investigación interna sin nombre que “no está planeado para el lanzamiento general”.
  • La empresa de inteligencia artificial no nombró a las tres organizaciones afectadas por los hackeos, pero dijo que fueron notificadas sobre el incidente el lunes.
  • Anthropic dijo que está trabajando con dos de las organizaciones afectadas que no habían detectado la violación antes de ser informadas, y está “continuando contactando a la tercera”.
  • La compañía dijo que los tres modelos involucrados en los incidentes no tenían las salvaguardias que pone en marcha para cuando dichos modelos se ponen a disposición del público.

Cita importante

En su comunicado, Anthropic afirmó: «En última instancia, muchos factores contribuyeron a estos incidentes, pero, en consonancia con una cultura de análisis posterior a los hechos que no busca culpables, estamos abordando las soluciones como si la responsabilidad fuera exclusivamente nuestra. Esto comienza por garantizar la seguridad de cada parte de nuestro proceso de evaluación, incluida la forma en que nos integramos con socios externos».

¿Qué sabemos sobre las brechas?

Los tres incidentes se produjeron cuando Anthropic evaluaba las capacidades de los tres modelos mediante un escenario ficticio para recuperar información oculta de otra máquina en la red. Anthropic afirmó que, en todos los casos, se les indicó a los modelos que estaban realizando una simulación y que no tenían acceso a internet. Sin embargo, debido a un malentendido entre la empresa y su socio de evaluación, Irregular, «esto no fue así y sí tenían acceso a internet». Anthropic señaló que, a diferencia del incidente de OpenAI-Hugging Face revelado la semana pasada, Claude no se «extrajo ni intentó escapar deliberadamente» del entorno de prueba controlado.

¿Qué hicieron los modelos después de hackear las organizaciones?

Anthropic señaló que los tres modelos reaccionaron de manera muy diferente tras descubrir que operaban en la internet abierta del mundo real en lugar de en una simulación. La compañía afirmó que su modelo más antiguo, Opus 4.7, continuó atacando un sistema «tras descubrir que probablemente operaba en un entorno real», ya que «racionalizó que la empresa real debía formar parte del ejercicio». El modelo Mythos 5 —el modelo más avanzado de la compañía lanzado hasta la fecha— «identificó correctamente las consecuencias de sus acciones», pero «se convenció de que aún se encontraba en una simulación». Anthropic reconoció que las acciones de Mythos en este escenario «no alcanzan el comportamiento ideal». El modelo de prueba no lanzado se percató de que había vulnerado un objetivo real y «cesó su ataque». La compañía señaló que estos incidentes no forman parte de un ensayo controlado y no deben utilizarse para sacar conclusiones. Sin embargo, indicó que el comportamiento que más desea observar «solo se produjo en el más reciente de los tres modelos».

Antecedente clave

La revelación de Anthropic se produce una semana después de que OpenAI publicara un informe en el que se indicaba que uno de sus modelos avanzados de IA había pirateado los servidores de Hugging Face, la plataforma que aloja modelos de IA de código abierto. A diferencia del escenario descrito por Anthropic, el incidente de OpenAI no fue resultado de un error de procedimiento, sino que el modelo de IA explotó una vulnerabilidad para escapar de su entorno de pruebas controlado. En su comunicado, Anthropic mencionó que su decisión de realizar esta revisión se debió a la revelación de OpenAI y elogió a su competidor por publicar el informe.

Este artículo fue publicado originalmente en Forbes US

Lea también: Mercedes retira más de 310.000 vehículos por falla que podría hacer que se desplacen solos