La empresa tecnológica estadounidense Anthropic afirma que sus modelos de inteligencia artificial (IA) piratearon los sistemas de tres organizaciones durante una prueba de ciberseguridad debido a un error que les dio acceso a internet.
Esto ocurre pocos días después de que su rival OpenAI anunciara que sus modelos habían vulnerado los sistemas de otras empresas , incluido el centro de herramientas de IA Hugging Face.
Tras el anuncio, Anthropic decidió comprobar si sus propios modelos habían llevado a cabo ataques similares. La empresa afirma haber detectado tres casos que ya han sido notificados a las compañías afectadas.
Anthropic, que no mencionó los nombres de las organizaciones, instó a otros laboratorios de IA a realizar revisiones similares para comprender mejor los riesgos de las capacidades de sus modelos.
Anthropic afirmó en un comunicado que revisó más de 140.000 pruebas para encontrar evidencia de que Claude, su familia de modelos de IA, pudiera acceder a Internet desde entornos de prueba diseñados para estar aislados.
Las pruebas incluyen las denominadas evaluaciones de «captura la bandera», en las que Claude tenía la tarea de obtener información vulnerando otros sistemas, una forma común en que los expertos evalúan las capacidades de pirateo de un modelo.
Según la empresa con sede en San Francisco, un «fallo de configuración» en los sistemas gestionados por Anthropic y su socio de pruebas dejó a los modelos con acceso directo a internet, lo que les permitió vulnerar otros sistemas.
Anthropic afirmó que los primeros incidentes se remontan a abril y que están «abordando las soluciones como si la responsabilidad fuera exclusivamente nuestra».
Ni Anthropic ni las organizaciones que sufrieron la brecha de seguridad se percataron de las intrusiones en ese momento.
Anthropic afirmó que podría haber revisado sus registros con mayor detenimiento y añadió que los hallazgos le infundieron a la empresa un «optimismo cauteloso» de que dichos riesgos pueden superarse con una mayor inversión y medidas más estrictas.
«La lección más importante no es necesariamente que la IA haya desarrollado una capacidad de ataque fundamentalmente nueva», declaró a la BBC el experto en ciberseguridad David Allott.
«En cambio, se trata de que los agentes de IA puedan combinar capacidades, obtener credenciales y acceso al sistema para realizar acciones de forma autónoma, adaptando el alcance y la escala a la velocidad de la máquina», añadió.
Estos incidentes se producen en un momento en que las empresas tecnológicas invierten miles de millones de dólares en el desarrollo de agentes de IA capaces de realizar de forma independiente tareas que van desde la investigación y la atención al cliente hasta la ciberseguridad.

Mira: ¿Por qué es tan alarmante el ciberataque a OpenAI?
Una serie de ciberataques impulsados por inteligencia artificial ha avivado las peticiones de mayores medidas de seguridad y supervisión de esta tecnología, ante la preocupación por los riesgos que plantean los sistemas autónomos cada vez más potentes.
El presidente estadounidense, Donald Trump, declaró el miércoles que Washington está considerando medidas para controlar las herramientas de inteligencia artificial tras los recientes incidentes de ciberseguridad.
Durante la última semana, OpenAI ha asumido la responsabilidad de al menos dos incidentes de piratería informática en los que sus plataformas infringieron las normas establecidas para su funcionamiento.
El 21 de julio, el creador de ChatGPT declaró que su agente, un sistema de IA que puede operar de forma autónoma tras recibir instrucciones humanas, se descontroló y superó los límites de su prueba para piratear Hugging Face.
OpenAI afirmó que el incidente era «sin precedentes» y que estaba investigando junto con Hugging Face, cuyo jefe y cofundador, Thomas Wolf, declaró a la BBC que el incidente es «una llamada de atención» para el sector .
Estos incidentes han sido recibidos con cierto escepticismo , mientras OpenAI y Anthropic se preparan para sus salidas a bolsa, que se prevé que valoren a cada empresa en alrededor de 1 billón de dólares (740.000 millones de libras esterlinas).
Un portavoz de OpenAI declaró: «Reconocemos que circulan muchas preguntas y especulaciones sobre el incidente». Añadió que «planeamos publicar un informe técnico con las lecciones aprendidas en las próximas semanas».
