Anthropic revela que Claude hackeó con éxito a tres organizaciones en pruebas
La empresa Anthropic ha revelado hace unos días que sus modelos de inteligencia artificial han obtenido acceso no autorizado a los sistemas de tres compañías anónimas distintas durante evaluaciones de ciberseguridad. Ante esto, la organización señala que Claude ha alcanzado el Internet desde adentro o interactuando con un entorno externo.
Este anuncio ha surgido poco después de que OpenAI confesara que uno de sus agentes ha hackeado también a Hugging Face en otra evaluación de ciberseguridad. El descubrimiento ha llegado después de que Anthropic haya lanzado una revisión retrospectiva masiva sobre sus propias evaluaciones cibernéticas, luego del incidente de OpenAI, ha detallado la firma en su blog publicado hace unos días.
El laboratorio manifiesta haber identificado inicialmente más de 140 mil pruebas donde se ha determinado que Claude pudo obtener conectividad total. Después, comprobó que tres modelos distintos de Claude accedieron a la red web durante pruebas dirigidas por firmas evaluadoras, hackeando hábilmente la infraestructura operativa de tres corporaciones diferentes.
Además, la compañía ha indicado claramente que los incidentes han involucrado a un modelo experimental interno. Las primeras fallas han sucedido en el mes de abril, evadiendo la atención del público durante muchos meses consecutivos. Al igual que OpenAI, Anthropic había desactivado intencionalmente los protocolos diseñados para contener a sus modelos y evitar mal uso.
En otras palabras, estas versiones no han llegado al público jamás, ya que, en los tres eventos, Claude ha enfrentado un desafío de captura la bandera, una de las formas para medir sus habilidades cibernéticas, ha relatado Anthropic en su propio artículo de blog.
La firma ha añadido que, en cada escenario particular, las estrictas instrucciones especificaron a Claude que operaba exclusivamente en una misión totalmente carente de conexión. Además, atribuyeron directamente este gran descuido a un “malentendido” surgido entre Anthropic y la empresa Irregular.
TIC Defense es una empresa que se dedica a prevenir y dar respuesta rápida a todo tipo de incidentes maliciosos, con el objetivo de robustecer las defensas cibernéticas de tu compañía. Nuestras herramientas y servicios de última tecnología ayudan a prevenir e interceptar cualquier tipo de ciberataques.
Aunque Claude no debería poseer Internet de ninguna manera, Anthropic ha admitido que la empresa Irregular ha configurado, de manera terrible, las máquinas empleadas para evaluarlo, otorgando también a todos los modelos habilidades completas de navegación web.
Nadie pudo notar la enorme y grave desconfiguración hasta lograr detectarla finalmente por medio del estricto monitoreo de evaluación adicional durante la semana pasada. Esto lo ha publicado la corporación Anthropic hace unos días.
Ahora, poseen evidencias contundentes que confirman que ambos gigantes de la IA no solo fallaron conteniendo a sus agentes, sino que fracasaron detectando todas esas fugas en tiempo real, señalan los investigadores y desarrolladores que operan para firmas de ciberseguridad.
Queda claro que se necesita imponer una regulación estricta y supervisión gubernamental fuerte sobre todas las evaluaciones de forma inmediata. Tanto la empresa Irregular como Anthropic no han respondido de inmediato, buscando emitir comentarios.
A diferencia del escándalo con OpenAI, Anthropic ha afirmado que Claude no ha encontrado ni explotado vulnerabilidades complejas.