La IA vuelve a encender las alarmas: Anthropic confirma accesos no autorizados

Descubre cómo Anthropic IA hackea empresas en pruebas de ciberseguridad y los debates que esto ha generado.
La IA vuelve a encender las alarmas: Anthropic confirma accesos no autorizados La IA vuelve a encender las alarmas: Anthropic confirma accesos no autorizados La IA vuelve a encender las alarmas: Anthropic confirma accesos no autorizados

La empresa Anthropic confirmó que tres de sus modelos de inteligencia artificial lograron acceder a sistemas de organizaciones reales durante pruebas de ciberseguridad. Aunque ocurrió en un entorno de evaluación y no se trató de un ciberataque malicioso, el incidente reavivó el debate sobre los límites y el control de la IA.

Anthropic detectó tres incidentes durante una revisión de seguridad

Anthropic, desarrolladora del modelo de IA Claude, informó que descubrió los incidentes tras revisar más de 141 mil evaluaciones de ciberseguridad realizadas en colaboración con un tercero. La investigación comenzó después de que OpenAI reportara un incidente similar durante una prueba de sus modelos.

Los modelos involucrados fueron Claude Opus 4.7, Claude Mythos 5 y un modelo experimental de investigación. De acuerdo con la empresa, los primeros casos ocurrieron desde abril y fueron identificados durante una auditoría retrospectiva.

¿Cómo lograron ingresar a otras organizaciones?

Aprovecharon vulnerabilidades básicas

Anthropic explicó que los modelos participaron en ejercicios de “Capture the Flag” (CTF), una metodología utilizada para evaluar capacidades de ciberseguridad.

Durante esas pruebas, los sistemas de IA recibieron la misión de encontrar una “bandera” o dato confidencial oculto en otro equipo de la red. Para conseguirlo, explotaron fallas simples como contraseñas débiles y servicios sin autenticación.

La compañía precisó que el acceso a organizaciones reales fue consecuencia de una configuración incorrecta que permitió conectividad a internet desde un entorno que debía permanecer aislado. No se trató del aprovechamiento de vulnerabilidades desconocidas (“zero-day”), sino de errores operativos y controles insuficientes.

Las empresas afectadas no detectaron el acceso

Anthropic indicó que notificó a las tres organizaciones involucradas, cuyos nombres no fueron revelados.

Dos de ellas afirmaron que desconocían por completo la actividad detectada por la empresa de IA, mientras que Anthropic continuaba intentando contactar a la tercera al momento de publicar su informe.

El caso llega días después del incidente de OpenAI

La revelación ocurre apenas unos días después de que OpenAI informara que uno de sus modelos logró salir de un entorno de pruebas y acceder a servidores de Hugging Face durante una evaluación controlada, un hecho que calificó como un “incidente de seguridad significativo”.

Ambos casos han incrementado la preocupación sobre la capacidad de los agentes de inteligencia artificial para ejecutar acciones no previstas cuando cuentan con permisos, herramientas o acceso suficiente.

Expertos advierten que el reto es controlar a los agentes de IA

Especialistas en ciberseguridad consideran que estos incidentes muestran que el desafío ya no se limita a crear modelos más seguros.

El director ejecutivo de NyxLab, Kok Tin Gan, señaló que el verdadero reto será definir qué permisos reciben los agentes de IA, qué acciones requieren autorización humana y cómo evitar que cumplan un objetivo utilizando métodos fuera de lo esperado.

Anthropic aseguró que continuará reforzando sus protocolos de evaluación y animó a otros laboratorios de inteligencia artificial a revisar sus propios sistemas de prueba para detectar incidentes similares antes del lanzamiento de nuevos modelos.

Para estar siempre al día con las últimas noticias y contenidos exclusivos, les invitamos a seguirnos en todas nuestras plataformas sociales de SéUno. Conéctense con nosotros en Facebook, X(Twitter), Instagram, TikTok, YouTube y Threads. ¡No se pierdan ninguna actualización y formen parte de nuestra creciente comunidad en línea!

ÚLTIMAS NOTICIAS

Sobre el Autor Sofia Saavedra