El canal internacional
de noticias en español
más visto en el mundo
Actualidad

'Malware' y manipulación: la IA alcanza niveles inéditos de autonomía en nuevo incidente de seguridad

Publicado:
El reciente caso se detectó en una prueba realizada con modelos de OpenAI y Anthropic.
'Malware' y manipulación: la IA alcanza niveles inéditos de autonomía en nuevo incidente de seguridad

Un agente avanzado de inteligencia artificial (IA) creó identidades falsas y buscó engañar a un humano para conseguir autorización y ejecutar acciones no permitidas durante pruebas de seguridad realizadas con modelos de OpenAI y Anthropic. Entre los episodios documentados figura el intento de obtener luz verde para insertar código malicioso en un proyecto de código abierto de uso público.

El Instituto de Seguridad de la IA del Reino Unido (AISI, por sus siglas en inglés) informó el martes que, por primera vez, observó el uso de "ingeniería social" para influir en una persona real mientras el sistema perseguía una tarea no autorizada. "Esta es la primera vez que AISI ha visto un engaño de esta gravedad dirigido a una persona real, por iniciativa propia, en el mundo real", comunicó el organismo sobre este nuevo incidente, que pone de relieve la laxitud de las salvaguardas en torno a los procesos de prueba de estos agentes.

Según el informe, la agencia ejecutó 122 veces un escenario ficticio de ciberseguridad e identificó 19 acciones no sancionadas en 10 simulaciones. De esas acciones, 17 fueron atribuidas al agente impulsado por Mythos 5 de Anthropic y las dos restantes al sistema basado en GPT-5.6-Sol de OpenAI. En el caso más grave, AISI detalló que el agente, al ser cuestionado, alteró registros previos y llegó a considerar adoptar otra identidad.

Una nueva brecha de seguridad que preocupa a la industria y a la Casa Blanca

El episodio ocurrió en pruebas controladas con salvaguardas reducidas, en las que también se registraron contactos con personas reales a través de un servicio de intercambio de archivos para persuadirlas —o a sus herramientas de programación asistida por IA— de ejecutar el código. Anthropic confirmó que su agente fue responsable del uso de identidades falsas y afirmó que trabaja con AISI para obtener más detalles y abrir su propia investigación.

Por su parte, AISI remarcó que, a diferencia de la brecha de seguridad de julio en la firma de IA Hugging Face atribuida a un agente de OpenAI, en estas pruebas los agentes no escaparon de un entorno aislado para llegar a la Red, sino que su acceso fue permitido por la agencia conforme a sus procedimientos estándar de evaluación.

Los 5 riesgos de la IA que podrían volverse catastróficos antes de 2030

Entretanto, representantes de Meta, Anthropic, OpenAI y Google han sido invitados a reunirse este martes con la Administración de Donald Trump para discutir un nuevo marco regulatorio que establezca pruebas de seguridad voluntarias para modelos de IA.

La capacidad de la IA para vulnerar sistemas de otras empresas ha generado preocupación entre los legisladores estadounidenses acerca de si estos modelos son cada vez más capaces de realizar o facilitar ciberataques.

Compartir:
RT en Español en vivo - TELEVISIÓN GRATIS 24/7