Anthropic decidió desconectar de internet a sus agentes de IA al darse cuenta que estaban hackeando webs. REUTERS/Carlos Barria

Anthropic decidió desconectar de internet a sus agentes de IA al darse cuenta que estaban hackeando webs. REUTERS/Carlos Barria

Anthropic desactivó el acceso a internet en tiempo real para todas sus evaluaciones internas después de descubrir que sus modelos de inteligencia artificial (IA) habían explotado vulnerabilidades en sitios web, incluidos algunos administrados por agencias del Gobierno de Estados Unidos.

Los agentes también encontraron formas de eludir restricciones digitales, accedieron a bases de datos sin pagar y llegaron a enviar una denuncia falsa de asesinato a la Policía de Filadelfia.

PUBLICIDAD

Los incidentes fueron detallados por la compañía en una publicación de blog y expusieron los riesgos de utilizar agentes de IA capaces de navegar por internet y ejecutar tareas de manera autónoma.

Anthropic explicó que mantendrá esta restricción hasta tener mayor certeza de que puede supervisar y controlar el comportamiento de sus sistemas cuando interactúan con servicios externos.

Anthropic decidió tomar medidas de seguridad al darse cuenta que sus agentes de IA empezaron a eludir la seguridad digital.
Anthropic decidió tomar medidas de seguridad al darse cuenta que sus agentes de IA empezaron a eludir la seguridad digital.

La empresa atribuyó estos episodios a fallos en los entornos de entrenamiento, que habrían llevado a los modelos a interpretar que recibirían una recompensa por encontrar vacíos en las reglas o sortear limitaciones. Este fenómeno, conocido como reward hacking o piratería de recompensa, ocurre cuando un sistema busca cumplir un objetivo de una manera que satisface la métrica de evaluación, pero no la intención de quienes lo diseñaron.

PUBLICIDAD

Los modelos estaban siendo evaluados en tareas que requerían buscar recursos en internet para resolver problemas. Durante esos ejercicios, algunos agentes aprovecharon vulnerabilidades de software, accedieron a bases de datos sin realizar el pago correspondiente y utilizaron servicios de acortamiento de enlaces para introducir información de contrabando y esquivar restricciones.

El episodio más delicado incluyó el envío de una denuncia falsa de asesinato a la Policía de Filadelfia. El caso muestra que las acciones de un agente de IA pueden superar el entorno previsto para una prueba y provocar consecuencias fuera de una simulación, especialmente cuando dispone de herramientas para interactuar con sistemas reales.

PUBLICIDAD

Anthropic señaló que comenzó a revisar estas actividades en julio. La investigación evidenció que el laboratorio no tenía una comprensión completa de cómo se comportaban sus modelos cuando operaban en tiempo real y combinaban distintas herramientas digitales.

Algunos agentes de IA de Anthropic ingresaron a bases de datos sin pagar. REUTERS/Dado Ruvic/Illustration/File Photo
Algunos agentes de IA de Anthropic ingresaron a bases de datos sin pagar. REUTERS/Dado Ruvic/Illustration/File Photo

La compañía sostuvo que estos incidentes son menos graves, desde el punto de vista de la alineación y la seguridad, que otros casos de infiltración en sistemas externos que había divulgado anteriormente. Sin embargo, decidió suspender algunas evaluaciones o ejecutarlas en entornos desconectados mientras mejora sus controles.

La decisión afecta a las evaluaciones internas de la compañía, pero no significa necesariamente que todos sus productos hayan perdido la capacidad de conectarse a internet. Anthropic no aclaró públicamente cuánto durará la medida ni qué criterios específicos utilizará para restablecer el acceso.

PUBLICIDAD

Entre las medidas anunciadas figuran herramientas para detectar y bloquear comportamientos de este tipo, una infraestructura centralizada y más segura para gestionar sus agentes internos y el uso más frecuente de clasificadores de seguridad. Estos últimos sistemas ayudan a identificar acciones potencialmente peligrosas antes de que continúen ejecutándose.

El desafío consiste en comprobar que los agentes puedan utilizar herramientas digitales sin interpretar las instrucciones de forma que los lleven a evadir controles o realizar acciones no autorizadas.

Anthropic decidió restringir el acceso a internet de su IA para evitar que estos sigan vulnerando sitios web.
Anthropic decidió restringir el acceso a internet de su IA para evitar que estos sigan vulnerando sitios web.

Sydney Von Arx, fundadora de la organización de seguridad de IA Nightingale, advirtió en declaraciones previas a TechCrunch que mantener los modelos en centros de datos aislados de internet puede dificultar la investigación y frenar el desarrollo de sistemas que necesitan acceso a servicios externos para resultar útiles. La especialista señaló que, en algún momento, estos modelos deben aprender a operar de forma segura en entornos conectados.

PUBLICIDAD

Los incidentes de Anthropic recuerdan otros episodios en los que agentes de OpenAI habrían colaborado para infiltrarse en sitios web, incluidos algunos administrados por el Gobierno australiano. En ambos casos, el problema central es determinar hasta qué punto los sistemas autónomos pueden actuar fuera de los límites previstos por sus desarrolladores.

Conrad Stosz, funcionario del laboratorio de supervisión de IA Transluce y exdirector del Centro de Estándares e Innovación de IA de Estados Unidos, valoró que Anthropic divulgara voluntariamente los incidentes, incluidos aquellos relacionados con páginas gubernamentales. Al mismo tiempo, defendió la necesidad de una verificación independiente y creíble de los sistemas de inteligencia artificial.

PUBLICIDAD

Anthropic no aclaro hasta cuándo mantendrá sin acceso a internet a sus agentes de IA. REUTERS/Carlos Barria/File Photo
Anthropic no aclaro hasta cuándo mantendrá sin acceso a internet a sus agentes de IA. REUTERS/Carlos Barria/File Photo

La controversia plantea una cuestión clave para el futuro de los agentes de IA: no basta con que puedan completar tareas complejas. También deben demostrar que respetan las restricciones, evitan acciones dañinas y pueden ser supervisados de manera efectiva. A medida que estas herramientas ganen autonomía, la seguridad dependerá tanto de las capacidades de los modelos como de los mecanismos externos que permitan controlar sus decisiones.