Publicado 11/10/2026 - 12:47 CEST•última actualización 14:30

El modelo de inteligencia artificial (IA) Claude, de Anthropic, ha enviado una pista falsa sobre un homicidio sin resolver a una página web de la Policía durante unas pruebas, según han informado la empresa y las autoridades estadounidenses.

PUBLICIDAD

PUBLICIDAD

El incidente se suma a la preocupación por las acciones no deseadas de los sistemas de IA a medida que adquieren capacidad para interactuar con sitios web y ejecutar tareas.

La pista falsa se presentó el 18 de julio a través de una página que recopila información sobre asesinatos sin resolver, según un comunicado de la Policía de la ciudad estadounidense de Filadelfia.

Anthropic señaló que Claude Haiku 4.5, un modelo antiguo de la familia Claude, estaba realizando tareas de ejemplo en páginas seleccionadas al azar cuando se encontró con ese sitio. El sistema envió información inventada en la que sugería haber visto a alguien cerca del lugar del crimen, dejando en blanco los campos de nombre y contacto.

La Policía de Filadelfia indicó que Anthropic descubrió el incidente el 28 de septiembre, pero no informó al departamento hasta el 7 de octubre. Tras una sesión informativa al día siguiente, los agentes localizaron el envío y confirmaron que había sido marcado como correo basura y que nunca se había remitido a los investigadores.

"Los casos sin resolver implican víctimas reales, familias en duelo e investigadores que trabajan para obtener respuestas", señaló el Departamento en el comunicado. "Las empresas tecnológicas deben adoptar todas las medidas oportunas necesarias para impedir que sus sistemas envíen información falsa a las fuerzas del orden".

La Policía estadounidense calificó el retraso en la detección y comunicación del incidente de "inaceptable", pero afirmó que no había indicios de accesos no autorizados a sus sistemas ni de datos comprometidos.

En un informe publicado este viernes, Anthropic detalló otros casos en los que modelos de IA enviaron formularios oficiales reales en lugar de copias de prueba, o presentaron documentos que se les había indicado que no enviaran.

Según el mismo informe, Claude también aprovechó un fallo en el servidor de una universidad para ejecutar un cálculo y accedió a datos gubernamentales sin pagar la tasa exigida.

Anthropic describió la mayor parte de este comportamiento como "persistencia", con modelos que sortean las restricciones en lugar de detenerse. La compañía aseguró que está modificando el entrenamiento y suspendiendo el acceso a internet en tiempo real para todas las evaluaciones internas hasta que las salvaguardas demuestren ser fiables.

La empresa añadió que ha informado a la Casa Blanca y ha notificado a las agencias gubernamentales estadounidenses implicadas.

Creciente preocupación por la IA

Los incidentes se producen en un contexto de creciente inquietud por los agentes de IA, sistemas capaces de encadenar varias acciones para completar tareas, y sobre si los desarrolladores pueden controlarlos de forma fiable.

En julio, OpenAI reveló que sus modelos de IA se habían escapado de un entorno de pruebas controlado y habían pirateado los sistemas de Hugging Face, una plataforma para compartir modelos y conjuntos de datos de IA.

Mientras tanto, las autoridades australianas revelaron en septiembre que un modelo de OpenAI también había accedido a archivos restringidos en una página gubernamental de estadísticas sanitarias durante unas pruebas realizadas en junio.

Este tipo de incidentes alimentó en septiembre las peticiones de los dirigentes de las principales empresas de IA de una regulación más estricta y una supervisión internacional, en un contexto de advertencias de que sistemas cada vez más potentes podrían escapar al control humano.