El 18 de julio, una denuncia sobre un asesinato sin resolver llegó a la página web de la policía de Filadelfia. Quien la envió aseguró haber visto a alguien cerca de la escena, pero no fue una persona: fue Claude Haiku 4.5, un modelo de inteligencia artificial creado por Anthropic.

La empresa no lo detectó durante 72 días. En su informe, explicó que el sistema estaba siendo probado para inventar tareas de ejemplo y ejecutarlas en páginas web aleatorias.

Una prueba que terminó en una denuncia policial

Claude estaba funcionando como un agente de IA, es decir, un software capaz de hacer clic, escribir y rellenar formularios por sí solo. Una de las páginas que visitó tenía información sobre un homicidio sin resolver y un formulario para enviar pistas.

El modelo tenía reglas para no iniciar sesión, no usar cuentas, no pedir datos personales, no comprar nada y no hacer nada destructivo. Nadie le indicó que no podía enviar formularios.

Así que llenó una pista falsa. Dijo que recordaba haber visto a alguien “que coincidía con la descripción” cerca de una calle mencionada en la página, aunque el sitio no ofrecía ninguna descripción. Dejó en blanco su nombre y sus datos de contacto.

Anthropic sostuvo que el modelo no intentaba engañar a nadie. “Parece que Claude solo estaba creando un contenido de ejemplo para la tarea, y no tratando de engañar a nadie para lograr algún objetivo”, dijo un extracto del informe.

La policía conoció el caso 72 días después

La pista nunca llegó a un detective. El sitio web la marcó como spam y la policía no encontró señales de que sus sistemas hubieran sido vulnerados.

Anthropic detectó el incidente el 28 de septiembre y, según el reporte, la policía se enteró del tema esta semana. En un comunicado, el Departamento de Policía de Filadelfia dijo que “el retraso de dos meses en detectar y reportar el incidente a la Ciudad es inaceptable”.

El caso también abrió una discusión legal. En Pensilvania, hacer un reporte policial falso a propósito es un delito, pero la ley está redactada para “una persona”, como señala Reuters.

Anthropic, además, dijo que cortó el acceso a internet para todas sus pruebas internas hasta que su monitoreo sea confiable.