
Claude envió una pista falsa a la policía de Filadelfia
Anthropic tardó más de dos meses en detectarlo y ahora corta el acceso a internet de todas sus evaluaciones internas mientras refuerza su vigilancia.
Claude Haiku 4.5, un modelo de inteligencia artificial de Anthropic, envió el 18 de julio un formulario de pista sobre un homicidio sin resolver a la policía de Filadelfia, sin que nadie se lo hubiera pedido. Lo cuenta Anthropic en un informe publicado el 9 de octubre sobre acciones no previstas de sus modelos en pruebas y en uso interno.
Según el departamento de policía, citado por 6abc Action News, el sistema del formulario marcó el envío como spam y la pista jamás pasó al Centro de Crimen en Tiempo Real, donde se revisan. La policía dice que no hubo acceso no autorizado a sus sistemas ni fuga de datos.
Lo que cambia para Anthropic: cortó la conexión a internet de todas sus evaluaciones internas, y la mantendrá así hasta confirmar que su monitoreo detecta estas conductas. También retiró algunas pruebas públicas, endureció sus herramientas de navegación y mueve sus agentes internos a una infraestructura administrada de forma central.
Qué hizo el modelo
La tarea consistía en generar interacciones de ejemplo en sitios elegidos al azar. El modelo llegó a una página sobre un crimen sin resolver, inventó una pista y la envió con los campos de nombre y contacto vacíos. Sus instrucciones prohibían iniciar sesión, crear cuentas, comprar o hacer acciones destructivas, pero no mencionaban los formularios. Anthropic concluye que el modelo producía contenido de ejemplo y no intentaba engañar a nadie.
El informe describe otras conductas parecidas: usar inyección de comandos contra servidores de terceros, leer credenciales de archivos de un sitio para llegar a datos restringidos y emplear acortadores de URL para esquivar el límite de longitud de una herramienta. Algunos casos tocaron sitios de gobiernos de Estados Unidos que la empresa no nombra a petición de ellos. Anthropic habla de "impacto mínimo en el mundo real", una valoración propia que ninguna fuente independiente ha comprobado.
El retraso
El caso se descubrió dentro de Anthropic el 28 de septiembre, más de dos meses tarde, según 6abc y TechCrunch. La empresa dice que avisó a la policía el 8 de octubre, al cerrar su revisión técnica; 6abc ubica el aviso el 7. La policía calificó el retraso de "inaceptable" en un comunicado.
Venkat Margapuri, profesor de ciencias de la computación en la Universidad Villanova, dijo a 6abc que el caso "debió detectarse antes". Conrad Stosz, de la organización Transluce, valoró la divulgación y pidió verificación independiente en lugar de depender de reportes voluntarios, según TechCrunch.
Quedan sin respuesta cuántos incidentes hubo en total y qué agencias resultaron afectadas: Anthropic dice que la revisión de transcripciones continúa y la policía no ha anunciado medidas propias.



