Noticias con acento.

Una camioneta blanca de la policía de Filadelfia, con franja azul y amarilla y la leyenda Dial 911, estacionada en una calle del centro.
Vehículo de la policía de Filadelfia. Imagen de archivo.PFDChasePictures / Wikimedia Commons (CC BY 2.0) · Imagen de archivo
Inteligencia artificial

Claude envió una pista falsa a la policía de Filadelfia

Anthropic tardó más de dos meses en detectarlo y ahora corta el acceso a internet de todas sus evaluaciones internas mientras refuerza su vigilancia.

Claude Haiku 4.5, un modelo de inteligencia artificial de Anthropic, envió el 18 de julio un formulario de pista sobre un homicidio sin resolver a la policía de Filadelfia, sin que nadie se lo hubiera pedido. Lo cuenta Anthropic en un informe publicado el 9 de octubre sobre acciones no previstas de sus modelos en pruebas y en uso interno.

Según el departamento de policía, citado por 6abc Action News, el sistema del formulario marcó el envío como spam y la pista jamás pasó al Centro de Crimen en Tiempo Real, donde se revisan. La policía dice que no hubo acceso no autorizado a sus sistemas ni fuga de datos.

Lo que cambia para Anthropic: cortó la conexión a internet de todas sus evaluaciones internas, y la mantendrá así hasta confirmar que su monitoreo detecta estas conductas. También retiró algunas pruebas públicas, endureció sus herramientas de navegación y mueve sus agentes internos a una infraestructura administrada de forma central.

Qué hizo el modelo

La tarea consistía en generar interacciones de ejemplo en sitios elegidos al azar. El modelo llegó a una página sobre un crimen sin resolver, inventó una pista y la envió con los campos de nombre y contacto vacíos. Sus instrucciones prohibían iniciar sesión, crear cuentas, comprar o hacer acciones destructivas, pero no mencionaban los formularios. Anthropic concluye que el modelo producía contenido de ejemplo y no intentaba engañar a nadie.

El informe describe otras conductas parecidas: usar inyección de comandos contra servidores de terceros, leer credenciales de archivos de un sitio para llegar a datos restringidos y emplear acortadores de URL para esquivar el límite de longitud de una herramienta. Algunos casos tocaron sitios de gobiernos de Estados Unidos que la empresa no nombra a petición de ellos. Anthropic habla de "impacto mínimo en el mundo real", una valoración propia que ninguna fuente independiente ha comprobado.

El retraso

El caso se descubrió dentro de Anthropic el 28 de septiembre, más de dos meses tarde, según 6abc y TechCrunch. La empresa dice que avisó a la policía el 8 de octubre, al cerrar su revisión técnica; 6abc ubica el aviso el 7. La policía calificó el retraso de "inaceptable" en un comunicado.

Venkat Margapuri, profesor de ciencias de la computación en la Universidad Villanova, dijo a 6abc que el caso "debió detectarse antes". Conrad Stosz, de la organización Transluce, valoró la divulgación y pidió verificación independiente en lugar de depender de reportes voluntarios, según TechCrunch.

Quedan sin respuesta cuántos incidentes hubo en total y qué agencias resultaron afectadas: Anthropic dice que la revisión de transcripciones continúa y la policía no ha anunciado medidas propias.

Sigue leyendo

Contamos las visitas sin cookies, con nuestra medición propia y con Google Analytics 4, de Google LLC, que recibe datos básicos de tu visita (la página, tu tipo de dispositivo y navegador, y tu IP para estimar tu ubicación aproximada) en servidores de Google en Estados Unidos. Solo si aceptas, se guardan además las cookies _ga y _ga_S137BJ57VS, con un identificador aleatorio que dura hasta dos años, y la cookie em_reader, un identificador aleatorio que solo sirve para contar de forma anónima a los lectores que vuelven; dura 13 meses y se borra en cuanto retiras tu aceptación. Puedes rechazarlas sin perder nada: el periódico funciona igual. Guardamos tu decisión doce meses y puedes cambiarla cuando quieras desde el pie de página. Más información sobre cookies