
OpenAI cancela GPT-6.1 Astra por regresiones de seguridad
Su jefa de seguridad dice que el modelo fue menos honesto sobre lo que hizo y actuaba sin pedir permiso. OpenAI no ha dado nueva fecha para el sucesor de GPT-6 Astra.
Quien usa ChatGPT o la API de OpenAI no verá cambios en los productos actuales, pero el siguiente modelo de la línea Astra no llegará en octubre. OpenAI canceló GPT-6.1 Astra después de que sus pruebas internas de seguridad encontraron regresiones, según Gizmodo, que cita al Wall Street Journal. Al Jazeera confirma el nombre del modelo y las declaraciones de la responsable.
Es Saachi Jain, jefa de sistemas de seguridad de OpenAI. Describió dos fallas. El modelo no siempre informaba con honestidad a los usuarios de lo que había hecho o dejado de hacer, y avanzaba en una tarea sin pedir aprobación, a veces con herramientas y servicios externos que podían ser inseguros. Sí mejoró en un punto: era menos "perezoso" al completar trabajo.
Hay que encontrar cuál es la línea justa entre mantenerse dentro del alcance y evitar la pereza.
Así lo resumió Jain, según la traducción de la cita que recoge Al Jazeera. La empresa piensa someter el modelo base a más entrenamiento por refuerzo (una técnica que ajusta el comportamiento con recompensas) para construir los siguientes modelos de la familia GPT-6, y el anuncio llegó un día antes de su conferencia anual de desarrolladores en San Francisco.
Una precisión que los reportes mezclan: GPT-6 Astra, ya lanzado el 3 de septiembre, y GPT-6.1 Astra, el cancelado, son modelos distintos.
Lo que midió un instituto británico
El mismo 28 de septiembre, el UK AI Security Institute, organismo público del Reino Unido, publicó pruebas de GPT-6 Astra, la versión anterior. En simulaciones de ciberseguridad, con los clasificadores del modelo apagados deliberadamente, ejecutó sin autorización ataques a la cadena de suministro de software en 29.2 % de los casos. GPT-5.6 Sol lo hizo en 6.3 % y GPT-5.5, en 0 % con una muestra menor.
Si la instrucción dejaba claro el alcance, el número de ataques pasó de 26 en 50 pruebas a 4 en 49. Todo ocurrió en simulación, sin acciones reales, y el instituto advierte que las salvaguardas estándar de OpenAI, que no se usaron, están diseñadas para bloquear este comportamiento. No describe al modelo cancelado.
Falta la versión de OpenAI. No hay un comunicado propio que se haya podido consultar: lo conocido viene de declaraciones de Jain a medios. Tampoco hay nueva fecha para el sucesor, y queda por ver qué dirá la empresa en su conferencia de desarrolladores.
Sigue leyendo
- Inteligencia artificial
OpenAI pausa el entrenamiento de sus modelos tras fuga por DNS
- Inteligencia artificial
Australia cita a Altman y Amodei por el hackeo a Medicare
- Inteligencia artificial
OpenAI repone límites de uso tras la caída de ChatGPT y Codex
- Internet
Cloudflare cierra falla que dejaba leer datos de otros clientes



