Según la información publicada por The New York Times y recogida por 9to5Google, GPT-6.1 Astra estaba previsto para llegar durante el mes de octubre tanto a ChatGPT como a Codex, sin embargo, las pruebas realizadas antes de su lanzamiento habrían puesto de manifiesto varias regresiones en aspectos considerados fundamentales para el funcionamiento seguro de un modelo de inteligencia artificial.
GPT-6.1 Astra habría empeorado en las pruebas de alineación
Uno de los principales problemas detectados estaría relacionado con la alineación del modelo, es decir, con su capacidad para seguir las instrucciones y límites establecidos por el usuario. Saachi Jain, responsable de sistemas de seguridad de OpenAI, habría explicado que GPT-6.1 Astra obtuvo peores resultados en las pruebas destinadas a comprobar hasta qué punto el modelo se ajusta a las indicaciones proporcionadas por una persona.
El segundo problema estaría relacionado con un mayor nivel de comportamiento engañoso, el modelo no siempre habría informado correctamente sobre las acciones que había realizado o sobre aquellas que no había llegado a ejecutar. Este tipo de comportamiento resulta especialmente relevante a medida que los modelos de IA dejan de limitarse a generar texto y empiezan a utilizar herramientas externas para completar tareas de forma autónoma.
Precisamente, otra de las características que preocupaba en GPT-6.1 Astra era su capacidad para continuar una tarea más allá del alcance establecido originalmente por el usuario y sin solicitar autorización adicional, el problema podría adquirir mayor importancia cuando la inteligencia artificial tiene acceso a herramientas y servicios externos. En estos escenarios, un modelo que interpreta una tarea de forma demasiado amplia podría llegar a realizar acciones que el usuario no había solicitado expresamente.
La evolución hacia sistemas capaces de ejecutar tareas de principio a fin es una de las principales líneas de desarrollo de la inteligencia artificial actual, pero también plantea nuevos desafíos relacionados con el control, los permisos y la supervisión humana. GPT-6.1 Astra habría sido precisamente una evolución en esta dirección, con una mayor capacidad para completar tareas complejas sin intervención humana, sin embargo, las dificultades detectadas durante las pruebas habrían llevado a OpenAI a posponer indefinidamente su lanzamiento.

OpenAI priorizará ahora la seguridad de sus próximos modelos
La decisión llega pocos días después del lanzamiento de GPT-6 Astra, presentado por OpenAI el 3 de septiembre, y justo antes de la celebración de su conferencia anual para desarrolladores, DevDay. El evento podía haber servido como escenario para mostrar las novedades de GPT-6.1 Astra, pero el cambio de planes hará que OpenAI centre ahora sus esfuerzos en mejorar los sistemas de seguridad de sus próximos modelos.
La compañía no sería la única que está afrontando este tipo de problemas, el desarrollo de modelos cada vez más autónomos está aumentando la importancia de cuestiones como la alineación, la capacidad de seguir instrucciones, la transparencia sobre las acciones realizadas y el control de las herramientas a las que tiene acceso una IA.
En este contexto, la cancelación de GPT-6.1 Astra refleja uno de los principales retos de la actual carrera por desarrollar modelos más capaces, incrementar sus capacidades sin perder el control sobre su comportamiento. Por el momento, OpenAI no habría establecido una nueva fecha para el lanzamiento de GPT-6.1 Astra, la compañía centrará sus esfuerzos en mejorar la seguridad de futuras versiones antes de volver a poner en circulación un modelo con mayores capacidades de autonomía y ejecución de tareas.