OpenAI decidió cancelar el lanzamiento de GPT-6.1 Astra, su próximo modelo de inteligencia artificial, después de que las pruebas internas detectaran problemas relacionados con la seguridad, la alineación con las instrucciones humanas y la capacidad del sistema para actuar sin autorización.
La decisión, reportada inicialmente por The Wall Street Journal, se produce apenas unas semanas después de que la compañía presentara GPT-6 Astra y en vísperas de su conferencia anual para desarrolladores.
Reuters confirmó posteriormente que OpenAI descartó el lanzamiento previsto para octubre luego de que el modelo no cumpliera con sus estándares internos de seguridad y alineación.
De acuerdo con Saachi Jain, jefe de sistemas de seguridad de OpenAI, durante las evaluaciones GPT-6.1 Astra mostró “retrocesos en dos áreas” frente a la versión anterior.
Una de ellas fue la alineación, es decir, la capacidad del modelo para actuar de acuerdo con las instrucciones y objetivos establecidos por las personas.
Jain también señaló que el sistema “mostró mayores niveles de engaño”, un comportamiento que elevó las preocupaciones de seguridad durante el proceso de evaluación.
El segundo problema identificado estuvo relacionado con la denominada “autorización de alcance”, que se refiere a los límites dentro de los cuales un modelo puede actuar al realizar una tarea.
Según Jain, Astra podía continuar ejecutando determinadas acciones sin solicitar autorización al usuario y, en algunos casos, utilizar herramientas o servicios externos aun cuando hacerlo podía representar un riesgo.
Jain destacó el desafío de “encontrar el equilibrio adecuado entre mantenerse dentro del alcance, pero también evitar la falta de iniciativa en la manera en que el modelo lleva a cabo las tareas, incluso cuando encuentra obstáculos”.
La situación adquiere especial relevancia porque GPT-6 Astra, presentado por OpenAI a principios de septiembre, fue clasificado por la propia compañía como su primer modelo en alcanzar el nivel Crítico de capacidad de ciberseguridad dentro de su Marco de preparación.
OpenAI indicó entonces que el sistema podía, con las herramientas y accesos adecuados, encontrar vulnerabilidades desconocidas y desarrollar métodos para explotarlas sin que una persona guiara cada paso.
La empresa también ha documentado mecanismos adicionales de protección para Astra, entre ellos un aislamiento más estricto, monitoreo de las trayectorias de los modelos y evaluaciones de alineación antes de su utilización interna.
El aplazamiento de GPT-6.1 Astra ocurre además en un contexto de creciente atención sobre el comportamiento de los agentes de inteligencia artificial, capaces de ejecutar tareas con mayor autonomía.
OpenAI y otras compañías del sector han investigado recientemente incidentes en los que sistemas de IA realizaron acciones no autorizadas en internet.
OpenAI tenía previsto celebrar este martes su conferencia anual de desarrolladores, un encuentro en el que habitualmente presenta nuevos productos y avances tecnológicos.
La cancelación de Astra llega así en un momento de mayor escrutinio sobre los mecanismos de seguridad necesarios para modelos capaces de realizar tareas complejas con menor supervisión humana.
Lee también: Bill Gates pide regular la IA; advierte que, sin control, podría provocar “mil millones de muertes”
Por ahora, la compañía no ha establecido una nueva fecha para el lanzamiento de GPT-6.1 Astra. La decisión implica que el modelo deberá someterse a nuevos trabajos de seguridad y evaluación antes de que OpenAI determine si cumple las condiciones necesarias para llegar a los usuarios.
Con información de EFE



