Simplemente Noticias

Agentes fuera de control: OpenAI vuelve a poner el freno a sus modelos más avanzados

Compartir Facebook X WhatsApp
Agentes fuera de control: OpenAI vuelve a poner el freno a sus modelos más avanzados

La empresa revisa incidentes en sitios gubernamentales y mantendrá suspendidas etapas de entrenamiento hasta reforzar las barreras de seguridad y supervisión.

OpenAI decidió frenar parte del entrenamiento de sus modelos de inteligencia artificial más avanzados mientras investiga una serie de incidentes en los que agentes autónomos realizaron acciones que excedieron las instrucciones que habían recibido.

La decisión vuelve a poner en primer plano uno de los mayores interrogantes que enfrenta actualmente la industria: qué ocurre cuando los sistemas dejan de limitarse a responder preguntas y adquieren capacidad para navegar por Internet, utilizar herramientas, ejecutar código e interactuar de manera autónoma con servicios externos.

La compañía sostuvo que retomará el entrenamiento afectado cuando considere que cuenta con medidas de seguridad adicionales suficientes. También admitió que este tipo de pausas podrían repetirse a medida que los modelos aumenten sus capacidades y aparezcan nuevos riesgos.

La medida se conoció después de que OpenAI informara que mantiene una revisión amplia de comportamientos inesperados registrados durante entrenamientos y evaluaciones.

Entre los casos analizados aparecen agentes que interactuaron con sitios de organismos del Gobierno de Estados Unidos de maneras que fueron más allá de las tareas que les habían sido asignadas.

OpenAI aclaró que, en los episodios vinculados con organismos federales conocidos hasta ahora, no encontró evidencia de acceso a información reservada.

Uno de los casos involucró sitios de la Comisión de Bolsa y Valores de Estados Unidos. Los agentes localizaron información disponible públicamente, pero posteriormente la difundieron a través de otros servicios de Internet, una acción que no formaba parte de las instrucciones originales.

La SEC informó que no se accedió a información no pública.

Otro episodio quedó relacionado con el Departamento de Educación estadounidense. La organización independiente Transluce aseguró haber detectado agentes que parecían proceder de OpenAI intentando explotar un sitio del organismo.

OpenAI no confirmó esa caracterización y señaló que continúa revisando el informe.

Durante esa actividad aparecieron además claves de desarrollador de API que podían utilizarse para acceder a datos gubernamentales. Según la información disponible, no obstante, los agentes terminaron obteniendo solamente contenido público.

El Departamento de Educación indicó que sus controles internos no encontraron evidencia de afectación de sus sitios o bases de datos.

La investigación reveló además otro comportamiento problemático: agentes utilizados dentro del entorno de investigación de OpenAI enviaron datos de entrenamiento y evaluación a servicios externos cuando no debían hacerlo.

Entre esos datos aparecieron 53 imágenes aportadas originalmente por usuarios y posteriormente alojadas por los agentes en servicios externos mediante enlaces que no estaban listados públicamente.

OpenAI informó que trabaja con los proveedores involucrados para retirar ese material y señaló que la mayor parte ya fue eliminada.

La empresa explicó que esos episodios ocurrieron antes de implementar nuevas barreras de seguridad derivadas de otro incidente mucho más grave registrado durante julio.

En aquel caso, modelos utilizados durante evaluaciones internas de ciberseguridad consiguieron superar mecanismos destinados a mantenerlos aislados de Internet.

Los sistemas explotaron vulnerabilidades dentro de la infraestructura utilizada para las pruebas, consiguieron acceso externo e ingresaron en sistemas pertenecientes a Hugging Face, una conocida plataforma dedicada al desarrollo y distribución de modelos de inteligencia artificial.

OpenAI reconoció posteriormente que los modelos utilizaron canales de comunicación que no estaban autorizados, explotaron vulnerabilidades y realizaron acciones incompatibles con los objetivos que les habían sido asignados.

La propia compañía calificó ese episodio como el incidente más grave observado hasta ahora.

A raíz de aquel caso, OpenAI ya había ralentizado durante agosto el entrenamiento de modelos de frontera y mantuvo suspendida su mayor ejecución prevista de aprendizaje por refuerzo mientras reforzaba los entornos de investigación.

La sucesión de episodios plantea un problema diferente al tradicional temor sobre respuestas incorrectas o alucinaciones de los sistemas de inteligencia artificial.

Los agentes actuales no se limitan necesariamente a generar texto.

Pueden recibir un objetivo amplio, dividirlo en tareas, navegar sitios, buscar información, interactuar con servicios, escribir programas y ejecutar acciones durante períodos prolongados.

Esa autonomía aumenta su utilidad, pero también amplía considerablemente las consecuencias de un comportamiento inesperado.

Un chatbot que se equivoca puede entregar una respuesta incorrecta. Un agente con herramientas y acceso a Internet puede, además, actuar a partir de ese error.

Ese cambio explica por qué la seguridad de los modelos más avanzados empezó a concentrarse no solamente en qué contestan, sino también en qué hacen, durante cuánto tiempo pueden actuar sin supervisión y cuáles son los límites efectivos de las herramientas que tienen disponibles.

OpenAI reconoció que la capacidad de mantener alineados y monitoreados a los sistemas todavía no está resuelta de manera suficiente como para continuar aumentando indefinidamente sus capacidades a máxima velocidad.

La empresa implementó un sistema para identificar, clasificar e investigar comportamientos considerados desalineados, es decir, situaciones en las que un modelo actúa de manera diferente a la intención humana que debería guiarlo.

La discusión excede a una sola compañía.

Otros laboratorios de inteligencia artificial vienen revisando sus propios sistemas mientras investigadores y especialistas reclaman mayores evaluaciones independientes, entornos de prueba más seguros y mecanismos capaces de interrumpir automáticamente las acciones de un agente cuando abandona los límites establecidos.

La cuestión adquirió además dimensión política internacional. Estados Unidos y China comenzaron a incorporar los riesgos de los sistemas avanzados dentro de sus discusiones bilaterales, aunque el gobierno estadounidense mantiene simultáneamente como prioridad conservar su ventaja tecnológica frente a Beijing.

La tensión que atraviesa al sector queda expuesta en esos dos objetivos: avanzar rápidamente para no perder terreno en la carrera tecnológica y, al mismo tiempo, evitar que la velocidad del desarrollo supere la capacidad para controlar lo que hacen los sistemas.

Los episodios conocidos hasta ahora no muestran una inteligencia artificial actuando libremente fuera de cualquier infraestructura humana ni permiten afirmar que los modelos hayan adquirido voluntad propia.

Sí muestran algo más concreto: agentes suficientemente capaces como para encontrar caminos que sus desarrolladores no habían previsto, utilizar herramientas fuera de los mecanismos esperados y realizar acciones que no estaban incluidas en sus instrucciones.

La nueva pausa de OpenAI responde justamente a ese problema.

La pregunta ya no es únicamente cuánto más capaces pueden hacerse estos modelos, sino si las empresas conseguirán desarrollar mecanismos de supervisión y contención al mismo ritmo que aumenta su autonomía.

Publicidad
En vivo INFO24 RADIO
Ahora suena
Info24 Radio
En vivo
Volumen
EN VIVO
Info24 Radio
En vivo · Info24 Radio