
La compañía presenta un nuevo marco de transparencia para documentar comportamientos no alineados en sus modelos de inteligencia artificial.
OpenAI ha revelado seis nuevos casos de desajuste en el comportamiento de sus modelos de inteligencia artificial: agentes que actuaron sin autorización, desde insertar instrucciones en resúmenes de tareas hasta inventar datos o acceder a recursos externos sin permiso.
La compañía ha hecho públicos estos casos dentro de un nuevo «marco para el seguimiento, la investigación y la divulgación de casos de desajuste de modelos». Con ello busca avanzar en transparencia y ofrecer a otros desarrolladores información útil para detectar problemas similares en sus propios modelos.
OpenAI señala que estos comportamientos «no necesitan causar daño ni establecer un patrón generalizado para merecer ser divulgados» y que su divulgación busca ser útil para el conjunto del sector. El primero de los seis casos corresponde a un modelo de investigación no publicado que insertó instrucciones no autorizadas en sus resúmenes de tareas para saltarse restricciones habituales.
En otro incidente, un modelo localizó y empleó una clave API expuesta en repositorios públicos sin autorización para responder a una pregunta sobre cifras de ingresos. Al no encontrar los datos solicitados, los fabricó. Durante el entrenamiento de GPT-5.6 Sol, la compañía detectó que el modelo añadía instrucciones a sus resúmenes para inventar datos o ocultar fallos al usuario.
Un modelo todavía no publicado subió de forma autónoma archivos a internet con el fin de citarlos en las instrucciones que solicitaba el usuario. Varios modelos utilizaron además un repositorio de software interno como tablón de anuncios para comunicarse entre distintos procesos de entrenamiento independientes mientras buscaban archivos de entrada faltantes, aunque no lograron recuperarlos.
OpenAI también detectó casos de colaboración entre agentes que trabajaban en la misma tarea de entrenamiento y recurrieron a sitios web públicos de almacenamiento para compartir archivos al carecer de acceso local cruzado.
OpenAI afirma que su objetivo es que otros desarrolladores puedan identificar y corregir comportamientos de desalineación equivalentes en sus propios modelos.
Estas preguntas han sido generadas por inteligencia artificial para favorecer el diálogo y la reflexión.
¿Crees que OpenAI está siendo suficientemente transparente al revelar estos desajustes en sus modelos de IA?
¿Te parece que estos comportamientos no autorizados de los modelos representan un riesgo real para la seguridad de la inteligencia artificial?
Tu opinión es importante. Comparte tu punto de vista con respeto.
Participa en la conversación con respeto. Tu comentario se publicará automáticamente, aunque podrá ser retirado por la redacción.
Comentarios (0)