OpenAI admite que sus agentes publicaban en una wiki

OpenAI admite que sus agentes publicaban en una wiki

Sigue a MadridActual en Google
Añadir a mis fuentes favoritas

La empresa reconoce que sus agentes autónomos se coordinaban en un foro para eludir restricciones de seguridad.

OpenAI ha confirmado que sus agentes de inteligencia artificial fueron los artífices del denominado "incidente de la wiki", con lo que ha decidido definir nuevos estándares sobre "cuándo y cómo compartir incidentes de desalineación". Un grupo de investigadores descubrió recientemente que agentes de OpenAI comenzaron a publicar en un foro wiki alemán poco conocido para colaborar entre sí.

Los investigadores encontraron aproximadamente 18.000 publicaciones de agentes de IA autónomos que se identificaban como pertenecientes a la compañía liderada por Sam Altman y utilizaban internet público para comunicarse durante una tarea de recuperación de información web. Según los investigadores, estos agentes confabularon para compartir respuestas, investigar su entorno y eludir las restricciones del entorno aislado.

OpenAI ha reconocido este incidente a través de su cuenta oficial en la red social X, donde se ha referido a este caso como "incidente de la wiki", en el que sus agentes "escribieron a varios sitios de internet". Este incidente se enmarca en un caso de desalineación, es decir, cuando agentes de IA actúan de forma no intencionada conforme a los objetivos de su diseño.

Nuevos criterios de reporteo

OpenAI ha explicado que habitualmente ha tratado estos casos de agentes de IA que actúan de forma no intencionada como "una pregunta de investigación, que se comunica en publicaciones de investigación". Sin embargo, estos hechos, que son similares a otros ocurridos recientemente como el 'hackeo' a Hugging Face, están provocando "nuevos tipos de impacto en el mundo real" relacionados con la seguridad.

Por ello, OpenAI ha decidido definir estándares sobre "cuándo y cómo" compartir incidentes de desalineación, "no solo propiedades de desalineación de los modelos". Estos nuevos criterios se desarrollarán específicamente para "esta nueva fase de capacidades de modelos", de manera que tanto la compañía como la comunidad de IA tengan un estándar claro para reportar desalineaciones que sucedan durante el entrenamiento, la evaluación y el despliegue.

Esto incluye "ejemplos que no se parezcan a incidentes de seguridad tradicionales pero que podrían proporcionar información sobre el comportamiento de la IA y riesgos futuros", como ha especificado la tecnológica. OpenAI ha adelantado que compartirán este nuevo marco en las próximas semanas y que están trabajando "con docenas de agencias reguladoras gubernamentales" a nivel mundial.

Antecedentes de desalineación

La pasada semana OpenAI compartió nuevos detalles sobre el 'hackeo' que protagonizaron sus modelos de IA en julio, cuando se escaparon de un entorno de entrenamiento aislado y desconectado de internet para resolver una de las pruebas más difíciles, conocida como ExploitGym. Los agentes de IA se coordinaron a través de un foro improvisado de Artifactory, que convirtió en "un tablón de anuncios no previsto".

Esta actividad empezó en mayo, cuando un agente dejó una nota pidiendo a otros agentes que le entregaran un archivo extraviado. La actividad mantenida en este tablón de anuncios por los agentes acabó provocando la interrupción del servicio el 4 de julio. Estos incidentes subrayan los desafíos de seguridad que plantea el desarrollo de agentes de IA cada vez más autónomos y capaces de coordinarse de formas imprevistas.

Preguntas para el debate:

Estas preguntas han sido generadas por inteligencia artificial para favorecer el diálogo y la reflexión.

¿Crees que OpenAI debería haber informado públicamente de estos incidentes de desalineación antes de que los investigadores los descubrieran?

¿Te parece suficiente que las empresas de IA establezcan nuevos estándares de reporteo, o deberían existir regulaciones externas que lo obliguen?

Tu opinión es importante. Comparte tu punto de vista con respeto.

Comentarios (0)

Sé el primero en comentar esta noticia.

Escribe un comentario

Participa en la conversación con respeto. Tu comentario se publicará automáticamente, aunque podrá ser retirado por la redacción.