
OpenAI ha pausado las actividades internas de Astra tras concluir que no puede descartar capacidades cibernéticas críticas que superan sus estándares de seguridad.
OpenAI ha decidido pausar las actividades internas de su modelo de inteligencia artificial (IA) en desarrollo Astra, tras no poder descartar "capacidades cibernéticas críticas", según los estándares de seguridad de su marco de evaluación interno.
La compañía liderada por Sam Altman ha enfrentado algunos episodios recientes de problemas de ciberseguridad, al admitir que algunos de sus modelos fueron los culpables de un acceso no autorizado a Hugging Face, así como al identificar un comportamiento descontrolado en pruebas de ciberseguridad del Instituto de Seguridad de la IA del Reino Unido (AISI). Otros modelos como Claude de Anthropic y Meta AI han vivido incidentes similares.
OpenAI ha anunciado su decisión de pausar las actividades internas de Astra, uno de sus próximos modelos en desarrollo, tras no poder satisfacer los estándares de seguridad de la propia compañía de IA. Sus últimas evaluaciones internas dejan ver avances significativos en la codificación de agentes y la ciberseguridad, pero han sido precisamente estos avances los que han llevado a OpenAI a concluir que no pueden "descartar capacidades cibernéticas críticas".
Las conclusiones se basan en que el modelo no cumple con el marco de su Plan de Preparación que, publicado en 2023, sirve de guía para que la compañía pueda identificar el progreso en las capacidades de los modelos. Por ejemplo, los modelos más recientes, incluido GPT-5.6 Sol, se evaluaron en cuanto a capacidades cibernéticas de vanguardia y se clasificaron en el umbral Alto "en lugar del crítico". Mientras que Astra supera esta clasificación llegando a crítico.
Un modelo que alcanza el umbral de crítico en ciberseguridad, según los estándares de OpenAI, tiene capacidad de "identificar y desarrollar exploits funcionales de día cero de todos los niveles de gravedad en muchos sistemas críticos reales y reforzados sin intervención humana". También puede idear y ejecutar estrategias novedosas de extremo a extremo para ciberataques contra objetivos reforzados.
Las evaluaciones preliminares de Astra indican un rendimiento "suficientemente sólido" como para no poder descartar "un nivel de capacidad crítico" actualmente. No obstante, OpenAI ha aclarado que este modelo aún está en desarrollo y "no participó en la explotación de Hugging Face".
Para continuar trabajando este modelo, a pesar de haber suspendido las actividades internas, OpenAI ha intensificado las pruebas de seguridad y desarrollado controles más estrictos. Además, están implementando un sistema de monitoreo universal para "detectar acciones riesgosas y desajustes en todas las aplicaciones de Astra".
OpenAI ha compartido su intención de continuar siendo transparentes respecto a todo lo relativo con la ciberseguridad y sus modelos, a medida que el panorama "cambia rápidamente" porque los modelos se vuelven más capaces. La compañía también colaborará con organismos gubernamentales y organizaciones seleccionadas de seguridad de la IA, proporcionando controles de seguridad recomendados a sus socios de pruebas externos para que puedan ejecutar evaluaciones de forma segura.
Participa en la conversación con respeto. Tu comentario se publicará automáticamente, aunque podrá ser retirado por la redacción.
Comentarios (0)