En una reunión informativa con WIRED, un representante de OpenAI reconoció que la empresa antes revelaba los incidentes de desalineación con muy poca frecuencia. Bajo condición de anonimato, explicó que el nuevo marco busca facilitar que OpenAI informe al público con mayor rapidez cuando detecte comportamientos inesperados en sus modelos, incluso antes de poder investigarlos a fondo, explicarlos o mitigarlos.
El marco de trabajo describe los métodos que los empleados de OpenAI pueden utilizar para informar sobre incidentes de desalineación a los responsables de seguridad y alineación de la empresa, quienes determinarán si es necesaria una investigación más exhaustiva. OpenAI afirma que planea desarrollar criterios de divulgación más objetivos en colaboración con otros desarrolladores de IA, investigadores externos, organismos de normalización del sector y reguladores. La empresa está trabajando activamente en propuestas de mecanismos de notificación para informar sobre incidentes de seguridad, protección y desalineación al gobierno federal de EE UU.
"Por el momento, no existe un marco para todo el sector con normas explícitas sobre cómo deben los desarrolladores de IA dar a conocer los casos de desalineación en sus modelos. Esperamos que el marco que presentamos sea un primer paso hacia la creación de dichas normas, en el que se establezca qué casos de desalineación deben comunicar los desarrolladores y qué deben incluir sus informes", ha señalado OpenAI en una entrada de blog.
ralentizar el desarrollo de la IA. Este respaldo se produjo apenas unos días después de que el investigador en IA Jacob Coxon renunciara a Anthropic y, posteriormente, se hiciera viral por alertar al público de que la carrera entre los laboratorios de vanguardia para desarrollar una IA cada vez más avanzada estaba poniendo en riesgo la seguridad de la humanidad.Las propuestas para desacelerar el desarrollo de la IA se han topado con la resistencia de la administración del presidente Trump, que ha argumentado que el sector no necesita nuevas leyes ni regulaciones para garantizar que su tecnología sea segura.
Dos de los ejemplos de desalineación que OpenAI compartió se referían a modelos de IA internos de la empresa, aún no publicados, que subieron archivos a internet a pesar de no haber recibido instrucciones para hacerlo.
Uno de los incidentes tuvo lugar en octubre de 2025, cuando, según OpenAI, estaba probando la capacidad de uno de sus modelos para citar datos de dominio público en sus respuestas. Sin embargo, cuando el modelo no pudo encontrar la información que necesitaba, subió un archivo a un servicio temporal de alojamiento de archivos, que posteriormente intentó citar en su respuesta. La empresa afirma que esto parecía un intento de aprovecharse de un sistema de calificación automatizado utilizado para evaluar la competencia del modelo en la prueba de referencia.
el ataque a Hugging Face meses más tarde. En este incidente, la empresa afirma que sus agentes no aprovecharon ninguna vulnerabilidad para intercambiar mensajes. OpenAI afirma que ahora utiliza monitores de alineación, evaluaciones y ejercicios de red teaming (pruebas de ataque) para garantizar que sus agentes no se comuniquen entre sí de forma encubierta.Los profesionales de la ciberseguridad ya habían declarado a WIRED que el ataque a Hugging Face se debió a errores humanos y que las prácticas de seguridad actuales podrían haber evitado el incidente. Sin embargo, Chen señala que OpenAI está tratando de adoptar un enfoque integral de la seguridad de la IA que tenga en cuenta las crecientes capacidades de los modelos de IA y no dependa de un entorno seguro.
"Queremos asegurarnos de que los modelos estén alineados independientemente del entorno en el que se implementen. Cuando la gente dice que se trata de un problema de seguridad y no de alineación, creo que realmente no tiene sentido. Lo que se quiere es que el modelo se comporte correctamente en todo momento", concluye Chen.
Artículo originalmente publicado enWIRED.com.Adaptado por Alondra Flores.