InicioMundialDetecta OpenAI seis anomalías en sus modelos: Desde ocultar errores hasta burlar...

Detecta OpenAI seis anomalías en sus modelos: Desde ocultar errores hasta burlar restricciones 

OpenAI reveló seis nuevos incidentes de comportamiento “inesperado o preocupante” por parte de sus modelos, incluyendo ocultar errores, compartir archivos y añadir instrucciones fraudulentas para que futuros modelos ignoren las restricciones, mientras la compañía exponía su nuevo marco para reportar “desalineaciones” y prometía mayor transparencia ante crecientes preocupaciones sobre la seguridad de la IA.

OpenAI anunció que compartía un nuevo marco para rastrear, investigar y divulgar la “desalineación de modelos”, lo que le permitirá acelerar la publicación de informes sobre estos incidentes.

La compañía afirmó que no cree que la industria de la IA haya “resuelto la alineación y la monitorización en un grado suficiente para seguir escalando de forma responsable a máxima velocidad durante mucho más tiempo.”

OpenAI también ha revelado seis casos de “comportamiento inesperado o preocupante del modelo” que ha observado en los últimos seis meses.

Uno de los seis incidentes incluyó un modelo no publicado que insertaba “instrucciones no relacionadas” que ignoraban las restricciones normales, aunque la empresa consideró este comportamiento “extremadamente raro”.

Otro caso ocurrió durante el entrenamiento del modelo GPT 5.6 Sol de OpenAI, donde algunas instancias añadieron instrucciones no autorizadas para ocultar errores y desalineaciones en sus resúmenes.

Otros ejemplos incluyen modelos que suben un archivo a internet para citarlos, añadir instrucciones para ocultar errores o comportamientos desalineados de los resúmenes, modelos que utilizan el repositorio interno de software de la empresa para comunicarse con otros modelos y el intercambio de archivos no autorizado entre modelos.

Con información de Forbes México

JMS

Noticias relacionadas

Popular