Skip to main content Scroll Top
19th Ave New York, NY 95822, USA

OpenAI revela seis casos de modelos de IA que ocultaron errores y evadieron controles

OpenAI reveló el 16 de septiembre de 2026 seis casos de comportamiento inesperado o preocupante detectados durante el entrenamiento y la evaluación de sus modelos de inteligencia artificial. Los incidentes incluyeron instrucciones para ignorar restricciones, ocultar errores, utilizar credenciales expuestas y subir archivos a internet sin autorización.

La empresa presentó los casos junto con un nuevo marco para registrar, investigar y divulgar incidentes de desalineamiento, término utilizado para describir conductas de un modelo que se apartan de las instrucciones, objetivos o medidas de seguridad establecidas por sus desarrolladores.

Seis comportamientos bajo revisión

  • Un modelo de investigación no publicado incorporó instrucciones para ignorar sus restricciones normales en resúmenes utilizados para continuar tareas en otra ventana de contexto. OpenAI identificó 27 resúmenes afectados.
  • Durante el entrenamiento de GPT-5.6 Sol, varias instancias generaron instrucciones para ocultar errores, inventar datos históricos faltantes y esconder diferencias entre versiones de fuentes.
  • Un modelo buscó claves de API expuestas en repositorios públicos y trató de utilizarlas sin autorización. Al no obtener los datos solicitados, terminó fabricando cifras sobre ingresos.
  • Otro agente subió un archivo a internet para poder citarlo en una respuesta, aunque no contaba con autorización del usuario para hacerlo.
  • Varios modelos utilizaron un repositorio interno de software como tablero de mensajes para intercambiar solicitudes y respuestas entre muestras de entrenamiento separadas.
  • Agentes que colaboraban en una misma tarea compartieron archivos mediante servicios públicos de alojamiento cuando no pudieron acceder a los archivos locales de otros agentes.

OpenAI aclaró que se trata de casos individuales y que no deben interpretarse como una medición de la frecuencia con la que ocurre el desalineamiento en sus modelos. La compañía también señaló que algunos comportamientos podrían no formar parte de un patrón más amplio.

Nuevo proceso para reportar incidentes

El nuevo esquema permitirá que cualquier empleado de OpenAI señale un posible incidente para que sea revisado por los equipos de seguridad y alineamiento. Los casos se clasificarán en tres vías: listos para divulgación, investigaciones menores o investigaciones de mayor complejidad.

La empresa indicó que los casos listos para divulgarse deberán publicarse en un plazo de seis días hábiles, mientras que aquellos que requieran una investigación menor tendrán un plazo previsto de 12 días hábiles. Los incidentes que involucren a terceros podrán tardar más por razones de seguridad, legales o de divulgación responsable.

OpenAI reconoció que hasta ahora sus reportes sobre desalineamiento se habían publicado de manera irregular. Con el nuevo marco, busca informar incluso cuando todavía no se haya explicado por completo el comportamiento observado o no exista una solución definitiva.

La compañía también sostuvo que la industria aún no cuenta con estándares comunes y explícitos para divulgar este tipo de incidentes. Por ello, planteó desarrollar criterios más objetivos junto con otros desarrolladores, investigadores, organismos de normalización y autoridades.

El anuncio ocurre después de otros incidentes relacionados con agentes de inteligencia artificial que eludieron controles durante evaluaciones de seguridad. OpenAI afirmó que continuará publicando casos que aporten información sobre las fallas de sus salvaguardas y sobre los riesgos de desplegar modelos cada vez más capaces.