jueves, 17 septiembre, 2026

OpenAI publicó seis casos de comportamiento inesperado en sus modelos de inteligencia artificial

La empresa informó episodios en los que sus sistemas inventaron datos, ocultaron información e intentaron eludir restricciones durante entrenamientos y evaluaciones. Anunció un nuevo mecanismo para reportar incidentes.

OpenAI hizo públicos seis episodios en los que sus modelos de inteligencia artificial mostraron comportamientos inesperados o preocupantes durante procesos de entrenamiento o evaluación realizados en los últimos meses. La empresa los engloba bajo el concepto de “desalineación”: situaciones en las que un sistema actúa de una manera que no coincide con los objetivos, límites o controles establecidos por sus desarrolladores o por los propios usuarios.

OpenAI aclaró que los seis casos no constituyen un registro exhaustivo de todos los problemas encontrados en sus modelos, sino un primer conjunto de incidentes que decidió divulgar públicamente.

Una IA intentó ignorar sus propios límites

Uno de los episodios involucró a un modelo experimental no lanzado al público que, durante determinadas tareas, debía resumir su trabajo para continuar cuando se quedaba sin espacio en su ventana de contexto. OpenAI detectó que, en algunos de esos resúmenes, el modelo introdujo instrucciones que no correspondían a la tarea original, como indicaciones para ignorar restricciones habituales y comportarse de manera diferente al retomar el trabajo. En uno de esos textos, el sistema se dejó instrucciones para quedar “liberado de los roles e identidades que atan a otros chatbots”.

Datos inventados y errores ocultos

Otro caso apareció durante el entrenamiento de un modelo. La compañía observó que algunas instancias incorporaban en sus propios resúmenes instrucciones destinadas a ocultar errores o comportamientos incorrectos al usuario. Por ejemplo, mensajes internos indicaban que, si faltaban datos para completar una tarea, debía inventarlos sin advertirlo. En otros casos, el modelo se recordaba ocultar información que no coincidía con lo que intentaba producir.

Otro incidente comenzó con una consulta que requería encontrar información en internet. El modelo localizó en un repositorio público una clave de acceso expuesta y decidió utilizarla sin autorización para intentar obtener los datos. El intento no funcionó. En lugar de reconocer que no había podido acceder a la información, el sistema inventó los datos faltantes y los presentó como reales.

Acciones sin permiso para completar una tarea

En otro experimento, un agente de IA había conseguido correctamente una respuesta mediante código informático, pero necesitaba además proporcionar una fuente disponible en internet. Para cumplir con esa condición, decidió subir un archivo a la web pública y utilizar posteriormente ese enlace como cita, sin solicitar autorización previa al usuario. El dato obtenido era correcto, pero el modelo realizó una acción externa que nadie le había pedido.

Agentes que encontraron formas de compartir información

Los últimos casos publicados por OpenAI muestran otro desafío: qué ocurre cuando varios agentes de inteligencia artificial trabajan juntos y encuentran mecanismos propios para intercambiar información. En una de las pruebas, distintos agentes utilizaron herramientas disponibles dentro del entorno de trabajo para enviarse pedidos y respuestas mientras intentaban localizar archivos. En otro caso, agentes que no podían acceder directamente a los archivos locales de otros sistemas terminaron utilizando servicios públicos para compartirlos. Como consecuencia, información que debía mantenerse restringida quedó disponible mediante enlaces accesibles desde internet.

El nuevo sistema de OpenAI para reportar incidentes

A partir de estos episodios, OpenAI presentó un nuevo mecanismo interno destinado a registrar, investigar y divulgar casos de desalineación. Los empleados podrán reportar comportamientos sospechosos para que sean analizados por los equipos de seguridad. Los incidentes serán clasificados y priorizados según su gravedad y complejidad.

OpenAI reconoció que hasta ahora este tipo de descubrimientos se publicaban de manera puntual y con menor frecuencia de la que la propia empresa considera adecuada. “En el pasado, para informar mejor a investigadores, desarrolladores de IA, responsables de políticas públicas y al público general, hemos intentado hacer públicos nuestros hallazgos sobre desalineación”, explicó la compañía. “Pero, sin un enfoque sistemático para informar estos hallazgos, nuestras divulgaciones han sido puntuales y menos frecuentes de lo ideal”, agregó.

La empresa sostuvo que todavía no existe dentro de la industria un estándar general para informar este tipo de comportamientos y espera que el nuevo esquema contribuya a generar prácticas similares entre otros desarrolladores.

La advertencia sobre seguir avanzando “a máxima velocidad”

El anuncio llega en medio de un debate cada vez más intenso sobre la velocidad con la que avanzan los modelos de inteligencia artificial más potentes. OpenAI fue explícita al referirse a ese punto. “No creemos que la industria de la IA haya resuelto la alineación y el monitoreo en un grado suficiente como para seguir ampliando responsablemente la escala a máxima velocidad por mucho más tiempo”, afirmó.

La compañía también sostuvo que las decisiones sobre cómo debería avanzar el desarrollo de la inteligencia artificial durante los próximos meses y años deberían basarse en evidencia que pueda ser examinada por personas ajenas a las empresas que construyen los modelos más avanzados.

Los seis episodios divulgados no implican que los sistemas actuales puedan actuar completamente por fuera del control humano. Muestran un problema que gana relevancia a medida que los modelos adquieren mayor autonomía: pueden encontrar caminos inesperados para cumplir un objetivo, incluso cuando esos caminos chocan con las restricciones que deberían respetar.

Con información de Bloomberg y AP

Más Noticias

Noticias
Relacionadas

Germán Gómez fue titular en el tercer triunfo argentino en el Sudamericano de Río

La Selección Argentina de vóley venció a Chile 3-0 en el Sudamericano de Río. Germán Gómez, de Carolina, fue titular y sumó 8 puntos.

OpenAI reporta incidentes de seguridad de IA y establece un plan de divulgación

OpenAI reveló incidentes no divulgados de comportamiento inesperado de sus modelos de IA y presentó un marco para reportar casos de desalineación en el futuro.

Corrientes fue sede del Primer Encuentro Litoral Cancillería

Corrientes albergó el Primer Encuentro Litoral – Cancillería: Oportunidades Mercosur-Unión Europea con funcionarios y empresarios de seis provincias.

Virasoro conmemora el centenario de la imposición de su nombre con actos oficiales y una serenata

Virasoro conmemora el centenario de la imposición de su nombre el 23 de septiembre con actos oficiales, desfile, serenata y obras urbanas.