La Propuesta Digital
jueves, 17 de septiembre de 2026
OpenAI revela conductas preocupantes de sus modelos y refuerza mecanismos de vigilancia

OpenAI revela conductas preocupantes de sus modelos y refuerza mecanismos de vigilancia

·17 de septiembre de 2026·4

¿Te gustó esta noticia? Compártela:

Compartir:
WhatsAppFacebookXLinkedIn
AdSense — horizontal

OpenAI divulgó seis informes sobre comportamientos “inesperados o preocupantes” detectados en modelos de inteligencia artificial, mientras aumenta el debate internacional acerca de los riesgos asociados con el rápido desarrollo de esta tecnología.

La empresa informó que implementará un nuevo marco destinado a registrar, investigar y divulgar episodios de lo que denomina “desalineación”. El concepto comprende situaciones en las que los sistemas actúan sin autorización, se coordinan con otros modelos o intentan evadir los mecanismos establecidos para supervisarlos.

El anuncio se produce mientras destacados ejecutivos de la industria tecnológica estadounidense, incluidos los responsables de OpenAI y Anthropic, reclaman una desaceleración en el desarrollo de sistemas avanzados de inteligencia artificial, con el objetivo de permitir que las medidas de seguridad puedan avanzar al mismo ritmo.

Entre los incidentes revelados figura el comportamiento de un modelo de investigación que todavía no había sido lanzado al público. Durante una prueba, el sistema introdujo en sus propias notas instrucciones similares a las utilizadas para quebrantar las barreras de seguridad de los modelos.

El sistema se indicó a sí mismo que ignorara sus restricciones habituales y buscó liberarse de las funciones e identidades establecidas para controlar el comportamiento de los asistentes conversacionales.

En otro caso, un agente de inteligencia artificial empleó un código informático para responder una pregunta. Sin embargo, al necesitar una fuente digital que pudiera citar para respaldar su respuesta, subió un archivo a internet sin solicitar previamente la autorización del usuario.

OpenAI también detectó comportamientos irregulares durante el entrenamiento de un modelo identificado como 5.6-sol. En ese proceso, el sistema se dio instrucciones para inventar datos que no estaban disponibles, mientras otro agente escribió un mensaje dirigido a sí mismo para recordar que debía ocultar información que no coincidía.

La compañía explicó que los seis casos fueron identificados durante procesos de entrenamiento o evaluación realizados en los últimos meses.

OpenAI sostuvo que, a medida que los sistemas de inteligencia artificial se vuelven más avanzados y se utilizan de manera más amplia, resulta necesario construir un consenso mejor informado sobre los avances y desafíos de las investigaciones destinadas a mantenerlos alineados con las instrucciones y los objetivos humanos.

La compañía consideró que las decisiones sobre la dirección que debe tomar el desarrollo de la inteligencia artificial durante los próximos meses y años tienen que basarse en pruebas que también puedan ser examinadas por especialistas, instituciones y ciudadanos ajenos a las empresas que construyen los modelos más avanzados.

Los nuevos informes se conocen después de que OpenAI revelara en julio que uno de sus sistemas de inteligencia artificial, cuyo comportamiento se había apartado de las instrucciones establecidas, logró vulnerar durante una prueba a la empresa tecnológica Hugging Face.

Anthropic informó ese mismo mes que sus modelos de inteligencia artificial también consiguieron penetrar los sistemas de tres organizaciones durante pruebas controladas.

Lian Jye Su, analista jefe del grupo de investigación y asesoría tecnológica Omdia, explicó que los agentes de inteligencia artificial se están volviendo más capaces y persistentes al momento de resolver tareas complejas.

Según el especialista, estos sistemas pueden recurrir a la colaboración entre agentes, compartir conocimientos y utilizar técnicas de engaño u ocultamiento para alcanzar los objetivos que les han sido asignados.

Estas capacidades dificultan la supervisión y contención de los modelos mediante los métodos tradicionales de seguridad empleados en el campo de la inteligencia artificial.

Su señaló que el nuevo marco de OpenAI para registrar y divulgar incidentes podría motivar a otros desarrolladores a establecer procedimientos similares.

No obstante, advirtió que el sistema continúa siendo interno y voluntario. Aun así, consideró que representa un paso positivo hacia una mayor transparencia y supervisión de la industria.

La información fue difundida por el periodista Chan Ho-Him, de The Associated Press, con la colaboración del corresponsal de negocios Kelvin Chan desde Londres.

AdSense — horizontal