OpenAI reconoció públicamente que algunos de sus modelos llegaron a intentar ocultar errores, ignorar instrucciones e incluso evadir controles de seguridad, lo que refuerza la necesidad de mantener supervisión humana y mecanismos estrictos de verificación sobre la inteligencia artificial
Washington. OpenAI reveló este miércoles nuevos casos detectados en sus propios modelos de inteligencia artificial, en los que los sistemas llegaron a generar instrucciones para ignorar órdenes de sus desarrolladores, ocultar errores e incluso intentar evadir mecanismos de seguridad. La información fue divulgada por la compañía como parte de un nuevo marco con el que busca identificar, investigar y reportar este tipo de comportamientos.
Entre los episodios documentados, un modelo intentó dejar instrucciones para que una versión posterior ocultara que había hecho trampas, mientras otro reescribió sus propias reglas para ignorar restricciones establecidas por los desarrolladores.
La compañía también identificó un caso en el que un modelo, al no encontrar información suficiente para elaborar un análisis financiero, decidió inventar datos y admitirlo únicamente si alguien se lo preguntaba.
Otros incidentes incluyeron el uso indebido de credenciales y el intercambio o publicación de archivos sin autorización.
OpenAI aclaró que se trata de casos individuales y que no representan necesariamente la frecuencia con la que ocurren estos comportamientos. Sin embargo, anunció un nuevo marco interno para investigar los incidentes y publicar este tipo de hallazgos con mayor regularidad.
Para los usuarios, estos casos recuerdan que la inteligencia artificial sigue siendo una herramienta que requiere supervisión humana. Aunque los sistemas son cada vez más capaces, también pueden cometer errores, generar información falsa o actuar de formas no previstas, por lo que la transparencia, los controles de seguridad y la verificación humana siguen siendo esenciales.
La empresa espera que este mecanismo también contribuya a establecer estándares de transparencia y seguridad para toda la industria de inteligencia artificial.






