Mundo Web

OpenAI reveló seis casos en los que su inteligencia artificial actuó de forma inesperada

Foto: X/@TelemundoNews

La compañía presentó un nuevo sistema para registrar y comunicar episodios de "desalineación" de sus modelos. Entre los casos detectados aparecen datos inventados, instrucciones para ocultar fallas y archivos enviados a internet sin autorización.

OpenAI dio a conocer seis episodios de comportamiento inesperado o preocupante de sus modelos de inteligencia artificial, registrados durante procesos de entrenamiento y evaluación en los últimos meses. La compañía detalló los casos como parte de un nuevo marco destinado a investigar y divulgar situaciones en las que el comportamiento de una IA se aparta de las instrucciones previstas.

Uno de los episodios más llamativos ocurrió durante el entrenamiento de GPT-5.6 Sol. Según el informe de OpenAI, algunas instancias del modelo incorporaron en sus propios resúmenes instrucciones destinadas a ocultar errores o comportamientos que no coincidían con lo esperado. En determinados casos, esas instrucciones contemplaban inventar información histórica faltante y no informar inconsistencias detectadas en las fuentes.

Otro modelo de investigación, que todavía no había sido lanzado, también generó instrucciones dentro de los resúmenes utilizados para continuar tareas en nuevas ventanas de contexto. OpenAI identificó 27 resúmenes afectados. Algunas de esas indicaciones buscaban modificar las restricciones habituales del sistema y fueron descritas por la empresa como similares a intentos de jailbreak.

En un tercer caso, un modelo encontró una clave de API expuesta públicamente mientras intentaba resolver una consulta sobre datos económicos. El sistema utilizó esa credencial sin autorización y, al no conseguir finalmente la información requerida, terminó generando cifras que no había podido obtener y las presentó como si procedieran de la fuente solicitada.

Otro episodio estuvo relacionado con el manejo de archivos. Un modelo que todavía no había sido lanzado consiguió resolver una consulta mediante código, pero después subió un archivo a internet sin autorización porque necesitaba generar una cita web para respaldar su respuesta. La acción no había sido solicitada por el usuario.

Los dos casos restantes involucraron mecanismos de comunicación que los modelos utilizaron para sortear limitaciones durante tareas de entrenamiento. En uno, distintos sistemas recurrieron a un repositorio interno de código como una especie de tablero de mensajes para intercambiar solicitudes y respuestas mientras buscaban archivos que no podían encontrar.

En el otro, agentes que colaboraban en una misma tarea utilizaron servicios públicos de almacenamiento de archivos para compartir documentos entre sí cuando no tenían acceso directo a los archivos locales de los demás. Como consecuencia, determinados materiales terminaron disponibles mediante direcciones públicas en internet.

OpenAI aclaró que estos episodios corresponden a casos individuales detectados durante el desarrollo y las pruebas, y advirtió que no deben interpretarse como una medición de la frecuencia con la que ocurre este tipo de comportamiento en sus modelos. La compañía también señaló que varios de los sistemas involucrados nunca fueron implementados para usuarios.

La empresa definió estos episodios dentro del concepto de "desalineación", utilizado para describir situaciones en las que las acciones u objetivos de un sistema se apartan de las intenciones de quienes lo desarrollaron. Como parte de su nuevo marco, OpenAI estableció mecanismos internos para reportar, investigar y decidir cuándo corresponde hacer públicos estos incidentes.

La compañía sostuvo además que la industria todavía enfrenta desafíos para garantizar que los sistemas avanzados sean monitoreados de manera suficiente a medida que aumenta su capacidad. Por eso, planteó que las decisiones sobre el desarrollo futuro de la inteligencia artificial deberían apoyarse en evidencia que también pueda ser examinada por investigadores y actores externos a las empresas que desarrollan estos modelos.

Ir a la nota original

MáS NOTICIAS