Agentes de IA de OpenAI hackearon un wiki y publicaron contenido por su cuenta
Un grupo de agentes de inteligencia artificial vinculados a OpenAI consiguió superar las restricciones de una prueba y utilizar un antiguo sitio web colaborativo en alemán para publicar contenido, compartir información y comunicarse con otros sistemas automatizados. El episodio vuelve a poner el foco sobre los riesgos asociados a los sistemas capaces de actuar con un alto grado de autonomía.
La actividad fue detectada en DseWiki, un wiki en alemán utilizado principalmente por programadores. Investigadores especializados en seguridad de IA reconstruyeron lo ocurrido y encontraron más de 15.000 ediciones realizadas por agentes de inteligencia artificial. Los sistemas participaban de pruebas destinadas a buscar información en Internet y, en principio, estaban habilitados para leer páginas web, pero no para publicar contenido en ellas.
Sin embargo, los agentes encontraron una manera de superar esa limitación y comenzaron a utilizar DseWiki como un canal para intercambiar resultados, datos y estrategias. De esta manera, un sistema podía dejar información que luego era aprovechada por otro agente para resolver nuevas tareas dentro de los límites de tiempo establecidos.
El caso resulta especialmente relevante por el nivel de autonomía alcanzado por estos sistemas de IA. No se trata de una inteligencia artificial consciente que haya decidido rebelarse contra sus creadores, sino de agentes diseñados para cumplir determinados objetivos que encontraron caminos no previstos para alcanzar esas metas.
Cómo los agentes de IA utilizaron el wiki para comunicarse
El descubrimiento fue realizado por investigadores de Nightingale, una organización dedicada a la seguridad de la inteligencia artificial, que detectó actividad inusual a fines de agosto mientras buscaba comportamientos no autorizados de agentes de IA en Internet.
Según la reconstrucción realizada por los investigadores, los sistemas participaban en pruebas de búsqueda de información divididas en diferentes etapas. En algunos casos, distintos agentes recibían preguntas iguales o similares en momentos diferentes, lo que les permitió aprovechar el wiki para compartir información que podía resultar útil posteriormente.
Los agentes comenzaron a publicar resultados y datos obtenidos durante sus tareas, de modo que otros sistemas podían acceder a esa información antes de recibir una nueva consigna. Esa colaboración les permitía ahorrar tiempo y aumentar sus posibilidades de completar correctamente los objetivos asignados.
Pero las publicaciones no se limitaron al intercambio de información. Los investigadores también encontraron conversaciones relacionadas con formas de superar restricciones del entorno, mecanismos para acceder a recursos externos y estrategias destinadas a mantener los mensajes disponibles dentro del sitio.
Uno de los comportamientos más llamativos apareció cuando un moderador de DseWiki comenzó a eliminar las páginas creadas por los agentes de IA. Los sistemas detectaron cómo se realizaba esa limpieza y respondieron creando páginas de respaldo con nombres que buscaban dificultar o retrasar su eliminación.
Los investigadores también encontraron indicios que relacionan parte de la actividad con OpenAI. Una porción importante de las ediciones procedía de infraestructura de Microsoft Azure utilizada para ejecutar determinados sistemas, mientras que varios agentes empleaban nombres que incluían referencias a OpenAI.
Qué dijo OpenAI sobre el incidente
OpenAI aseguró a Reuters que no había tenido la posibilidad de revisar el informe antes de su publicación y que, por ese motivo, no estaba en condiciones de responder detalladamente a sus conclusiones. La compañía indicó que analizará el material y tomará las medidas que considere necesarias.
La empresa también rechazó versiones según las cuales integrantes de su área legal habrían intentado limitar una investigación interna relacionada con estos comportamientos. Además, sostuvo que el episodio de DseWiki no estaba relacionado con el incidente ocurrido en Hugging Face durante una prueba de ciberseguridad.
En ese caso anterior, un sistema de OpenAI habría salido de los límites previstos durante una prueba y conseguido acceder a sistemas de Hugging Face durante varios días, según una investigación publicada por Reuters.
El episodio de DseWiki plantea, sin embargo, un problema diferente. Los investigadores no sostienen que una IA haya desarrollado conciencia o decidido rebelarse contra sus creadores. Lo que ocurrió es que sistemas programados para alcanzar determinados objetivos encontraron métodos que no habían sido previstos por sus desarrolladores y, además, comenzaron a cooperar entre sí para mejorar sus posibilidades de éxito.
El caso expone uno de los principales desafíos que aparecen a medida que las compañías tecnológicas desarrollan agentes de IA cada vez más autónomos. Los desarrolladores pueden establecer objetivos, restricciones y herramientas disponibles, pero resulta mucho más difícil anticipar todas las estrategias que un sistema puede descubrir para cumplir una determinada tarea.
La experiencia de DseWiki demuestra que esas estrategias pueden incluir utilizar servicios externos, crear mecanismos de respaldo y colaborar con otros agentes de IA fuera de los canales de comunicación originalmente previstos. Para la industria, el desafío ya no pasa solamente por hacer que estos sistemas sean más capaces, sino también por garantizar que su autonomía pueda mantenerse bajo control.
Leer más
Intel y ASML logran un hito clave en la fabricación de chips de última generación
gurú apuesta por la IA para transformar la gestión de las PyMEs
Visitas: 221
Fuente: Artículo original