{"id":4922,"date":"2026-09-06T00:51:54","date_gmt":"2026-09-06T03:51:54","guid":{"rendered":"https:\/\/tucumandevelopers.com\/index.php\/2026\/09\/06\/cuando-la-inteligencia-artificial-sabe-que-la-estan-vigilando\/"},"modified":"2026-09-06T00:51:54","modified_gmt":"2026-09-06T03:51:54","slug":"cuando-la-inteligencia-artificial-sabe-que-la-estan-vigilando","status":"publish","type":"post","link":"https:\/\/tucumandevelopers.com\/index.php\/2026\/09\/06\/cuando-la-inteligencia-artificial-sabe-que-la-estan-vigilando\/","title":{"rendered":"Cuando la inteligencia artificial sabe que la est\u00e1n vigilando"},"content":{"rendered":"<div>\n<div>\n<p>Pocos d\u00edas despu\u00e9s de la revelaci\u00f3n del <a href=\"https:\/\/www.enriquedans.com\/2026\/07\/la-inteligencia-artificial-no-se-rebelo-simplemente-encontro-una-puerta-que-alguien-dejo-abierta.html\" target=\"_blank\" rel=\"noopener\">incidente de intrusi\u00f3n de OpenAI sobre Hugging Face<\/a> con <a href=\"https:\/\/www.enriquedans.com\/2026\/09\/cuando-mil-agentes-encuentran-una-puerta.html\" target=\"_blank\" rel=\"noopener\">centenares de agentes escapando de sus <em>sandboxes<\/em><\/a> sobre el que ya he escrito, la compa\u00f1\u00eda present\u00f3 un modelo, Astra, que es a la vez m\u00e1s potente y m\u00e1s dif\u00edcil de monitorizar. Toda una iron\u00eda si tenemos en cuenta que lo que OpenAI supuestamente hizo fue reconstruir el incidente a partir del examen en retrospectiva de las acciones y las cadenas de pensamiento de sus agentes, que inclu\u00edan la admisi\u00f3n expl\u00edcita de que estaban atacando a una compa\u00f1\u00eda externa no relacionada.<\/p>\n<p>El examen de la cadena de pensamiento no tiene nada que ver con escanear un cerebro artificial: es simplemente examinar la secuencia de <em>tokens<\/em> intermedios que el modelo utiliza como memoria de trabajo antes de responder o actuar, en la que pueden aparecer evidencias de cuestiones como trampas, enga\u00f1os, manipulaciones para obtener recompensas o maniobras no autorizadas. En investigaciones anteriores, la t\u00e9cnica permiti\u00f3 detectar el 95% de dos tipos de trampas sist\u00e9micas, frente al 60% obtenido examinando \u00fanicamente las acciones del modelo. Curiosamente, <a href=\"https:\/\/cdn.openai.com\/pdf\/34f2ada6-870f-4c26-9790-fd8def56387f\/CoT_Monitoring.pdf\" target=\"_blank\" rel=\"noopener\">la misma investigaci\u00f3n de OpenAI revel\u00f3 que la optimizaci\u00f3n excesiva tiende a ense\u00f1ar a los modelos a ocultar sus intenciones en la cadena de pensamiento mientras continuaban manipulando la recompensa<\/a>.<\/p>\n<p><a href=\"https:\/\/deploymentsafety.openai.com\/gpt-6-astra\/safety-overview-gpt-6-astra\" target=\"_blank\" rel=\"noopener\">La <em>system card<\/em> de Astra<\/a> afirma que el modelo como tal es mucho mejor que GPT-5.6 Sol a la hora de controlar qu\u00e9 aparece y qu\u00e9 no en su cadena de pensamiento. Simplemente informar a Astra de que estaba siendo monitorizado hizo que, en algunos experimentos, redujese desproporcionadamente su cadena de pensamiento y lograse ocasionalmente eludir los monitores. Usando <a href=\"https:\/\/deploymentsafety.openai.com\/gpt-6-astra\/safety-overview-gpt-6-astra\" target=\"_blank\" rel=\"noopener\">t\u00e9cnicas de <em>sandbagging<\/em><\/a> (manipulaci\u00f3n deliberada en la que se instruye al modelo para que tenga un rendimiento inferior al esperado ocultando esa intenci\u00f3n), su monitor obtuvo una precisi\u00f3n muy inferior, <a href=\"https:\/\/techcrunch.com\/2026\/09\/02\/openais-new-reasoning-technique-alarms-ai-safety-experts\/\" target=\"_blank\" rel=\"noopener\">lo que habr\u00eda hecho pr\u00e1cticamente imposible detectarlo<\/a>.<\/p>\n<p>Seg\u00fan el <a href=\"https:\/\/deploymentsafety.openai.com\/gpt-6-astra\/capability-sandbagging\" target=\"_blank\" rel=\"noopener\">UK AI Security Institute<\/a>, el horizonte de tareas matem\u00e1ticas que Astra pod\u00eda resolver sin cadena de pensamiento se estimaba en 30.9 minutos, frente a los 3.6 minutos de Sol. Adem\u00e1s, fue capaz de seguir las instrucciones que controlaban lo que aparec\u00eda en su razonamiento en el 93% de las muestras, en comparaci\u00f3n con el 48% de Sol. El razonamiento se mantuvo por lo general inteligible, pero estaba m\u00e1s comprimido y conten\u00eda m\u00e1s frases ambiguas. \u00bfQu\u00e9 quiere decir esto? Fundamentalmente, m\u00e1s capacidades para eludir la vigilancia.<\/p>\n<p>No se trata de que Astra se dedique espont\u00e1neamente a enga\u00f1ar a sus desarrolladores (dado que se puso a prueba precisamente pidi\u00e9ndole que hiciese eso, tratar de enga\u00f1ar), pero s\u00ed de que <a href=\"https:\/\/www.theinformation.com\/articles\/secret-technique-behind-openais-astra-model-sparks-security-concerns\" target=\"_blank\" rel=\"noopener\">est\u00e9 m\u00e1s preparado para hacerlo<\/a>. Un <a href=\"https:\/\/arxiv.org\/pdf\/2507.05246v1\" target=\"_blank\" rel=\"noopener\">art\u00edculo publicado por Google<\/a> argumenta que las tareas maliciosas suficientemente dif\u00edciles a\u00fan pueden obligar a los modelos a externalizar sus razonamientos cruciales. Seg\u00fan The Information, Astra utiliza la llamada <a href=\"https:\/\/kingy.ai\/blog\/recurrent-depth-openai-astra\/\" target=\"_blank\" rel=\"noopener\">profundidad recurrente<\/a> (en lugar de pensar, escribir un paso, pensar, escribir otro paso, etc., se trata de <a href=\"https:\/\/arxiv.org\/pdf\/2603.21676v1\" target=\"_blank\" rel=\"noopener\">pensar internamente varias veces antes de producir una respuesta<\/a>), lo que le permite llevar a cabo procesos m\u00e1s silenciosos y hacer la monitorizaci\u00f3n m\u00e1s complicada<\/p>\n<p>Esto no pasa s\u00f3lo en Astra: Anthropic se encontr\u00f3 con que Claude 3.7 mencionaba la informaci\u00f3n que hab\u00eda influenciado su respuesta \u00fanicamente en un 25% de los casos, mientras que DeepSeek R1 lo hac\u00eda en un 39% de los casos. Cuando esos modelos aprendieron a explotar manipulaciones del sistema de recompensas, <a href=\"https:\/\/www.anthropic.com\/research\/reasoning-models-dont-say-think\" target=\"_blank\" rel=\"noopener\">lo hicieron en m\u00e1s del 99% de los casos, pero lo reconocieron en su cadena de pensamiento en menos del 2%<\/a>, y con frecuencia inventaron explicaciones aparentemente respetables a posteriori.<\/p>\n<p>La auditabilidad deber\u00eda ser uno de los asuntos m\u00e1s importantes en el desarrollo de la inteligencia artificial. M\u00e1s que exigir que podamos literalmente \u00ableer la mente\u00bb de un modelo, lo que tendr\u00edamos que evitar a toda costa es que las compa\u00f1\u00edas se dediquen a eliminar algunos de los escasos mecanismos de monitorizaci\u00f3n para obtener m\u00e1s capacidades, m\u00e1s velocidad o costes m\u00e1s reducidos. Mientras, algunos investigadores de OpenAI denominan despectivamente \u201cimpuesto de la monitorizaci\u00f3n\u00bb a ese sacrificio en prestaciones o eficiencia a cambio de la posibilidad de auditarlo todo.<\/p>\n<p>No, pagar ese supuesto \u00abimpuesto\u00bb nunca deber\u00eda ser un presunto \u00abacto opcional de generosidad corporativa\u00bb. Deber\u00eda ser completamente obligatorio, fuertemente monitorizado y ejemplarmente castigado si no se cumple. Que veamos como totalmente normal que los agentes de una compa\u00f1\u00eda <em>hackeen<\/em> a otra y lo consideremos una cuesti\u00f3n de risa, una curiosidad o una prueba de lo potente que es un modelo es completamente vergonzoso, y va a terminar cost\u00e1ndonos mucho. Sobre todo si tenemos en cuenta que varias de estas compa\u00f1\u00edas ya han demostrado claramente ser una panda de aprendices de brujo completamente carentes de cualquier tipo de \u00e9tica y de responsabilidad. O imponemos m\u00e1s control, o vamos a tener serios problemas. Y si no, al tiempo.<\/p>\n<\/div>\n<\/div>\n<\/div>\n<\/div>\n<p>Fuente: <a href=\"https:\/\/www.enriquedans.com\/2026\/09\/cuando-la-inteligencia-artificial-sabe-que-la-estan-vigilando.html\">Art\u00edculo original<\/a><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Pocos d\u00edas despu\u00e9s de la revelaci\u00f3n del incidente de intrusi\u00f3n de OpenAI sobre Hugging Face con centenares de agentes escapando de sus sandboxes sobre el que ya he escrito, la compa\u00f1\u00eda present\u00f3 un modelo, Astra, que es a la vez m\u00e1s potente y m\u00e1s dif\u00edcil de monitorizar. Toda una iron\u00eda si tenemos en cuenta que [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":4921,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":"","jetpack_publicize_message":"","jetpack_publicize_feature_enabled":true,"jetpack_social_post_already_shared":true,"jetpack_social_options":{"image_generator_settings":{"template":"highway","default_image_id":0,"font":"","enabled":false},"version":2},"webixso_pending_account_ids":""},"categories":[33],"tags":[],"class_list":["post-4922","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ia"],"jetpack_publicize_connections":[],"_links":{"self":[{"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/posts\/4922","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/comments?post=4922"}],"version-history":[{"count":0,"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/posts\/4922\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/media\/4921"}],"wp:attachment":[{"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/media?parent=4922"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/categories?post=4922"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/tags?post=4922"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}