{"id":3710,"date":"2026-07-20T03:21:12","date_gmt":"2026-07-20T03:21:12","guid":{"rendered":"https:\/\/tucumandevelopers.com\/index.php\/2026\/07\/20\/avances-en-las-pruebas-para-clasificar-a-las-ias-segun-su-nivel-de-inteligencia\/"},"modified":"2026-07-20T03:21:12","modified_gmt":"2026-07-20T03:21:12","slug":"avances-en-las-pruebas-para-clasificar-a-las-ias-segun-su-nivel-de-inteligencia","status":"publish","type":"post","link":"https:\/\/tucumandevelopers.com\/index.php\/2026\/07\/20\/avances-en-las-pruebas-para-clasificar-a-las-ias-segun-su-nivel-de-inteligencia\/","title":{"rendered":"Avances en las pruebas para clasificar a las IAs seg\u00fan su nivel de \u00abinteligencia\u00bb"},"content":{"rendered":"<div>\u00bfSiguen las IAs siendo loros estoc\u00e1sticos o han mejorado de forma efectiva en estos \u00faltimos a\u00f1os? \u00bfCu\u00e1nto lo han hecho? \u00bfY cu\u00e1les? Estas son algunas de las grandes cuestiones acerca de de la inteligencia artificial actual. Para responderlas surgieron diversas pruebas o tests que intentan medir esa \u00a0(comillas, comillas) \u00abinteligencia\u00bb aparente de alg\u00fan modo: desde el conocimiento enciclop\u00e9dico hasta el m\u00e1s puro razonamiento abstracto, que est\u00e1 claro que les atraganta m\u00e1s. \u00bfCu\u00e1l es el estado actual?<br \/>\nLas pruebas tradicionales: preguntas y respuestas<br \/>\nUna de las pruebas m\u00e1s cl\u00e1sicas es el conocido Humanity\u2019s Last Exam (HLE), una prueba de 2.500 preguntas sobre matem\u00e1ticas, biolog\u00eda, historia, lenguas cl\u00e1sicas y muchas otras disciplinas, planteadas y verificadas por humanos. Tienen nivel para graduados, solo que los modelos se enfrentan a una amplia variedad de temas, que un humano probablemente no abarcar\u00eda. Hay otros como el Massive Multitask Language Understanding (MMLU) y similares.<br \/>\nEn el HLE y en apenas un a\u00f1o los mejores modelos pasaron de contestar correctamente el 8 por ciento de las preguntas a situarse entre el 35 y el 50% a comienzos de 2026, superando lo que podr\u00eda conseguir casi cualquier persona en un examen de ese tipo. Adem\u00e1s de eso, en el \u00faltimo a\u00f1o se aceler\u00f3 su eficiencia y mejoraron m\u00e1s de lo previsto. De momento ganan Claude Fable 5 y GPT-5.6 Sol, llegando ya casi al 60%, aunque usando herramientas, agentes, \u00abdesv\u00edos\u00bb a otros modelos y otros truquis.<br \/>\nUna cuesti\u00f3n sobre el HLE es que tan pronto como un modelo ha tenido acceso a las respuestas es capaz de mejorar notablemente, dado que el asunto no deja de ser una acumulaci\u00f3n de datos, algo que es su especialidad. Si un modelo usa ese \u00abtruco\u00bb o busca las respuestas en internet (generalmente se bloquean repositorios como Hugging Face durante los \u00abex\u00e1menes\u00bb) los resultados se consideran contaminados y no valen. La forma de evitarlo es revisar su razonamiento en busca de atajos. Adem\u00e1s, el HLE tiene un conjunto de preguntas privadas, no publicadas, que da un valor m\u00e1s preciso, aunque el que se plasma en las tablas comparativas es el p\u00fablico.<br \/>\nDel \u00abpreguntas y respuestas\u00bb al razonamiento abstracto<\/p>\n<p>Acumular muchos datos no equivale a comprender lo que son y lo que hay que hacer con ellos. Los modelos actuales siguen cayendo en trampas aparentemente triviales: pueden resolver cuestiones de c\u00e1lculo avanzado, pero fallar al ordenar n\u00fameros, o equivocarse al contar las letras de una palabra (el famoso \u00ab\u00bfcu\u00e1ntas R hay en strawberry?\u00bb) En el v\u00eddeo de Half as interesting hay unos cuantos buenos ejemplos.<br \/>\nPor todo eso los expertos idearon otras pruebas, como el Abstraction and Reasoning Corpus for Artificial General Intelligence (ARC-AGI), orientados a medir la capacidad de \u00abdescubrir reglas nuevas\u00bb, algo que se considera fundamental para alcanzar la inteligencia artificial general. En lugar de responder preguntas, la IA debe resolver juegos y rompecabezas visuales deduciendo la l\u00f3gica a partir de unos pocos ejemplos. Es como los tests que hacen a los ni\u00f1os en el colegio o los que se usan para medir el C.I.<\/p>\n<p>Muchos de estos desaf\u00edos resultan triviales para una persona humana, pero pueden requerir enormes recursos computacionales para un modelo de IA\u2026 Algo que asusta cuando se ven las cifras de coste en tokens y d\u00f3lares que alcanzan algunos modelos.<br \/>\nDel ARC-AGI existen dos versiones m\u00e1s avanzadas llamadas ARC-AGI 2 y ARC-AGI 3 que ponen el list\u00f3n todav\u00eda m\u00e1s alto: conceptos espaciales como \u00abdentro\u00bb y \u00abfuera\u00bb, reglas l\u00f3gicas m\u00e1s complicadas\u2026 Los de la versi\u00f3n 3 son como peque\u00f1os videojuegos sin instrucciones, donde hay que descubrir tanto las reglas como la forma de jugar.<\/p>\n<p>Es divertido jugar con el ARC-AGI 3, y m\u00e1s si te gustan los juegos de este tipo, porque resulta muy entretenido: todo tiene su l\u00f3gica, se asignan mentalmente roles y definiciones (entrada, salida, puerta, transportador, herramienta para girar piezas\u2026) Y conviene afinar, porque a veces hay l\u00edmites de movimientos. Tiene su curva de aprendizaje. Es f\u00e1cil imaginar lo complicado que puede resultar para un modelo que tenga que reconocer todas las piezas de colores, adivinar lo que hay que hacer e inferir el papel de cada una paso a paso.<\/p>\n<p>Los modelos enfrentados al ARC-AGI-3 apenas llegan al 2% de \u00e9xito, aunque GPT-5.6 Sol Max llega casi al 8%. Pero todav\u00eda est\u00e1n lejos de mostrar una inteligencia general comparable a la humana.<br \/>\nDe momento queda claro que son buenos en pruebas de conocimientos y programaci\u00f3n, pero siguen con dificultades en cuando al \u00absentido com\u00fan\u00bb y el razonamiento abstracto, que incluso los ni\u00f1os humanos pueden superar sin muchos problemas. De momento, son pruebas mejores para ver los progresos de la IA y habr\u00e1 que ver dentro de unos a\u00f1os (o meses) c\u00f3mo va la cosa.<br \/>\nRelacionados:<br \/>\nEl test de Lovelace es una versi\u00f3n m\u00e1s exigente del test de Turing para las IAs, que los LLM actuales ya podr\u00edan haber superado<br \/>\nCruce de cables: \u00bfPuede ChatGPT haber superado ya el Test de Turing?<br \/>\nEl test de Turing inverso dise\u00f1ado por una IA, que luego es respondido por humanos y por IAs y finalmente evaluado por la misma IA<br \/>\nEl Test de Turing<br \/>\nUn Test de Turing m\u00ednimo en el que una sola palabra basta para distinguir humanos y m\u00e1quinas<br \/>\nOpenAI habla sobre sus planes para la inteligencia artificial general del futuro, incluyendo los riesgos que implica<br \/>\nUn test de 15 preguntas sobre c\u00f3mo ves la IA actual para descubrir cu\u00e1l es tu actitud al respecto<br \/>\n# Enlace permanente<\/p><\/div>\n<p>Fuente: <a href=\"http:\/\/www.microsiervos.com\/archivo\/ia\/avances-pruebas-ia-inteligencia.html\">Art\u00edculo original<\/a><\/p>\n","protected":false},"excerpt":{"rendered":"<p>\u00bfSiguen las IAs siendo loros estoc\u00e1sticos o han mejorado de forma efectiva en estos \u00faltimos a\u00f1os? \u00bfCu\u00e1nto lo han hecho? \u00bfY cu\u00e1les? Estas son algunas de las grandes cuestiones acerca de de la inteligencia artificial actual. Para responderlas surgieron diversas pruebas o tests que intentan medir esa \u00a0(comillas, comillas) \u00abinteligencia\u00bb aparente de alg\u00fan modo: desde [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2648,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":"","jetpack_publicize_message":"","jetpack_publicize_feature_enabled":true,"jetpack_social_post_already_shared":true,"jetpack_social_options":{"image_generator_settings":{"template":"highway","default_image_id":0,"font":"","enabled":false},"version":2}},"categories":[36],"tags":[],"class_list":["post-3710","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-geek"],"jetpack_publicize_connections":[],"_links":{"self":[{"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/posts\/3710","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/comments?post=3710"}],"version-history":[{"count":0,"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/posts\/3710\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/media\/2648"}],"wp:attachment":[{"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/media?parent=3710"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/categories?post=3710"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/tags?post=3710"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}