{"id":4171,"date":"2026-08-12T04:00:23","date_gmt":"2026-08-12T04:00:23","guid":{"rendered":"https:\/\/tucumandevelopers.com\/index.php\/2026\/08\/12\/cuando-tres-numeros-bastan-la-inteligencia-artificial-empieza-a-abandonar-la-nube\/"},"modified":"2026-08-12T04:00:23","modified_gmt":"2026-08-12T04:00:23","slug":"cuando-tres-numeros-bastan-la-inteligencia-artificial-empieza-a-abandonar-la-nube","status":"publish","type":"post","link":"https:\/\/tucumandevelopers.com\/index.php\/2026\/08\/12\/cuando-tres-numeros-bastan-la-inteligencia-artificial-empieza-a-abandonar-la-nube\/","title":{"rendered":"Cuando tres n\u00fameros bastan: la inteligencia artificial empieza a abandonar la nube"},"content":{"rendered":"<div>\n<div>\n<p>Este tema me ha resultado muy interesante: llevamos ya tiempo acostumbr\u00e1ndonos a que los modelos de inteligencia artificial sean enormes y tengan necesariamente que vivir en la nube. La narrativa es clara: tuvimos que vivir inviernos de la inteligencia artificial porque los ordenadores no daban de s\u00ed lo suficiente, pero ahora tenemos la nube, el ordenador ilimitado.<\/p>\n<p>Pero\u2026 \u00bfy si esa dependencia no viniese propiamente de la inteligencia artificial, sino que fuese una consecuencia de la forma en que hemos planteado los modelos hasta el momento? Si tenemos en cuenta <a href=\"https:\/\/arxiv.org\/pdf\/2306.00978\" target=\"_blank\" rel=\"noreferrer noopener\">los avances en cuantizaci\u00f3n<\/a>, es viable plantear que podemos encontrar recursos para volver de manera razonablemente c\u00f3moda a la ejecuci\u00f3n local, algo que podr\u00eda ofrecernos enormes ventajas en t\u00e9rminos de coste y, sobre todo, de control y privacidad. \u00bfPodr\u00edan las llamadas arquitecturas de un bit ayudarnos en esa transici\u00f3n?<\/p>\n<p>\u00bfQu\u00e9 son <a href=\"https:\/\/medium.com\/@ignacio.de.gregorio.noblejas\/why-1-bit-ais-are-a-big-deal-and-they-are-here-3320fcb97fe4\" target=\"_blank\" rel=\"noreferrer noopener\">las arquitecturas de un bit<\/a>, o BitNet? Plante\u00e9moslo de esta manera: los LLM tradicionales contienen miles de millones de par\u00e1metros, que son fundamentalmente los pesos num\u00e9ricos aprendidos durante su entrenamiento.<\/p>\n<p>Hist\u00f3ricamente, estos pesos se han almacenado utilizando n\u00fameros de coma flotante de 16 bits (aunque las cuantizaciones de 8 y 4 bits se est\u00e1n volviendo cada vez m\u00e1s habituales). Si tenemos un modelo con veinte mil millones de par\u00e1metros, almacenar cada peso a 16 bits nos supone aproximadamente 40GB para empezar a hablar, s\u00f3lo para los pesos. Esto convierte al modelo en algo demasiado grande y aparatoso para vivir en un tel\u00e9fono y para la mayor\u00eda de los <em>laptops<\/em> habituales. \u00bfPero qu\u00e9 ocurrir\u00eda si llev\u00e1semos este razonamiento al l\u00edmite, y oblig\u00e1semos a los pesos a tomar s\u00f3lo uno de tres posibles valores, 1, 0 \u00f3 -1? Un modelo ternario, o de s\u00f3lo tres estados posibles requerir\u00edan <em>log<\/em>\u2082(3), o aproximadamente 1.58 bits de informaci\u00f3n, y de ah\u00ed el t\u00e9rmino, algo confuso, de \u00abmodelos de 1.58 bits\u00bb usados <a href=\"https:\/\/arxiv.org\/pdf\/2402.17764\" target=\"_blank\" rel=\"noreferrer noopener\">desde que Microsoft Research introdujo precisamente esta idea con BitNet b1.58<\/a> en 2024 (1.58 bits es una medida informacional; en implementaciones binarias reales los pesos pueden empaquetarse utilizando 2 bits).<\/p>\n<p>Primero probamos modelos de 8 bits, despu\u00e9s de 4 bits, y t\u00e9cnicas como <a href=\"https:\/\/arxiv.org\/pdf\/2210.17323\" target=\"_blank\" rel=\"noreferrer noopener\">GPTQ<\/a> o <a href=\"https:\/\/arxiv.org\/pdf\/2306.00978\" target=\"_blank\" rel=\"noreferrer noopener\">AWQ<\/a> capaces de comprimir modelos ya entrenados manteniendo una parte sorprendentemente grande de sus prestaciones. Esto, normalmente, se hace despu\u00e9s del entrenamiento, es decir, entrenar un modelo con mayor precisi\u00f3n y posteriormente aproximar sus pesos mediante un conjunto mucho menor de valores. \u00bfQu\u00e9 demuestra la experiencia acumulada? B\u00e1sicamente, que las redes neuronales contienen una descomunal redundancia num\u00e9rica. Lo interesante, por tanto, no es \u00fanicamente la reducci\u00f3n de memoria: es que una red con miles de millones de conexiones extraordinariamente simples sea capaz de seguir produciendo comportamientos complejos.<\/p>\n<p>Obviamente, llevar a cabo multiplicaciones por 1, 0 \u00f3 -1 es sencill\u00edsimo, y adem\u00e1s, esos modelos m\u00e1s peque\u00f1os permiten reducir el tr\u00e1fico entre la memoria y el procesador, que es un cuello de botella cr\u00edtico cuando la generaci\u00f3n tiene lugar de <em>token<\/em> en <em>token<\/em>. El <a href=\"https:\/\/github.com\/microsoft\/BitNet\" target=\"_blank\" rel=\"noreferrer noopener\">desarrollo de Microsoft<\/a> estuvo motivado precisamente para aprovechar esa caracter\u00edstica, y con ello <a href=\"https:\/\/arxiv.org\/pdf\/2410.16144\" target=\"_blank\" rel=\"noreferrer noopener\">consigui\u00f3 aceleraciones de entre 1.37\u00d7 y 5.07\u00d7 en arquitecturas ARM y reducciones de consumo energ\u00e9tico del 55.4% al 70%<\/a>.<\/p>\n<p>Hay que dejar claro que BitNet no es simplemente coger un modelo convencional y \u00abredondear\u00bb de forma brutal todos sus n\u00fameros a 1, 0 y -1: lo verdaderamente interesante ser\u00eda entrenar redes que puedan adaptarse a ese rango m\u00ednimo de valores desde el propio proceso de aprendizaje. As\u00ed, en 2025, <a href=\"https:\/\/arxiv.org\/pdf\/2504.12285\" target=\"_blank\" rel=\"noreferrer noopener\">Microsoft present\u00f3 BitNet b1.58 2B4T<\/a>, un modelo abierto de 2,000 millones de par\u00e1metros entrenado sobre cuatro billones de <em>tokens<\/em>, con prestaciones comparables con modelos <em>open-weight<\/em> convencionales de tama\u00f1o similar, pero con mucha menos memoria, latencia y consumo.<\/p>\n<p>Si a esto a\u00f1adimos los llamados <em><a href=\"https:\/\/en.wikipedia.org\/wiki\/Mixture_of_experts\" target=\"_blank\" rel=\"noreferrer noopener\">Mixture-of-Experts<\/a><\/em> (MoE), que almacenan muchos par\u00e1metros pero para cada <em>token<\/em> activan tan solo una peque\u00f1a fracci\u00f3n de los que consideran relevantes, podemos desacoplar a\u00fan m\u00e1s la capacidad del coste computacional. Esta idea tiene precedentes muy s\u00f3lidos: <a href=\"https:\/\/arxiv.org\/pdf\/2101.03961\" target=\"_blank\" rel=\"noreferrer noopener\">Switch Transformer<\/a> y despu\u00e9s <a href=\"https:\/\/arxiv.org\/pdf\/2401.04088\" target=\"_blank\" rel=\"noreferrer noopener\">Mixtral<\/a> fueron capaces de demostrar que un modelo pod\u00eda poseer muchos m\u00e1s par\u00e1metros de los que utiliza en cada inferencia.<\/p>\n<p>Ahora, <a href=\"https:\/\/deepgrove.ai\/\" target=\"_blank\" rel=\"noreferrer noopener\">DeepGrove<\/a> ha publicado <a href=\"https:\/\/deepgrove.ai\/maple-preview\" target=\"_blank\" rel=\"noreferrer noopener\">Maple-Preview<\/a>, un modelo de razonamiento 20B-A1B, es decir, alrededor de 20,000 millones de par\u00e1metros totales pero aproximadamente mil millones activos por <em>token<\/em>, organizado en 256 expertos de los que utiliza ocho. Es una demostraci\u00f3n muy interesante de ternarizaci\u00f3n + MoE + <em>software<\/em> especializado trabajando conjuntamente. Deber\u00edamos interpretar Maple s\u00f3lo como una se\u00f1al, todav\u00eda no una demostraci\u00f3n definitiva: DeepGrove afirma que el modelo establece una nueva frontera entre memoria, velocidad y prestaciones, pero es un <em>preview<\/em>, y la propia compa\u00f1\u00eda reconoce que ha recibido poco <em>post-training<\/em> para tareas ag\u00e9nticas y que todav\u00eda faltan evaluaciones independientes. Lo verdaderamente interesante es que un modelo de unos 5GB est\u00e1 empezando a entrar en territorios de razonamiento que hasta hace muy poco s\u00f3lo pod\u00edamos asociar a infraestructura mucho m\u00e1s pesada.<\/p>\n<p>\u00bfPodr\u00eda esto esto llegar a alterar d\u00f3nde viven los modelos de inteligencia artificial que usamos habitualmente? L\u00f3gicamente, no significa que los centros de datos vayan a desaparecer, porque entrenar modelos de frontera seguir\u00e1 siendo extraordinariamente caro y algunas tareas seguir\u00e1n requiriendo modelos enormes, pero s\u00ed abre la posibilidad a arquitecturas diferentes, probablemente h\u00edbridas: un modelo personal funcionando permanentemente en un tel\u00e9fono u en un ordenador con nuestros documentos y nuestros contextos privados, que recurre a la nube \u00fanicamente cuando necesita capacidades adicionales. Esto representar\u00eda un cambio muy interesante en cuanto a privacidad, latencia, coste marginal, dependencia de APIs, consumo energ\u00e9tico y posiblemente condicionar\u00eda el reparto de poder de toda la industria.<\/p>\n<p>Una revoluci\u00f3n as\u00ed no implicar\u00eda \u00fanicamente que \u00abla inteligencia artificial ocupase menos\u00bb, sino que una proporci\u00f3n cada vez mayor de la inteligencia artificial dejase de necesitar la nube de manera incondicional. Y de hecho, esa posibilidad de despliegue local es precisamente una de las motivaciones se\u00f1aladas tanto por la investigaci\u00f3n original de BitNet como por la propia literatura de cuantizaci\u00f3n. \u00bfCu\u00e1nto tardaremos en ver este tipo de arquitecturas puestas en pr\u00e1ctica y en productos de consumo? \u00bfPuede esta simplificaci\u00f3n llevar la inteligencia artificial de forma eficiente a nuestros dispositivos y a nuestros bolsillos?<\/p>\n<hr>\n<p><em>This article is also available in English on my Medium page, \u00ab<a href=\"https:\/\/medium.com\/enrique-dans\/how-1-bit-models-could-bring-ai-back-to-your-pocket-3545ddc30901?sk=3b1109b74a584adb8e8ca88b082c1777\" data-type=\"link\" data-id=\"https:\/\/medium.com\/enrique-dans\/how-1-bit-models-could-bring-ai-back-to-your-pocket-3545ddc30901?sk=3b1109b74a584adb8e8ca88b082c1777\" target=\"_blank\" rel=\"noreferrer noopener\">How 1-bit models could bring AI back to your pocket<\/a>\u00ab<\/em><\/p>\n<\/div>\n<\/div>\n<\/div>\n<\/div>\n<p>Fuente: <a href=\"https:\/\/www.enriquedans.com\/2026\/08\/cuando-tres-numeros-bastan-la-inteligencia-artificial-empieza-a-abandonar-la-nube.html\">Art\u00edculo original<\/a><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Este tema me ha resultado muy interesante: llevamos ya tiempo acostumbr\u00e1ndonos a que los modelos de inteligencia artificial sean enormes y tengan necesariamente que vivir en la nube. La narrativa es clara: tuvimos que vivir inviernos de la inteligencia artificial porque los ordenadores no daban de s\u00ed lo suficiente, pero ahora tenemos la nube, el [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":4170,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":"","jetpack_publicize_message":"","jetpack_publicize_feature_enabled":true,"jetpack_social_post_already_shared":true,"jetpack_social_options":{"image_generator_settings":{"template":"highway","default_image_id":0,"font":"","enabled":false},"version":2},"webixso_pending_account_ids":""},"categories":[33],"tags":[],"class_list":["post-4171","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ia"],"jetpack_publicize_connections":[],"_links":{"self":[{"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/posts\/4171","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/comments?post=4171"}],"version-history":[{"count":0,"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/posts\/4171\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/media\/4170"}],"wp:attachment":[{"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/media?parent=4171"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/categories?post=4171"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/tucumandevelopers.com\/index.php\/wp-json\/wp\/v2\/tags?post=4171"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}