tecnologia

Google desata una revolución en ia: adiós a la crisis de ram

La carrera armamentística por la inteligencia artificial ha llegado a un punto crítico, amenazando con agotar las reservas globales de memoria RAM. Una situación que ha sido apodada, no sin un toque de dramatismo, como 'RAMmageddon'. Pero Google, fiel a su estilo, podría tener la solución: TurboQuant, una Tecnología que promete cambiar las reglas del juego.

El cuello de botella que asfixia el desarrollo de la ia

El problema es claro: el entrenamiento de modelos de lenguaje gigantes como Gemini exige una cantidad ingente de memoria RAM, disparando los precios y dificultando el acceso a esta Tecnología. Esta voraz demanda se traslada al consumidor final, encareciendo componentes de ordenadores y consolas. La raíz del problema, según expertos, reside en los cuellos de botella inherentes a la memoria interna, limitando la eficiencia del proceso.

Ahora, la propuesta de Google, liderada por Sundar Pichai, no solo busca aliviar esta sobrecarga, sino romper una barrera técnica que ha frustrado a la industria. El impacto se extiende hasta la App Store, donde la saturación en la revisión de aplicaciones es otra consecuencia de la explosión de la IA.

Turboquant: ¿el arma secreta de google?

Turboquant: ¿el arma secreta de google?

Mientras OpenAI con ChatGPT y Microsoft con Copilot invierten en sus propias investigaciones, Google parece haber dado con la clave. El punto débil, hasta ahora, ha sido el llamado 'caché clave-valor', una especie de 'hoja de trucos digital' que optimiza el funcionamiento de los modelos al evitar cálculos repetidos. Este sistema, cada vez más complejo, exige una presión constante sobre la memoria, y su crecimiento lineal se convierte en un problema de escalabilidad y coste.

Pero TurboQuant, anunciado oficialmente por Google, redefine la eficiencia de la IA mediante una técnica de compresión extrema. Se trata de la cuantificación, un proceso que reduce la precisión numérica sin sacrificar la calidad. El sistema se divide en dos fases: PolarQuant, que transforma los vectores cartesianos para eliminar redundancias, y Quantized Johnson-Lindenstrauss (QJL), que reduce cada elemento a un bit positivo o negativo, 'eliminando errores ocultos'. A diferencia de otras soluciones de cuantificación que degradan el rendimiento, TurboQuant mantiene la precisión en cargas de trabajo exigentes, reduciendo el uso de memoria para el caché clave-valor hasta en un 60%.

Los cálculos de atención se ejecutan hasta ocho veces más rápido con operaciones de 32 bits, y la cuantificación se logra con tan solo tres bits, sin necesidad de reentrenar los modelos. El resultado es una creación que ofrece ventajas en energía, tiempo, compatibilidad y recursos, una inyección de aire fresco para la crisis de la memoria RAM.

Si TurboQuant se implementa ampliamente, la necesidad de módulos físicos masivos podría desaparecer. La optimización del software es una buena noticia para la escasez de chips, y marcaría un punto de inflexión en la industria. Aunque todavía quedan pruebas por delante, los resultados controlados sugieren que una vez confirmados los beneficios en condiciones reales, el cambio será irreversible. Mientras tanto, Microsoft explora alternativas audaces, como el uso de placas de vidrio para almacenar información durante milenios – una apuesta por la longevidad que refleja la magnitud de los desafíos que plantea el futuro de la IA.