La 'rammageddon' del ai: google descubre la solución con turboquant
La competencia por desarrollar la inteligencia artificial (IA) más potente ha alcanzado un punto crítico con la escasez de componentes de memoria RAM en todo el mundo. Esta situación se conoce como 'RAMmageddon', ya que la alta demanda de centros de datos para entrenar modelos de lenguaje como Gemini supera la capacidad de suministro.

Google aplasta el cuello de botella con turboquant
En medio de esta crisis, Google parece haber encontrado la solución con su nuevo sistema llamado TurboQuant. Esta Tecnologíarevoluciona la eficiencia de la IA al reducir la precisión numérica de los cálculos sin sacrificar calidad. Según explica la empresa, su funcionamiento se basa en dos etapas: PolarQuant y Quantized Johnson-Lindenstrauss (QJL). PolarQuant transforma los vectores cartesianos en polares para evitar repetir normalizaciones, mientras que QJL reduce cada elemento a un bit (positivo o negativo) para eliminar errores ocultos.
Con TurboQuant, Google logra reducir el uso de memoria para el cache clave-valor por un factor de seis, mejorando significativamente el rendimiento. Los cálculos de atención se ejecutan hasta ocho veces más rápido que con procesos de 32 bits, y la cuantificación se puede realizar hasta con tres bits sin necesidad de reentrenar modelos. Esto otorga ventajas en energía, tiempo, compatibilidad y recursos, lo que podría cambiar radicalmente la forma en que se desarrolla la IA.
La optimización de software es una buena noticia para la escasez de chips, ya que se reduciría la necesidad de cantidades masivas de módulos físicos. Aunque aún falta confirmar los beneficios en condiciones reales, si se implementa ampliamente, podría marcar un antes y un después en la carrera por la IA.
