Si te suena a ciencia ficción eso de meter “núcleos de GPU” dentro de una memoria HBM, no te preocupes, es normal. Era, hasta ahora, un secreto que ha salido entre bambalinas y que viene de una colaboración entre NVIDIA, Samsung y SK Hynix, el cual ha explotado tan rápido que muchos creen que estamos hablando de memoria PIM como tal, otros de CUDA Cores escondidos en un die diminuto, y los más atrevidos, de una GPU “partida en trozos”. Nada de eso. El plan real es mucho más interesante y, sobre todo, mucho más estratégico para la guerra de la Inteligencia Artificial que estamos viviendo, porque NVIDIA apuesta por el llamado Compute Near Memory, y es realmente disruptivo.
Si el colapso del sector de la memoria no es suficiente, a partir del año que viene, como muy tarde en 2027, vamos a ser testigos de algo insólito hasta el momento: memoria creada en exclusiva para una compañía en concreto. Y como era de esperar, en el centro del diseño están NVIDIA, SK Hynix y Samsung.
El concepto no es sencillo de entender, pero vamos a intentar explicarlo, porque todavía quedan muchos flecos que conocer, solo han desvelado la idea en su versión más primitiva. Las compañías nombradas y encabezadas por NVIDIA están estudiando integrar en el base die de la HBM unas unidades de cálculo que se comportan como Tensor Cores, pero en versión miniatura.
Y aquí viene la clave. No buscan meter CUDA Cores, ni SM, ni nada que se parezca remotamente a los bloques gigantescos de una GPU moderna. Buscan otra cosa. Algo tan pequeño y tan eficiente que pueda respirar dentro del espacio limitado que dejan los TSV y el stack de DRAM, algo que no funda la memoria de calor y que siga siendo compatible con CUDA. Eso nos lleva a una única respuesta lógica: unidades MMA.
¿Y qué demonios es una MMA? Pues, resumiendo muy y mucho, es un bloque de cálculo diseñado para hacer multiplicaciones de matrices y acumular resultados, por decirlo de alguna manera simple, es el pilar matemático de la IA moderna. Las redes neuronales dependen casi por completo de operaciones GEMM, que no son más que multiplicaciones matriciales masivas con miles de elementos. Cuando pedimos a un modelo que genere texto, tipo ChatGPT o similares, que entienda patrones o que calcule pesos, lo que realmente está haciendo por dentro es disparar miles de GEMM.
Lo que NVIDIA, Samsung y SK Hynix pretenden es llevar parte de ese trabajo justo debajo de la memoria, donde están los datos, en vez de moverlos continuamente hasta la GPU principal. Por si te lo estabas preguntando, esto no es memoria PIM en el sentido clásico.
No se tocan los bancos DRAM ni se rediseña la arquitectura de la memoria y esto es clave. No hay ALU dentro de la matriz DRAM, no se rompe JEDEC ni se crea un monstruo incompatible con CUDA. Es Compute Near Memory: cálculo cercano a los datos, no dentro de ellos, diseñado con parte del hardware exclusivo de NVIDIA y que tendrá como base los Tensor Cores. La HBM sigue siendo HBM, pero el base die de la misma deja de ser un simple intermediario para convertirse en un mini acelerador matricial.
¿Por qué no pueden ser CUDA Cores? Por tamaño, por consumo, por registros, por complejidad, entre otras tantas cosas. Un solo bloque CUDA necesitaría demasiada potencia y generaría demasiado calor. Una MMA, en cambio, es perfecta: pequeña, repetible en mosaico, eficiente, ideal para formatos de precisión reducida como FP8 o FP4.
Y, sobre todo, capaz de quitar trabajo repetitivo a la GPU y reducir kilómetros de tráfico interno en forma de datos moviéndose arriba y abajo. Si esta idea llega a producción, y así lo parece porque se dice estar investigando la tecnología y tener bastante avanzado el proyecto entre bambalinas, estaremos ante una memoria capaz de participar en el cálculo, reduciendo la latencia, el consumo y la presión sobre la GPU.
Una memoria que no solo alimenta de datos al die, sino que acelera los cálculos. Una memoria que multiplica el rendimiento por vatio sin tocar ni un solo transistor de la DRAM. Una memoria que puede cambiar la jerarquía completa de la computación de IA. Como decíamos arriba, es disruptivo totalmente.
Y ahora la pregunta final: ¿veremos este concepto en la próxima generación? El escenario está servido. NVIDIA quiere mantener su dominio, Samsung y SK Hynix buscan diferenciar su HBM en plena escasez, y la industria está desesperada por nuevas vías para reducir consumo y movimiento de datos.
Todo apunta a que sí. Que este es el siguiente paso lógico, y que cuando llegue, no hablaremos de memoria, sino de un nuevo híbrido que redefine lo que es una arquitectura de Inteligencia Artificial. Al parecer, NVIDIA, Samsung y SK Hynix podrían tener una versión de esta Compute Near Memory para Feynman, o su sucesor, no está todavía realmente claro, pero podríamos hablar de 2028 como fecha para disipar las primeras dudas.
Esto, con la que está cayendo en el sector de la memoria, puede ser un paso adelante para desbloquear la relación entre demanda y oferta, oferta y demanda, puesto que para esa fecha las nuevas FAB estarían listas y funcionando, lo que incluiría líneas de producción específicas que dejarían las tradicionales libres para PC y portátiles.
Sea como fuere, será un salto exponencial que llevará el sello de NVIDIA, y esperemos que esta Compute Near Memory sea un paso adelante que impulse mucho más el rendimiento en IA, pero, sobre todo, reduzca o mantenga el consumo.
Para poder comprar, aprovechar las promociones y utilizar los medios de pago en nuestro sitio es requisitio estar correctamente registrado. En ningún momento recibirá correo electrónico que no haya solicitado. Pero se le pediran una serie de datos personales indispensables para cualquier operación comercial.
Los datos solicitados son necesarios para confeccionar la factura de los productos comprados y la dirección física para el envio de su compra.
Para más informació sobre nuestras políticas en el tratamiento de los datos personales visite la sección Terminos y Condiciones.
