LA CARRERA POR LA IA ENFRENTA OTRO DESAFÍO: AUMENTAR LA CAPACIDAD DE CÓMPUTO SIN DISPARAR EL CONSUMO DE ENERGÍA
● Atlas 960E SuperPoD puede integrar hasta 4.096 NPU y alcanzar un
rendimiento de 8 EFLOPS en FP8 y 16 EFLOPS en FP4.
● Una de las principales innovaciones está en
Hi-ONE, un motor óptico desarrollado para acercar la transmisión de datos a los
procesadores y reducir las pérdidas asociadas a las conexiones tradicionales.
La
propuesta se materializa en Atlas 960E SuperPoD, una infraestructura diseñada
para conectar miles de procesadores y responder a las crecientes necesidades de
entrenamiento e inferencia de los modelos fundacionales de IA. El sistema puede
integrar hasta 4.096 NPU y alcanzar un rendimiento de 8 EFLOPS en precisión FP8
y 16 EFLOPS en FP4.
“Los
modelos fundacionales de inteligencia artificial se aproximan a la siguiente
gran frontera, por lo que las infraestructuras requieren innovaciones
arquitectónicas a nivel de sistema, capaces de entrenar modelos de diez
billones de parámetros. En Huawei estamos comprometidos con la construcción de
una infraestructura de inteligencia artificial potente y con el desarrollo de
sistemas abiertos para consolidar ecosistemas de cómputo”, señaló David Wang,
presidente rotatorio de Huawei y vicepresidente del Consejo de Administración.
Uno
de los principales cambios está en la manera como los procesadores intercambian
información. A medida que aumenta el número de chips trabajando
simultáneamente, la velocidad con la que los datos circulan entre ellos puede
convertirse en un cuello de botella y elevar el consumo energético. Para
enfrentar este desafío, Huawei incorporó conexiones ópticas mucho más cerca de
los procesadores, reduciendo la distancia que debe recorrer la señal.
Esta
arquitectura utiliza Hi-ONE, un motor óptico NPO con fuente de luz integrada
producido en masa, capaz de alcanzar velocidades de transmisión de 7,2 Tbit/s.
La compañía busca con esta tecnología sustituir parte de las conexiones
eléctricas tradicionales por transmisión óptica y disminuir tanto las pérdidas
de señal como la energía necesaria para movilizar grandes volúmenes de
información.
El
sistema incorpora además refrigeración líquida y UnifiedBus, una tecnología de
interconexión que permite administrar de manera unificada los recursos de
memoria y procesamiento. De acuerdo con Huawei, esta arquitectura puede reducir
el consumo energético en más de 550 kilovatios por nodo.
La
escala es otro de los componentes de la apuesta. Para operaciones que demandan
mayores capacidades, diferentes unidades Atlas 960E SuperPoD pueden conectarse
entre sí mediante UnifiedBus o redes RoCE. Esta configuración permite alcanzar
hasta 512.000 NPU en una topología Clos de dos niveles y escalar hasta un
millón de NPU mediante una arquitectura multi-rail.
Huawei
también está extendiendo este enfoque más allá del procesamiento especializado
de inteligencia artificial. La compañía presentó TaiShan 950 SuperPoD para
cómputo general y OceanStor M900 para almacenamiento, con el propósito de
integrar procesamiento, conectividad y gestión de datos dentro de una misma
arquitectura de infraestructura.
En
paralelo, Huawei anunció la apertura del código de CANN, su plataforma de
software para cómputo de IA, con el objetivo de ampliar las posibilidades de
desarrollo sobre su ecosistema tecnológico.
La
estrategia de la compañía no contempla, por ahora, concentrarse en desarrollar
un modelo fundacional propio. Según explicó Guo Ping, presidente del Consejo de
Supervisión de Huawei, la apuesta está en construir la infraestructura sobre la
cual puedan operar modelos desarrollados por diferentes actores, apoyándose en
tecnologías como Ascend, Kunpeng y SuperPoD.
Con
esta arquitectura, Huawei apunta a elevar la disponibilidad operativa de sus
sistemas hasta el 99,8%, en un momento en el que la competencia por la
inteligencia artificial comienza a trasladarse también hacia la infraestructura
capaz de sostener su crecimiento.

Comentarios
Publicar un comentario