Help us improve your experience.

Let us know what you think.

Do you have time for a two-minute survey?

 
 

Riel de GPU de backend Arquitectura de bandas optimizada

Como se describió anteriormente, una arquitectura de bandas optimizada para rieles proporciona una transferencia de datos eficiente entre GPU, especialmente durante tareas computacionalmente intensivas, como las cargas de trabajo de entrenamiento de modelos de lenguaje grandes (LLM) de IA, donde es necesaria una transferencia de datos fluida para completar las tareas dentro de un plazo razonable. Una topología optimizada para rieles tiene como objetivo maximizar el rendimiento al proporcionar una contención mínima del ancho de banda, latencia mínima e interferencia de red mínima, lo que garantiza que los datos se puedan transmitir de manera eficiente y confiable a través de la red.

En una arquitectura de bandas optimizada para rieles hay dos conceptos importantes: riel y rayas.

Las GPU de un servidor se numeran del 1 al 8, donde el número representa la posición de la GPU en el servidor, como se muestra en la Figura 6. Este número a veces se denomina rango o, más específicamente, "rango local" en relación con las GPU en el servidor donde se encuentra la GPU, o "rango global" en relación con todas las GPU (en varios servidores) asignadas a un solo trabajo.

Un riel conecta GPU del mismo orden en uno de los nodos leaf de la estructura; es decir, el riel Nth conecta todas las GPU en la posición Nth en todos los servidores al nodo leaf Nth, como se muestra en la Figura 9.

Figura 9: Rieles en una arquitectura optimizada para rieles

Una franja se refiere a un módulo de diseño o bloque de construcción, compuesto por múltiples rieles, y que incluye una serie de nodos Leaf y servidores GPU.

Figura 10: Franjas en una arquitectura optimizada para raíles

Todo el tráfico entre GPU del mismo rango (tráfico intrarferroviario) se reenvía a nivel de nodo leaf, como se muestra en la Figura 11.

Figura 11: Ejemplo de tráfico intrarraíl de GPU a GPU.

Una banda se puede replicar para escalar verticalmente la cantidad de servidores (N1) y GPU (N2) en un clúster de IA. A continuación, se conectan varias bandas (N3) a través de los conmutadores Spine como se muestra en la Figura 12.

Figura 12: Múltiples bandas conectadas a través de nodos Spine

Tanto el tráfico entre carriles como el tráfico entre franjas se reenviarán a través de los nodos spines, como se muestra en la figura 13.

Figura 13. Ejemplo de tráfico entre rieles e interbandas de GPU a GPU.