AI-ML 数据中心概述
随着人工智能 (AI) 和机器学习 (ML) 应用的扩展,支持这些 AI-ML 应用的网络需要更高的容量来处理大型数据流。对于存储 AI-ML 数据集的数据中心来说,这一要求尤其如此。Junos® OS 演化版为 AI-ML 数据中心提供了一套创新功能。网络管理员可阅读本指南,了解如何配置这些功能,从而优化 AI-ML 数据中心交换矩阵内部的运维。
大型语言模型 (LLM) 等生成式 AI 和机器学习应用基于数据集的统计分析:计算模型在数据中发现模式的频率越高,其输出中就越能强化该模式。通过这种重复的模式发现,这些模型能够完成令人信服地模仿人类语音等任务。然而,生成式 AI 应用的好坏取决于它所训练的数据集。数据集越大,模型能够检测到的模式就越多。因此,AI 和 ML 应用需要大型数据集。这些数据集存储在数据中心。
为了提高训练速度,AI 和机器学习模型通常通过并行计算在数据中心网络中进行训练。图形处理单元 (GPU) 聚集在一起并托管在分布在数据中心的服务器节点上。复杂的计算同时在这些 GPU 群集上进行。网络必须同步群集内 GPU 的输出,才能创建经过全面训练的模型。这种同步需要大型数据流(以下简称 大象流)在网络后端连续移动。
AI-ML 数据中心大象流需要强大的网络。在处理大象流时,网络不足很快就会遇到流量拥塞、丢包、链路故障等问题。在处理需要高精度的数据时,这些网络问题尤其不可接受。轨道优化条带是 AI-ML 数据中心的理想强大网络设计。这种 AI 群集架构将数据移动到与目标位于同一轨道上的 GPU,从而最大限度地减少网络中断。IP Clos 架构是另一种功能性 AI-ML 数据中心交换矩阵设计。
运行 Junos OS 演化版的瞻博网络® QFX 系列交换机是轨道优化条带架构和 IP Clos 网络设计的理想选择。例如,QFX5220-32CD、QFX5230-64CD、QFX5240-64OD 和 QFX5240-QD 交换机可以作为叶式、主干 和超级主干设备在这两种网络类型中正常工作。这些交换机还可作为一组称为分配点 (POD) 的叶主干交换机正常运行。要在数据中心构建更大的 AI-ML 群集,可以使用超级主干层将不同的 POD 互连。您可以将这些交换机部署为单个 POD 或多个 POD,以获得最大的灵活性和网络冗余。此外,这些设备支持高级 AI-ML 功能,可解决 AI-ML 数据中心中常见的许多负载平衡和流量管理问题。