报告摘要
人工智能 (AI) 和机器学习 (ML) 工作负载的规模和复杂性已经重新定义了数据中心设计。为了高效训练万亿参数模型,数据中心正在高速互连网络上部署数千个 GPU 和 xPU。这些分布式集群必须作为一个紧密同步的计算平台运行。
AI 工作负载依赖于一种独特的流量模式,专为分布式系统中的大容量并行数据处理而设计。训练现代 AI 模型涉及将大规模数据集分成块,并将它们分布在多个 xPU(例如,GPU 或自定义加速器)上进行同时处理。这些操作的结果必须在训练期间反复同步,需要精确的协调和超可靠的网络通信。
在第一步中,进程的数量 p 减少到2的幂值。前2r 个进程成对执行,从每个偶数秩向奇数秩 (秩 + 1)传递输入向量的后半部分,从每个奇数秩向偶数秩(秩 − 1)传递输入向量的前半部分。所有2r 进程各自计算其对应一半部分的归约。第一步结束时,将每个奇数进程(1 …… 2r – 1) 的结果发送至秩 – 1,放入缓冲区的第二部分。
报告前五页预览





本文来自知之小站
报告已上传百度网盘群,限时10元即可加入
(如无法加入或其他事宜可联系zzxz_88@163.com)