在超大规模数据中心,限制因素不再是能够部署多少加速器,而是能够有效输送、分配和利用多少能源。在许多环境中,容量上限并非由芯片密度决定,而是由系统和设施能够承受的功率决定。
而这一瓶颈正逐渐显现。国际能源署(IEA)的一份报告预测,到2030年,全球数据中心的电力消耗量将达到945太瓦时,约为目前的两倍,这主要受人工智能工作负载的驱动。因此,系统设计越来越不再以理论计算能力为导向,而是越来越注重如何高效地将可用电力转化为实际性能。
与此同时,如此大规模的人工智能性能不再取决于单个组件,而是由系统行为决定。数千个计算单元并发运行,在复杂的互连和内存层级结构中共享数据。重要的不仅是单个引擎的运行速度,更是整个系统在高负载下移动、优先级排序和交付数据的效率。
随着超大规模人工智能系统的不断扩展,挑战正从增加计算能力转向协调计算能力。而这一转变的核心在于互连。
数据中心重新定义了人工智能扩展问题
虽然人工智能几乎无处不在,从边缘到数据中心,但数据中心代表了它最极端的形式。
这里的系统旨在最大限度地提高由多种异构计算资源(例如 CPU、GPU、NPU 和其他专用 AI 加速器)组成的大规模集群的吞吐量,所有这些资源同时处理共享数据集。架构模式是一致的:如果管理不当,并行引擎访问共享或分布式数据资源可能会导致争用。
与受限于固定功率和散热预算的边缘系统不同,数据中心的运行几乎完全依赖于可用能源。问题不仅在于能够部署多少计算能力,更在于如何有效地将可用电力转化为有效工作。
低效数据传输消耗的电力会减少可用于有效计算的能源。随着人工智能系统规模的扩大,低效数据传输对能源预算的消耗也日益加剧。因此,互连效率已成为数据中心人工智能系统设计的核心。单位能耗下传输的数据量越多,系统有效性能就越高。
瓶颈已转移到芯片内部
目前,业界关于人工智能扩展的讨论大多仍集中在片外带宽上,例如高带宽内存(HBM),或者使用CXL和PCIe的扩展和内存池化方案。这些方案至关重要,尤其是在内存容量和外部带宽仍然是关键瓶颈的训练工作负载中。然而,在许多现代架构中,瓶颈越来越多地分布在片上和片外数据传输中,这就需要对整个系统进行协调优化。
随着人工智能加速器复杂性的增加,它们集成了越来越多的计算引擎,包括多核神经网络处理器(NPU)、脉动阵列和向量单元。所有这些引擎都会同时生成和使用数据。其结果是内部流量呈爆炸式增长,片上互连现在必须处理:
- 高带宽流数据流
- 对延迟敏感的控制流量
- 一致性驱动的内存访问模式
与此同时,片上缓存层次结构变得越来越重要。当数据重用率较高时,本地缓存可以提供比外部存储器高得多的有效带宽,但它们也引入了额外的流量模式,必须对其进行高效协调。
这意味着:即使是最快的外部存储系统也无法完全弥补内部架构的不足。人工智能的性能越来越取决于系统内部数据的移动、重用和优先级排序效率,而不仅仅是从外部获取数据的速度。
异构计算需要智能互连
现代人工智能系统本质上是异构的。不同的计算单元会产生截然不同的运行行为:
- GPU 和 NPU 驱动高吞吐量、流式工作负载,对非常宽的多线程数据流执行向量运算。
- CPU引入了突发性、对延迟敏感的流量。
- 加速器可能需要紧密同步、具有相干性的通信。
- 支持这种多样性并非仅仅是增加带宽的问题。它需要互连架构能够同时管理多种流量类型,强制执行优先级排序,并在负载下保持可预测的延迟。正因如此,服务质量 (QoS)、流量隔离和一致性域管理等概念对于管理争用和优先级排序至关重要。
尤其值得注意的是,相干流量和非相干流量之间的区别增加了复杂性。在共享内存域中维护数据一致性会引入同步开销,必须谨慎管理以避免性能下降。如果没有智能仲裁和调度机制,争用会迅速抵消额外计算带来的优势。
实际上,互连控制着系统在实际工作负载下的行为,不仅影响数据传输,还影响整体性能和效率。
Chiplet的出现改变了数据传输的格局,并加剧了这一挑战
为了持续扩展人工智能计算能力,业界正在快速采用基于芯片组的架构。通过将大型SoC分割成多个芯片,设计人员可以提高良率、降低成本,并使系统规模突破光刻限制。但这种架构转变并没有消除数据传输的挑战,而是将其重新分配。
在芯片内部,可以通过更短的线路、更高的带宽和更低的延迟来优化局部通信,同时可以将内存和计算单元放置得更近以提高效率。然而,芯片间的通信对芯片间接口提出了新的限制。
片上互连相比,这些接口通常在带宽密度、延迟和能效方面受到更多限制。因此,在需要持续、海量数据交换的人工智能工作负载下,它们很容易成为瓶颈。同时,芯片组的出现也增加了对以下方面的需求:
- 跨芯片QoS和优先级;
- 高效的芯片间流量调度;
- 合理划分工作负载,最大限度地减少不必要的数据传输。
- 从这个意义上讲,芯片组既解决了问题,也带来了问题。它们实现了可扩展的系统设计,但也使得系统级数据传输架构变得更加关键。
人工智能规模化需要自动化和架构意图
随着人工智能系统规模和复杂性的增长,传统的互连设计方法正逐渐失效。虽然手工设计的互连在规模较小的系统中行之有效,但对于拥有数百个计算单元、多个存储层次结构以及复杂流量交互的系统而言,其扩展性却十分有限。
挑战始于架构意图层面,甚至早于实施阶段。定义数据在系统中的流动方式正变得日益复杂。手动指定这些架构既耗时又容易出错,而且难以优化,因此促使人们转向:
- 系统级建模与探索;
- 自动互连生成;
- 更抽象、可编程的架构描述方式。
- 目标不仅仅是更快地构建互连,而是要从概念到实现始终保持架构意图,并确保性能、功耗和可扩展性目标能够按预期实现。在数据中心,设计周期被压缩,性能裕度也十分有限,因此这种转变至关重要。
互联互通是人工智能规模化发展的新杠杆
历史上,互连设计通常被视为次要问题,在计算和内存配置决策完成后才会考虑。然而,在现代人工智能系统中,互连是决定系统性能、效率和可扩展性的主要因素,而不仅仅是基础设施。
数据中心人工智能扩展的下一阶段取决于如何在可用电力限制下高效地将数据传输到计算资源。对于数据中心架构而言,这意味着:
- 在设计过程早期就优先考虑数据移动;
- 将互连视为一流的架构元素;
- 采用将高性能面料与系统级自动化相结合的解决方案。
- 性能不再仅仅取决于机架中加速器的数量,还取决于这些加速器能否持续保持高负载运行。这就要求系统能够在负载下进行优先级排序、资源平衡和数据可预测地交付,而不仅仅依赖于带宽。
在现代人工智能系统中,数据流动必须尽早、有计划地进行架构设计,并实现规模化部署。下一代人工智能基础设施不仅要具备更强大的计算能力,更要从一开始就设计出能够像处理数据一样高效地流动数据的系统。
来源:编译自hpcwired
本文转自:半导体行业观察,转载此文目的在于传递更多信息,版权归原作者所有。如不支持转载,请联系小编demi@eetrend.com删除。





