近日,国家超级计算深圳中心部署的全新百亿亿级(Exascale)超级计算机**"岭声"(LineShine)引发了全球技术圈的强烈震动。《Tom\'s Hardware》及《Jon Peddie Research》等海外权威机构相继对此进行了深度技术拆解。 在全球地缘政治博弈与 GPU 严苛禁令的背景下,"岭声"系统完全绕开了传统的 CPU+GPU 异构加速架构,凭借纯 CPU 阵列实现了 1.54 EFLOPS(混合精度 BF16 训练性能)至 2 EFLOPS(理论峰值)的算力跨越**。
从系统架构师与 IT 咨询顾问的专业视角来看,这不仅是一次极其成功的"工程学突围",更展现了中国信创产业在高算力、全栈自研控制力上的底层技术蜕变。以下从架构设计、算力密度、内存子系统及工程哲学四个维度进行深度解构。
一、 核心微架构:华为自研 LX2 Armv9 处理器
"岭声"的核心驱动力是全自研的华为 LX2 处理器,基于Armv9架构设计,单芯片展现出极高的算力密度。
- •Chiplet 芯粒架构:每个 LX2 处理器内部集成了2 个计算芯粒(Compute Die),单芯片总计封装了304 个 CPU 核心。
- •群组拓扑:这 304 个核心被划分为8 个 CPU 集群(Clusters),每个集群包含 38 个核心。
- •向量与矩阵加速单元:每个核心均深度集成了 **SVE(Scalable Vector Extension,可伸缩向量扩展)**和SME(Scalable Matrix Extension,可伸缩矩阵扩展)。这是其能脱离 GPU 进行高效 AI 计算的底牌。
- •多精度数据支持:底层原生支持 FP64、FP32、BF16、FP16 和 INT8,打破了传统 CPU 无法进行高效低精度矩阵运算的桎梏。
单芯片理论吞吐量:
- •FP64(双精度浮点,科学计算):60.3 TFLOPS
- •BF16/FP16(半精度浮点,AI 训练):240 TFLOPS
- •INT8(量化整型,AI 推理):960 TOPS
二、 异构存储解耦:打破"存储墙"的激进方案
在传统超算中,GPU 往往受限于 HBM 的容量瓶颈(如 96GB/141GB),且 CPU 与 GPU 之间的 PCIe/NVLink 频繁数据迁移会带来严重的带宽税(Bandwidth Tax)。LX2 采用了极其罕见且激进的统一内存空间与非对称存储架构:
| 存储层级 | 单芯片容量 | 聚合带宽 | 技术特性 |
|---|---|---|---|
| 片上内存 (On-Package) | 32 GB HBM | 4 TB/s | 8 堆栈 HBM,作为高速缓存或超高带宽直接驻留层 |
| 片外内存 (Off-Package) | 256 GB DDR5 | 标准高带宽 | 跨 4 个 NUMA 域,满足大模型及超大物理仿真驻留 |
- •硬件级 SDMA 引擎:芯片内部集成了专用 SDMA(System DMA)引擎,在硬件底层全自动调度 DDR5 与 HBM 之间的数据吞吐,对软件层完全透明。
- •全栈内存一致性:由于去除了 GPU 独立的显存空间,复杂的 AI 模型训练与科学计算仿真运行在完全相同的处理器和内存寻址空间中。这彻底干掉了昂贵的跨总线数据拷贝,大幅降低了系统软件栈的开发和调度复杂度。
三、 超大规模集群拓扑与"领渠"互联
要把几万颗芯片堆叠出百亿亿级的算力,网络拓扑和工程落地的规模堪称恐怖。
``` {language-pending="" raw-code="[20,480 计算节点] ──> [40,960 颗 LX2 处理器] ──> [2,451,840 个 Armv9 核心] │ 通过 1.6 Tb/s“领渠”互联 │ ┌──────────────────┴──────────────────┐ [92 栋计算机柜] [36 栋网络机柜] │ │ └──────────────────┬──────────────────┘ ▼
[67 栋存储机柜 / 650 PB 容量]" show-line-number="false"}
[20,480 计算节点] ──> [40,960 颗 LX2 处理器] ──> [2,451,840 个 Armv9 核心] │ 通过 1.6 Tb/s“领渠”互联 │ ┌──────────────────┴──────────────────┐ [92 栋计算机柜] [36 栋网络机柜] │ │ └──────────────────┬──────────────────┘ ▼ [67 栋存储机柜 / 650 PB 容量] ```text
- •节点规模:全系统共包含20,480 个计算节点,每个节点部署 2 颗 LX2 处理器。整机共计40,960 颗 LX2,物理核心数达到了惊人的2,451,840 个。
- •"领渠"自研网络:节点间互联采用了名为"领渠"的高速网络,基于双平面多轨胖树(Dual-plane Multi-rail Fat-tree)拓扑结构,为每个节点提供高达1.6 Tb/s的互联带宽。百亿亿级规模下的全连接线速转发能力,是确保 245 万核协同作业不发生系统性雪崩的关键。
- •配套体量:全系统由 92 栋计算机柜、36 栋网络机柜、67 栋存储机柜(包含 428 个存储节点)组成,提供10 TB/s的聚合存储带宽及650 PB的海量存储。
四、 架构师深度思考:纯 CPU 超算突围的得与失
"岭声"的问世,在技术路线上更接近日本当年的"富岳"(Fugaku,基于 Fujitsu A64FX),而非美国当前的"Frontier"或"El Capitan"(基于 AMD/NVIDIA GPU 异构)。这种设计是一次基于制程和供应链约束下的高明反击:
1. 核心优势(工程与软件层面的胜利)
- •全栈主权可控(Sovereign Infrastructure):从微架构设计(基于 Armv9 授权自研内核)、互联网络、存储节点到基础编译器,完全摆脱了美国先进晶圆代工与高端 GPU 供应链的钳制。
- •近乎完美的通用性与开发效率:传统的 CPU+GPU 架构需要编写复杂的 CUDA / ROCm 或 OpenMP 代码。而"岭声"天然是纯 CPU 架构,传统的 MPI+OpenMP 科学计算程序、气象模拟、流体力学软件几乎可以零成本移植,并完美享受 SVE/SME 带来的向量加速。
- •超大规模多任务编排优化:在需要频繁进行数据清洗、IO 吞吐、大模型预处理(Data Ingestion)的复杂场景中,纯 CPU 阵列不存在 GPU 异步调度的等待瓶颈,流水线编排效率更高。
2. 潜在权衡(Skepticism & Trade-offs)
- •能效比与算力密度挑战:在纯粹的密集型矩阵运算(如大规模 LLM 的 Attention 机制)中,即便 CPU 拥有 SME,其每瓦特生成的 AI 算力(TFLOPS/Watt)依然很难在绝对值上与高集成度的专用 GPU(如 Blackwell / Hopper 架构)相媲美。维持 245 万核的运行,其电力供应与液冷散热成本将是天文数字。
- •Linpack 效率的隐忧:目前该超算尚未向 TOP500 组织提交官方的 Linpack 基准测试数据(这也是近年中国超算的常态)。其宣传的 1.54 EFLOPS 更多是在特定"地球观测生成式压缩模型(63亿参数)"训练中跑出的实际混合精度表现,其真实的高阶通用线性代数效率仍有待时间验证。
总结
"岭声"超级计算机不仅是一个跑分机器,它代表着信创工业界的一种全新解题思路:当尖端制程与专用加速器被锁死时,通过先进封装(Chiplet)、极宽的片上内存带宽(HBM)、底层向量/矩阵单元的深度寄生,以及超大规模的高速互联网络,依然可以用 CPU 堆叠出世界顶级的百亿亿级算力。\ 这向全球科技界释放了一个明确信号------计算主权的围剿,并未阻断中国登顶超算之巅的步伐。
\
\
AI 工作站三国杀:元脑 Z3 vs 联想 vs 同方,NVIDIA DGX Spark vs 苹果 M5 推理对决\
深度拆解:从 Kirin 叠层架构到芯片级 MEMS 主动散热的技术演进\
\