阿里云灵骏真武 M890 超节点实例正式上线,64 卡可承载十万亿参数大模型
8月12日,阿里云宣布灵骏真武 M890 超节点实例正式上线,首批已在乌兰察布地域开售。企业客户无需自建机房,在云上即可开通 64 卡高速互联算力单元,最高可承载十万亿参数级 MoE 大模型推理。
灵骏真武 M890 超节点也是国内首个成功运行超 2 万亿参数大模型的超节点形态算力,Kimi K3 与 Qwen3.8 Max 均已通过该实例对外提供服务。这是阿里云首次通过公共云对外提供超节点形态的 AI 算力服务,把原本需要自建机房才能获得的"算力能力"直接打包输出。
超节点架构:64 卡互联、800GB/s 卡间带宽
M890 超节点实例的核心在于"超节点"架构。通过自研 ICN Switch 1.0 芯片,卡间 Scale-up 互联规模由 16 卡提升至 64 卡,卡间互联带宽提升至 800GB/s,P2P 通信时延控制在 150 纳秒以内。每卡配备 144GB 显存,单实例 64 卡组成 9216GB 显存池,为大模型训练推理提供充足空间。
精度支持方面,实例新增 MXFP4 精度,兼容 FP8、FP16、BF16 与 FP32 全精度覆盖。官方数据显示,在智能驾驶、具身智能等训练场景中,M890 相比上一代真武 810E 性能提升 3 倍。依托 T-Head SAIL 软件栈,PyTorch、vLLM、SGLang、Megatron-LM 等主流框架开箱即用,业务迁移无需修改代码。
图:阿里云真武 M890 完成创新适配,支持国内最大规模模型
核心参数一览:
芯片:真武 M890P,每卡 144GB 显存,单实例 64 卡组成 9216GB 显存池
互联:卡间 Scale-up 800GB/s,P2P 通信时延 150 纳秒以内
精度:FP32 / FP16 / BF16 / FP8 / MXFP4 全精度覆盖
能力:最高承载十万亿参数级 MoE 大模型推理
集群:HPN 8.0 支持 13 万卡异构混布,可扩展至百万卡级
算力底座:HPN 8.0 支持百万卡级扩展
支撑超节点集群的是阿里云统一底座——灵骏智算平台。依托 HPN 8.0 训推一体网络,单集群最高支持 13 万卡异构算力混布,并可扩展至百万卡级,为超大规模模型训练提供弹性扩展能力。真武系列 AI 芯片累计交付已超过 56 万片,服务 400 多家客户,应用覆盖智能驾驶、金融、运营商、政务、具身智能等 20 多个行业。
开服部署:乌兰察布首发、绿电占比约 90%
本次首批开售地域为乌兰察布,这是阿里云五大超级数据中心之一,绿电占比约 90%,可为高密度算力提供更低碳的运行环境。数据中心采用全模块化设计,供电、冷却、安防与消防的模块化率高达 90%,支持至少三代芯片迭代,可显著缩短交付周期。
市场层面,沙利文报告显示 2025 年中国全栈 AI 云服务市场规模达 595.9 亿元,阿里云以 40.1% 的份额位列第 一。今年阿里云计划将模块化数据中心的全球产能提升两倍以上,灵骏真武 M890 超节点实例也将陆续在其他地域开服。
图:阿里云超级智算中心,为超节点算力提供基础设施底座
从 16 卡到 64 卡,从自建机房到云上开箱即用,灵骏真武 M890 超节点把大模型训练推理的门槛又压低了一截。随着乌兰察布率先开服与更多地域陆续跟进,超节点形态的公共云算力正在成为国产 AI 基础设施的重要一环。