阿里玄铁C950成全球首款原生运行27B大模型的RISC-V服务器CPU
2026年8月19日,阿里巴巴达摩院宣布,今年3月推出的RISC-V架构旗舰CPU玄铁C950已实现对通义千问3.8-27B大模型的原生支持。这是全球首款在无GPU参与、不借助模拟层或二进制翻译技术的前提下,直接运行参数规模达270亿级大模型的RISC-V处理器。
长期以来,运行大模型推理被视作GPU的专属领地,RISC-V架构处理器在AI算力领域的存在感并不强。此次玄铁C950打破这一惯例,将大模型推理下沉至纯CPU方案,也为国产处理器在AI浪潮中打开新的想象空间。
硬件规格:5纳米64核设计
玄铁C950基于台积电5纳米先进工艺打造,定位服务器级应用,为64位RISC-V架构处理器。芯片配备64个高性能计算核心,每8个核心组成一个计算单元,通过高速AMBA CHI总线实现低延迟互连,最高主频达3.2GHz。内部集成专用矩阵加速引擎与向量加速引擎,深度适配AI推理任务需求。
该处理器采用8指令并行译码设计及16级优化流水线,内存访问带宽较前代玄铁C920提升超过四倍。在SPECint2006整数性能基准测试中,单核得分突破70分,创下当前RISC-V CPU性能新高。
图:阿里巴巴达摩院玄铁C950旗舰CPU官方发布图
实测表现:纯CPU跑通27B模型
在运行通义千问3.8-27B模型时,玄铁C950实测解码速率达每秒30个token,首token响应时间稳定控制在1.9秒以内。传统方案下,同等规模模型通常依赖搭载16GB至24GB显存的独立GPU完成推理;而玄铁C950仅凭CPU本体与片上硬件加速单元即可高效承载整套推理流程,无需额外配置独立图形处理器。
生态意义:开放架构的全栈闭环
区别于x86和ARM等封闭架构,RISC-V的开放特性使芯片研发过程摆脱了高昂授权成本的制约。阿里巴巴同时掌握大模型研发、云基础设施构建及处理器架构设计三大关键环节,形成了从底层芯片、系统软件到上层模型的全栈技术闭环。这种垂直整合能力,不仅支持未来针对特定硬件特性重新设计模型算子,也为依据真实业务负载持续迭代指令集与微架构提供了坚实基础。
图:玄铁C950刷新RISC-V架构性能纪录
总结与展望
玄铁C950在RISC-V赛道上跑通大模型原生推理,标志着开放指令集架构从「可用」迈向「好用」。随着RISC-V生态与AI工作负载进一步融合,这类纯CPU推理方案在成本敏感的边缘与私有化部署场景中,有望获得更大的用武之地。