在2026中国算力大会上,移动云联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、清华大学、北京大学共同发布了国内首个国产GPU+类脑芯片大模型异构混合推理系统。该系统对标英伟达Vera Rubin+Groq方案,首次将国产通用GPU与类脑芯片深度融合。
项目团队从架构创新入手,实现Transformer模型的PD/AF分离推理:Attention注意力计算交由国产GPU承载,发挥通用计算优势;FFN前馈网络延时敏感模块交给类脑芯片处理,利用存算一体与片上大容量SRAM架构优势。团队还自研了模型编译器、高速互联协议和统一推理引擎,实现两类算力的任务拆解、协同调度与结果聚合。
经DeepSeek V4 Flash实测,相较同类国产GPU算力集群,该系统推理输出和能效均提升1倍以上,业务运营成本降低40%以上,实现自主可控。中国移动云公司类脑与光实验室技术总监杜宇健表示,引入类脑算力相当于给现有GPU资源“涡轮增压”,让国产芯片不依赖先进制程即可实现推理性能翻倍。
该成果可广泛适配Token工厂、AI代码生成、多智能体协同、智能制造等高实时性场景,并为金融、安防、通信等安全敏感行业提供全栈国产化推理底座。团队计划逐步开放核心异构推理框架,赋能国内GPU与类脑芯片厂商及算力运营商。
