
张栋祥
- 面向国产 NPU 万卡集群的大模型训练与推理系统级协同优化,以及面向“鹏城云脑 III”智算中心的软硬件协同设计与工程落地。
- 高性能集合通信:围绕昇腾 910C SIO/HCCS 分层互联与 Die-to-Die 直连架构,设计高带宽、可扩展的集合通信算法与通信优化方案。
- 功耗建模与能效优化:面向大模型训练/推理负载的细粒度功耗建模、能效度量体系构建与集群级能效协同优化。
- 资源受限下的推理质量控制:大模型量化部署、访存友好的数据布局优化,以及能效约束下的词元级多模型协同推理。
- 大规模训练仿真与性能工程:万卡级并行策略分析、性能预测工具链建设与国产集群性能摸底方法学。
云脑研究所博士后 | 鹏城实验室
2026.08 ~ 至今
- 入职“鹏城云脑”网络智能重大科技基础设施团队,继续围绕国产 NPU 万卡集群开展大模型训练与推理的系统级优化研究,重点推进高性能集合通信、功耗建模与能效优化等已有成果的工程化落地与规模验证。
多媒体研发工程师 | 展讯半导体(南京)有限公司
2021.07 ~ 2022.07
- 负责 Android 平台 Camera IP 的软件设计、功能开发、系统集成与技术支持工作,专项负责 Camera 相关的功耗、性能与深度优化,并积极参与技术难题攻关,分析并处理复杂系统问题。独立承担多媒体领域的需求分析、架构分析和方案设计,确保软件方案满足产品规格与性能目标。因在新项目中表现出色,荣获 2021 年度《优秀新人》称号。
华南理工大学 | 博士研究生 未来技术学院
2022.08 ~ 2026.06
- 华南理工大学与鹏城国家实验室联合培养博士生。
- 鹏城国家实验室智能计算研究部,主要研究方向为 AI 大模型训练并行加速算法、高性能网络通信、软硬件协同设计。
南京大学 | 项目合作 现代工程与应用科学学院
2020.07 ~ 2021.01
- 参与袁洪涛教授组内多个科研项目,并提供支持,并参与部分实验项目设计。
郑州大学 | 本科 & 硕士
2014.09 ~ 2021.06
- 本科(电子科学与技术专业):C/C++、MATLAB、数字信号系统、模拟电子技术基础、数字电子技术基础、单片机原理、微机原理等。
- 硕士(仪器仪表工程专业):数字图像处理、现代数字信号处理、现代传感技术、数值分析、机器视觉、现代光电测试技术等。
- 学习成绩优异,多次获得校一等奖学金、优秀学生干部等荣誉称号,综合学习成绩排名前 10% 左右。
➤ 论文发表:
- Dongxiang Zhang, et al. “Synchronized Dual-Ring: A Synergistic Algorithm for Bandwidth-Efficient Collective Communication Leveraging Die-to-Die Direct Interconnects.” In IEEE International Parallel and Distributed Processing Symposium (IPDPS), 2026.
- Dongxiang Zhang, et al. “A DUAL-PATH APPROACH TO OPTIMIZING LLMS: ENTROPY CONSTRAINT FOR EXPLOITATION AND NEURAL PERTURBATION FOR EXPLORATION.” In IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2026.
- Dongxiang Zhang, et al. “NPUPower: A Fine-Grained Power Modeling and Optimization Framework for Large-Language Model Training on Ascend NPUs.” In IEEE Transactions on Parallel and Distributed Systems (TPDS), 2026.
- Yijia Zhang,Dongxiang Zhang, et al. “TOKCOINFER: TOKEN-LEVEL MULTI-MODEL COLLABORATION FOR ENERGY-EFFICIENT LLM INFERENCE.” In IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2026.
- Yijia Zhang,Dongxiang Zhang, et al. “Improving the Energy Efficiency of AI Clusters Through Variability-Aware Frequency Scaling and Task Allocation.” In Proceedings of the 25th International Conference on Algorithms and Architectures for Parallel Processing (ICA3PP 2025), Zhengzhou, China, October 30 - November 02, 2025.
- Yijia Zhang,Dongxiang Zhang, et al. “AUE: A Normalized Energy Efficiency Metric for AI Servers under LLM Workloads.” In 2025 IEEE 31st International Conference on Parallel and Distributed Systems (ICPADS 2025), Hefei, China, December 14 - 17, 2025.
➤ 发明专利:
- 张栋祥, 张士勋, 李雪宁 等. 双环路芯片结构、集合通信方法、装置、设备和存储介质. CN120780647A[P]. 2025-08-28.
- 张栋祥, 张士勋, 张尔焜 等. 针对大模型参数的数据处理方法、装置、设备以及介质. CN120806000A[P]. 2025-09-12.
- 章弋嘉,张栋祥, 王丙强 等. 大模型并行训练场景下的功耗预测方法以及相关设备. CN120822038A[P]. 2025-10-21.
- 章弋嘉,张栋祥, 王丙强 等. 通信能效优化方法、装置、设备和存储介质. CN121151301A[P]. 2025-12-16.
- 田永鸿, 张士勋, 王丙强,张栋祥等. 数据传输方法、装置、存储介质及计算机设备. CN119011512A[P]. 2025-01-07.
- 田永鸿, 张士勋, 王丙强,张栋祥等. 一种智能计算系统架构. CN119204130A[P]. 2025-02-18.
“鹏城云脑”网络智能重大科技基础设施项目
(国家重大科技基础设施)
2022-09 ~ 2025-05
- 核心职责:负责国产“鹏城云脑 III”大规模 NPU 集群的系统优化与通信算法设计,围绕昇腾 910C 芯片的 SIO/HCCS 分层互联架构开展高性能集合通信研究。
- 设计面向 Die-to-Die 直连互联的同步双环/双环类集合通信算法,协同利用 SIO 与 HCCS 链路,在 4 到 128 NPU 规模下较官方 HCCL 平均通信带宽提升9.15% 到 15.81%;在万亿参数模型训练评估中的暴露通信占比由51.05% 降至 34.19%,端到端性能提升最高达34.35%。
- 主导昇腾 910B/910C 集群性能摸底与瓶颈定位,围绕矩阵计算、NPU-CPU 通信、统一编址、跨超节点扩展等关键路径,为硬件和驱动团队提供底层测试数据与优化依据。
- 开发大规模训练仿真工具原型,并完成 NS3-RDMA 插件迁移,为万卡级并行策略分析与性能预测提供工具支撑。
万亿级大模型高效训练与推理平台研发
(广东省重点领域研发计划)
2024-12 ~ 2026-06
- 核心职责:负责国产算力平台上的大模型训练与推理全栈优化,聚焦显存墙、推理吞吐、部署精度与系统能效的协同设计。
- 研究并落地 Llama2、DeepSeek-V3、Qwen3 等模型在昇腾 910C 上的混合并行与量化部署方案,完成 DeepSeek 的 INT4/INT8 量化实现与精度评测,将 INT4 量化精度损失控制在 5.6% 以内。
- 围绕推理能效与质量约束开展系统优化研究,设计词元级多模型协同推理 TokCoInfer,在生成 2k 长文本时实现系统级能耗下降31%,显存峰值增幅不足10%,体现出较强的工程应用价值。
- 设计“量化数据元数据原子块(QDMAB)”数据结构,针对分块量化矩阵推理过程中的访存瓶颈优化数据布局,减少非合并访存并提升带宽利用率,相关成果已申请发明专利。