第1页:封面 标题:国产自主编译器的贡献与产品 副标题:编译原理与实践 课程汇报 姓名/学号/班级 日期:2026年9月 第2页:目录 一、战略背景 二、国产芯片产品介绍(鲲鹏、龙芯、昇腾、香山) 三、国产编译器产品介绍(毕昇、方舟、龙芯LLVM、龙渊LCC、香山XSCC、兆松ZCC等) 四、核心贡献总结 五、未来展望 第3页:战略背景 — 为什么需要国产编译器 国际形势倒逼: 中美贸易摩擦暴露了芯片与基础软件“断供”风险 GCC、Clang等编译器工具依赖国外,存在“卡脖子”隐患 国产硬件多样化需求: 鲲鹏、龙芯、昇腾、香山等国产芯片涌现 传统编译器采用固定优化流程,难以适配多样化的国产硬件 政策强力推动: 国家标准《人工智能 深度学习编译器技术规范》已立项 多省市将编译器列为重点技术攻关方向 第4页:华为鲲鹏920处理器 基本信息: 2019年发布,华为自研高性能数据中心处理器 基于ARM v8.2架构,7nm工艺,2022年被国家博物馆收藏 核心架构: 2个CPU Die + 1个IO Die的SoC设计,集成CPU、南桥、网卡、硬盘控制器 单芯片最高支持64核,主频2.6GHz 缓存:每核64KB L1指令+64KB L1数据,512KB L2,24~64MB L3 华为自研HCCS缓存一致性总线,支持最高4路互联、256核NUMA架构 性能数据: SPECint Benchmark评分超过930,超出业界25% 能效比优于业界标杆30% 单处理器整型计算性能相比上一代提升2.9倍 应用场景:大数据、分布式存储、高性能计算、数据库 第5页:龙芯处理器(LoongArch) 龙芯3A6000(桌面) : 完全自主的龙架构(LoongArch)指令集,龙芯第四代微架构 主频2.5GHz,4核8线程(支持SMT2) 集成安全可信模块,支持SM2/SM3/SM4国密算法 性能对标:总体性能与英特尔第10代酷睿四核相当 与上一代3A5000相比,单线程提升60%,多进程提升100% 主流行业出货量已突破100万片 龙芯3C6000系列(服务器) : 2025年6月发布,单硅片16核32线程 可通过龙链封装为32核64线程或60/64核120/128线程 性能对标英特尔第三代至强可扩展架构 生态支持:统信、麒麟、欧拉、龙蜥、开源鸿蒙等操作系统 第6页:华为昇腾AI处理器 达芬奇架构: 专门为AI计算优化的异构计算架构 核心采用3D Cube矩阵计算引擎,每时钟周期实现4096个MAC操作 每个计算核包含独立的一维向量、二维矩阵和标量处理单元 昇腾910: 7nm增强版EUV工艺,单Die内建32颗达芬奇核心 半精度(FP16)256 TFLOPS,整数精度(INT8)512 TOPS 达到规格算力所需功耗仅310W 昇腾910C(最新) : 算力800 TFLOPS(FP16),HBM容量128GB 内存带宽3.2TB/s,互联带宽784GB/s 未来路线图: 2026 Q1:昇腾950PR(1 PFLOPS FP8) 2027 Q4:昇腾960(2 PFLOPS FP8) 2028 Q4:昇腾970(4 PFLOPS FP8) 第7页:香山RISC-V处理器 项目背景: 2019年中科院计算所牵头发起,目前国际性能最高的开源RISC-V处理器核 三代演进: 代际 架构 工艺 主频 SPECint2006 第一代 雁栖湖 28nm 1.3GHz 7分/GHz 第二代 南湖 14nm 2GHz 10分/GHz 第三代 昆明湖 7nm 3GHz 15-16分/GHz 第三代昆明湖架构: 性能对标ARM Neoverse N2服务器级CPU内核 中科院实测SPEC CPU2006达16.5分/GHz 可应用于服务器芯片、AI芯片、GPU、DPU等高端领域 第8页:四款芯片对比总结 芯片 架构 工艺 核心数 主频 性能对标 应用场景 鲲鹏920 ARM v8.2 7nm 最高64核 2.6GHz SPECint超业界25% 服务器、大数据 龙芯3A6000 LoongArch 成熟工艺 4核8线程 2.5GHz 英特尔10代酷睿 桌面、办公 昇腾910 达芬奇 7nm EUV 32核 — 256 TFLOPS FP16 AI训练、云端推理 香山昆明湖 RISC-V 7nm 可配置 3GHz ARM Neoverse N2 服务器、AI芯片 第9页:华为毕昇编译器(一)— 定位与技术架构 基本信息: 首版2020年9月30日发布,最新版本5.1.0 基于LLVM框架开发,支持C/C++/Fortran 专为鲲鹏920处理器架构深度优化 技术架构: 前端:支持异构混合编程编译,使能高性能Ascend C算子开发 中端:昇腾微架构亲和优化技术,自动完成指令调度与合并消减,算子性能提升20%以上 后端:自动优化寄存器分配,基于动态二进制插桩实现分钟级内存异常定位 AscendNPU IR开放(2025年): 基于MLIR设计,将硬件指令操作抽象为高阶OP 分层开放策略,提供从核内资源细粒度控制到核资源抽象的多层次接口 全面支持Triton等第三方AI编程框架 第10页:华为毕昇编译器(二)— 性能与生态 核心优化技术: LTO链接时优化:跨文件函数内联、特化、常量传播 PGO反馈优化:运行时收集性能数据,编译阶段优化,性能提升10-30% 控制流优化:分支消除、循环展开、循环软件流水、热路径代码分离,流水线填充率提升至90%以上,综合性能提升15%-35% AutoTuner自动调优:基于AI自学习模型的编译器自动调优 性能数据: SPEC CPU 2017跑分平均优于GCC 20%以上 2.1.0版本性能较GCC 9.3.0提升24.3% 已在openEuler仓库中可直接安装 生态贡献: 兼容openEuler、CentOS、Ubuntu等多种操作系统 2025年12月31日发布5.1.0版本 第11页:华为方舟编译器(ArkCompiler) 定位: 组件化、可配置的多语言编译和运行平台 支持JavaScript、TypeScript、Java等多种语言 HarmonyOS生态核心基础组件 技术架构: 包含编译器、工具链、运行时等关键部件 前端编译器将高级语言编译成统一字节码(ArkCompiler Bytecode) 字节码格式为基于寄存器设计,每寄存器64位,最多支持65536个寄存器 运行机制: 根据应用场景,通过解释器执行字节码或JIT/AOT编译执行机器码 支持TypeScript AOT编译,静态分析类型信息直接生成高质量机器码 方舟编译器2.0通过AOT预编译+运行时JIT+字节码优化,让ArkTS应用启动速度提升30%+ 战略意义: HarmonyOS NEXT砍掉AOSP,从“兼容安卓”走向“纯血鸿蒙”,微内核+分布式软总线+方舟编译器三件套重构系统底座 第12页:龙芯编译器(LoongA