登录社区云,与社区用户共同成长
邀请您加入社区
Ascend 950PR和Ascend 950DT芯片在继承前代DaVinci架构核心设计理念的基础上,围绕计算、存储、互联三大维度实现了系统性升级,通过计算效能革新、访存效率深挖与互联架构突破三者的协同优化,面向大模型预训练、中心推理、后训练与强化学习、推荐系统、多模态内容生成等核心AI业务场景,提供了系统的软硬协同能力,为AI产业的算力需求增长提供了强有力的算力底座支撑。面向下一代硬件,CAN
学习 Ascend C 必须掌握的硬件知识写在最前面一、 宏观视角:昇腾处理器的“前店后厂”1.1 异构计算的指挥与执行1.2 Da Vinci 架构的“计算工厂”二、 深入车间:AI Core 的“三驾马车”2.1 控制单元:不仅仅是发指令2.2 计算单元:暴力的“方”与灵活的“圆”A. Cube Unit(矩阵计算单元):暴力的“方”B. Vector Unit(向量计算单元):灵活的“圆”?
当前AI模型部署设备通常采用CPU与算力卡组成的异构架构。在AI推理业务中,CPU主要负责任务调度,算力卡负责执行大量计算任务。由于算力卡成本远高于CPU,其计算执行又依赖CPU的任务下发,一旦CPU调度不及时,算力卡便会陷入空闲等待,造成高成本算力资源被低成本CPU拖累的局面。Overlap Scheduling是解决这一问题的通用优化手段——它将CPU的任务调度过程与算力设备的计算执行过程并行
AReaL框架为需要在昇腾平台进行强化学习的开发者提供了新的可靠途径——开箱即用保障开发者轻松上手,优秀架构支撑模型性能。AReaL框架在昇腾平台上会持续演进,为开发者提供更强大、更便捷的强化学习体验,大家可以持续关注AReaL开源项目了解最新的技术动态。AReaL开源项目:https://github.com/inclusionAI/AReaL。
如何充分利用Cube单元的能力,是算子开发的关键课题。下一代Ascend平台的Cube矩阵计算单元进一步增强了计算能力,支持更丰富的数据类型(如MX FP4/MX FP8),更多的数据通路(如UB 到L1 Buffer,L0C Buffer到UB),为大模型训练和推理提供了更强大的算力支撑。下一代Ascend平台引入了SIMT(单指令多线程)编程能力,在SIMT编程模型下,开发者可以像业界通用的S
融合了ACLGraph的调度能力和亲和NPU的图优化能力,在大模型推理场景下有效的消除了算子调度时延,显著提升了大模型的推理表现。然而使能npugraph_ex由于需要对模型进行编译优化会引入较长的冷启动时间,此时便需要使用编译缓存功能,将编译优化后的产物保存到磁盘以便下次运行直接加载,节省编译耗时。当前npugraph_ex不仅支持了第三方框架对于模型性能优化的集成,也支持了编译缓存功能的集成,
本文以HCCL异构计算通信库的代码贡献为例,详细介绍了从发现问题到PR合并的全流程。重点包括:基于CONTRIBUTING.md规范进行Fork仓库、代码修改、单元测试和提交PR;通过真实案例Issue#782演示如何分析问题、优化算法选择逻辑并添加测试用例;强调规范的提交信息和PR描述撰写;分享应对Reviewer反馈的经验与心态建议。文章还提供性能优化技巧和故障排查指南,帮助开发者在大型AI基
CANN catlass 通过精妙的模板元编程设计,将高性能 GEMM 算子的开发从“手写汇编”的黑盒模式,转变为“参数化配置 + 白盒调试”的工程化范式。它不仅是 CANN 生态的性能基石,更是开源社区协同创新的典范——让每一位开发者都能站在巨人的肩膀上,定制属于自己的极致算子。对于追求极致性能的 AI 系统工程师、编译器开发者或 HPC 研究者而言,深入理解 catlass 的设计哲学与实现细
在华为针对AI场景打造的异构计算架构CANN的生态体系中,https://gitcode.com/cann/ 仓库作为核心技术阵地,汇聚了众多适配AI异构计算的开发工具、框架插件与工程化实践方案。CANN架构凭借承上启下的特性,对上兼容TensorFlow、PyTorch等多类AI框架,对下赋能昇腾AI处理器的高效编程与计算,而在这一生态里,DrissionPage脱颖而出,成为仓库中最受开发者青
大语言模型(LLM)的训练是人工智能领域算力密集、流程复杂的核心工作,从模型架构选择、超参数配置,到硬件资源调度、训练流程编写,每一个环节都需要资深算法工程师和运维工程师的深度参与。传统LLM训练脚本的开发模式,不仅需要开发者熟练掌握PyTorch、TensorFlow等AI框架,还需深入理解底层硬件的调度逻辑,开发周期长、门槛高、可复用性低,成为制约LLM技术规模化落地的重要瓶颈。
本文介绍了CANN Opbase算子库基础框架的核心技术架构与功能。Opbase作为算子生态的基础框架,提供了公共依赖管理(内存管理、日志系统、配置管理)、基础调度能力(任务调度、资源调度)和错误处理机制三大核心功能。通过分层架构设计,Opbase实现了稳定高效的公共基础设施,为上层算子库提供统一接口,有效减少代码重复并提高兼容性。文章还详细阐述了Opbase的性能优化技术,包括针对CANN AI
本文介绍了CANN Ops-Transformer算子库在大模型加速中的关键技术实现。该算子库针对Transformer架构的自注意力机制和前馈神经网络进行深度优化,通过融合算子技术将多个操作合并,减少内存访问和同步开销。核心实现包括注意力融合算子和前馈网络融合算子,利用CANN AI处理器的硬件特性优化计算效率。同时采用内存复用、数据重排、零拷贝传输等策略优化内存访问,并通过计算流水线技术实现计
本文深入解析CANN生态中的Ops-Samples算子实战样例项目。该项目通过分层架构设计(基础/进阶/高级/综合样例模块)提供循序渐进的学习路径,包含478个stars和156个forks,具有活跃的社区参与度。核心价值体现在实战导向、循序渐进、完整覆盖和易学易用四个方面,提供从简单算子到融合算子的完整开发样例。文章详细剖析了基础算子、复杂算子和融合算子的设计特点,并展示了学习路径和实际应用代码
本文深入解析了CANN算子模板库Catlass的架构设计与开发技术。Catlass作为CANN生态的重要组件,通过模板化技术显著提升算子开发效率,提供代码生成、优化和验证等核心功能。其模块化架构包含模板定义、代码生成、优化和验证四大模块,支持算子、参数、数据等多种模板类型。文章详细剖析了代码生成机制和优化技术,并通过实例展示了实际应用效果。Catlass将持续演进,未来将扩展更丰富的模板、引入AI
本文深入解析CANN信号处理算子库SIP的架构设计与加速技术。SIP是专为信号处理设计的算子库,具有丰富算子、硬件优化、高性能和易用性等核心价值。其模块化架构包含基础算子、变换、滤波和调制解调四大核心模块。文章重点剖析了FFT、滤波等核心算子的实现原理,以及算法优化、内存访问优化和计算优化等性能提升策略。通过简洁API和高效实现,SIP显著提升了信号处理性能,并将在AI技术融合、场景扩展等方面持续
CANN算子基础框架库OpBase是华为CANN生态系统的核心组件,提供统一的算子开发、注册、调度和执行管理。其模块化架构包含算子注册、调度、执行和工具支持四大模块,通过公共依赖管理、属性系统和执行引擎简化算子开发。OpBase采用多种优化策略,包括算子融合、内存优化和并行计算,显著提升性能。开发流程从需求分析到算子集成,提供完整支持。该框架已在CANN生态中广泛应用,为AI计算提供高效算子管理解
本文深度解析了CANN生态中的ops-transformer算子库技术架构与优化实践。该库针对Transformer类大模型在NPU上的高效计算,采用C++实现核心算子(自注意力、FFN、层归一化等),通过计算融合、内存优化和并行计算等策略显著提升性能。文章详细剖析了算子实现原理、性能优化方法,并展示了实际应用效果。随着大模型技术发展,该库将持续演进以支持更多Transformer变体,进一步优化
ops-transformer:CANN大模型算子库解析 ops-transformer是CANN生态中针对Transformer类大模型的专用算子库,专注于NPU上的高效计算实现。该C++项目已获得658星和765个fork,显示出社区的高度关注。 核心架构包含五大模块: Attention算子(多头/Flash/交叉注意力) FFN算子(线性层+激活函数) Normalization算子(La
理论之后,让我们通过一个实战案例,了解如何基于ops-nn的生态,使用Ascend C开发一个自定义算子。我们将实现一个PReLU(参数化ReLU)激活函数算子。从基础算子到AIGC的性能突破,仓库不仅仅是一个代码库,更是一个连接算法创新与硬件实力的桥梁,一个汇聚开发者智慧、推动AI技术进步的开放平台。它体现了华为在AI基础软件领域的开源决心和生态布局,也为我们展示了如何通过开源开放的方式,构建一
ops-cv代表了计算机视觉底层加速从“通用可用”走向“场景极致”的重要演进。它通过专用算子设计、深度融合策略与工程化工具链,为视觉算法在异构计算架构下的高效执行提供了完整解决方案。未来,随着具身智能、空间计算、视频大模型等新范式的兴起,ops-cv将持续扩展其能力边界,支持光流估计、NeRF 渲染、3D 卷积等新兴算子,为下一代 AI 视觉系统奠定坚实基础。对于致力于构建高性能视觉系统的团队而言
ops-cv 不仅是一个视觉算子库,更是实时 AI 系统的基石。它通过算子融合、内存对齐、向量化计算与确定性调度,在预处理、检测、分割等关键路径上实现了数量级的延迟降低。在智能驾驶、工业自动化等对可靠性与实时性要求极高的领域,这种“硬件资源高效适配 + 低延迟设计”的工程范式,不仅提升了系统性能,更保障了业务连续性与用户体验。未来,随着多模态感知与空间智能的发展,ops-cv 将持续扩展其能力边界
摘要:本文提出一种基于复数旋转指令融合的RoPE位置编码硬件加速方案,通过SIMD向量化、内存布局优化和指令级并行三大关键技术,在Transformer架构中实现显著性能提升。实验表明,优化后的方案相比标量实现获得23%的吞吐提升,单批次处理4096维数据时达到27,512 tokens/s。文章详细解析了从数学原理到AVX2指令集实现的全链路优化方法,并提供了可落地的代码实现、性能分析工具链和常
通过深入解析Graph Engine的编译链路,我们不仅理解了ONNX→OM转换的技术本质,更掌握了性能优化和故障排查的实用技能。在实际项目中,我强烈建议:🎯关键洞察不要盲目追求最高优化等级:Level 3优化在某些场景下反而会引入不稳定因素建立编译性能基线:针对不同模型类型建立耗时标准,快速发现异常关注内存使用模式:大模型编译时内存峰值往往是瓶颈所在随着模型复杂度的不断提升,编译技术的深度优化
摘要:HCCL内存池技术通过智能缓冲区复用机制和动态尺寸调整策略,有效解决了分布式训练中的显存碎片问题。核心设计采用预分配缓冲区和历史使用模式预测,将BERT、GPT等大模型的显存占用降低35-45%。实现方案包括智能缓冲区查找、动态分配策略和碎片整理机制,实测显示通信效率提升8-15%,OOM错误减少98%。该技术为大规模分布式训练提供了高效的显存管理方案,未来可结合AI预测和异构内存管理进一步
本文深入解析CANN项目中卷积算子的安全校验机制,重点探讨conv2d_validator.cpp实现的三层防护体系:编译期静态检查、运行时动态验证和异常安全处理。通过ACL_CHECK_SHAPE宏的展开机制分析,展示了零运行时开销的错误检测技术,并提供了完整的测试用例与性能数据,证明分层校验策略可有效平衡安全与性能。文章还包含企业级实践方案,如分布式环境校验、内存越界诊断工具等,为AI工程化部
摘要:本文深入探讨了目标检测模型中NMS(非极大值抑制)后处理的硬件加速优化方法。通过分析ops-cv中non_max_suppression.cpp的实现,详细介绍了如何利用aicpu_sort硬件单元加速排序计算,并结合YOLOv8案例提供完整的IoU阈值调优方案。实验数据显示,优化后的NMS在NPU上可实现3-5倍的性能提升,同时保持检测精度稳定。文章还包含环境配置、调优策略、常见问题解决等
摘要:本文深入探讨分布式训练中BatchNorm同步的关键技术,以ops-nn的bn_training.cpp实现为例,解析HCCL通信库的all_reduce优化策略。通过异步流水线设计、缓冲区复用和拓扑感知路由三大原则,实现计算通信重叠,在ResNet-50训练中达到99.8%的精度对齐,同步开销降低40%。文章包含完整的代码实现、性能对比数据及13年实战经验总结的调优技巧,包括通信死锁排查、
华为CANN开源仓库为AIGC开发者提供了解锁昇腾算力的关键工具。该生态体系包含pytorch-npu(框架适配)、ops-nn(优化算子)和modelzoo(预训练模型)三大核心子仓库,通过屏蔽硬件差异、提供优化算子和简化部署流程,有效解决AIGC大模型的算力瓶颈问题。实战案例展示了如何基于CANN在昇腾NPU上高效运行Stable Diffusion模型,利用混合精度优化和模型量化技术显著提升
本文介绍了CANN生态model-zoo中的模型量化技术,包括量化原理、类型和方法。模型量化通过降低参数精度来减小模型大小、提高推理速度和降低功耗。主要量化方法包括线性量化和对数量化,分别通过数学转换实现不同精度需求。量化策略涵盖训练后量化和量化感知训练,前者在模型训练完成后进行参数校准,后者则在训练过程中模拟量化效果。这些技术为AI模型部署提供了重要的优化手段。
通过本文的深入解析和实战案例,我们掌握了CANN架构下AIGC算子开发的核心原理和Ascend C编程范式。从流水线机制到内存管理,从计算API到优化技巧,这些知识将助你高效开发高性能算子。未来发展方向自动化开发工具:基于AI的算子自动生成与优化跨平台兼容性:统一抽象层,实现算子跨硬件复用自适应优化:根据数据分布自动调整计算策略开发者资源CANN开源社区ops-nn算子仓库昇腾CANN训练营随着C
在AIGC时代,算法创新与系统优化同等重要。CANN的ops-nn算子库为我们提供了一个将深度学习计算映射到昇腾硬件的强大平台。通过理解TIK/Ascend C的开发范式,掌握数据搬运、内存管理和流水线并行等核心技术,我们才能不仅仅是“使用”算子,更能“优化”和“创造”算子,从而为AIGC应用注入极致性能。进一步探索:你可以从实现一个简单的自定义算子(如带特殊填充的卷积或一种新型的激活函数)开始你
下面我们通过一个完整的加法算子开发示例,演示从环境准备到验证的全过程。CANN ops-nn作为昇腾AI软件栈的核心组件,通过提供高性能算子实现完善的开发工具和丰富的优化策略,为AI应用落地提供了坚实的算力基础。随着AIGC技术的快速发展,ops-nn将在大模型推理、多模态生成和实时内容生成等领域发挥越来越重要的作用。昇腾算子共建仓已经正式上线Gitee社区,这是国内首个面向昇腾开发者的算子共建平
本文介绍了CANN生态中基于custom-op的算子融合策略,详细解析了融合原理、类型和方法。通过将多个算子融合为一个算子,可减少内存访问、提高计算效率并降低延迟。文章重点展示了卷积+ReLU和卷积+BatchNorm+ReLU两种典型融合算子的实现代码,包括内存访问优化和计算流程整合。这些优化技术可显著提升AI模型推理和训练性能,适用于算子级、层间、跨层等多种融合场景。
池化算子作为ops-nn仓库的核心算子,通过其高效的实现和性能优化,为深度学习应用提供了强大的池化能力。它不仅降低了特征图维度,还通过灵活的池化策略适应了不同的应用场景。对于AI开发者来说,掌握池化算子的实现和优化技巧,可以显著提高模型的性能。在使用池化算子时,建议开发者
本文主题在生产中可落地为端到端部署:以 OM 模型承载推理服务,接入 AIPP 完成图像或文本前处理,通过 ACL 管理设备资源与多流并发,结合容器与 K8s 形成弹性伸缩与资源隔离,在 CI/CD 中纳入性能基线,定期回归并输出报表。本文围绕主题“核心组件:混合精度 · 路标”展开,聚焦 CANN 在软件栈与工程化的协同:从 GE 的图优化、ATC 转换与 AIPP 前处理,到 ACL 管理的设
本文主题在生产中可落地为端到端部署:以 OM 模型承载推理服务,接入 AIPP 完成图像或文本前处理,通过 ACL 管理设备资源与多流并发,结合容器与 K8s 形成弹性伸缩与资源隔离,在 CI/CD 中纳入性能基线,定期回归并输出报表。本文围绕主题“入门:学习路线 · 复盘”展开,聚焦 CANN 在软件栈与工程化的协同:从 GE 的图优化、ATC 转换与 AIPP 前处理,到 ACL 管理的设备/
本文主题在生产中可落地为端到端部署:以 OM 模型承载推理服务,接入 AIPP 完成图像或文本前处理,通过 ACL 管理设备资源与多流并发,结合容器与 K8s 形成弹性伸缩与资源隔离,在 CI/CD 中纳入性能基线,定期回归并输出报表。本文围绕主题“入门:入门案例 · 答疑”展开,聚焦 CANN 在软件栈与工程化的协同:从 GE 的图优化、ATC 转换与 AIPP 前处理,到 ACL 管理的设备/
本文主题在生产中可落地为端到端部署:以 OM 模型承载推理服务,接入 AIPP 完成图像或文本前处理,通过 ACL 管理设备资源与多流并发,结合容器与 K8s 形成弹性伸缩与资源隔离,在 CI/CD 中纳入性能基线,定期回归并输出报表。本文围绕主题“入门:硬件与平台 · 案例”展开,聚焦 CANN 在软件栈与工程化的协同:从 GE 的图优化、ATC 转换与 AIPP 前处理,到 ACL 管理的设备
ops-cv、ops-transformer、SiP库作为CANN生态的核心专用算子库,分别聚焦AIGC多模态生成的视觉、Transformer、信号处理三大核心环节,各有侧重、协同互补。依托CANN的算力底座与生态支撑,三大库构建起AIGC多模态生成的全链路加速体系,破解了AIGC落地的效率瓶颈与部署难题。
摘要:本文深入解析CANNRuntime动态库加载机制,重点阐述dlopen/dlsym调用链的核心实现。通过分析符号解析、版本校验等关键技术,结合性能测试数据(内存占用降低40-60%),揭示按需加载的设计优势。文章提供完整代码示例、故障排查指南及优化技巧,分享企业级应用案例(推荐系统性能提升140%)。最后展望AI框架在动态加载技术上的未来发展方向,为开发者提供实用参考。
昇腾CANN在多个行业实现AI应用创新:教育领域通过大小模型协同实现考场作弊行为检测,延迟低至420ms;金融风控系统利用算子融合优化,交易检测延迟降至15ms;智慧农业采用3D视觉技术实现作物表型分析,单株分析时间≤3秒。这些案例展示了CANN如何将芯片性能转化为行业生产力,在国产化硬件上实现高性能AI部署。
本文主题在生产中可落地为端到端部署:以 OM 模型承载推理服务,接入 AIPP 完成图像或文本前处理,通过 ACL 管理设备资源与多流并发,结合容器与 K8s 形成弹性伸缩与资源隔离,在 CI/CD 中纳入性能基线,定期回归并输出报表。本文围绕主题“深入理解:计算架构 · 白皮书”展开,聚焦 CANN 在软件栈与工程化的协同:从 GE 的图优化、ATC 转换与 AIPP 前处理,到 ACL 管理的
TensorMove算子虽然功能简单,但在深度学习计算生态系统中扮演着不可或缺的角色。它是计算图优化、内存管理和数据流控制的基础工具。随着AI计算硬件的不断发展和计算图编译器技术的进步,TensorMove算子将继续在提高计算效率和优化资源使用方面发挥重要作用。对于希望深入了解AI计算底层实现的开发者来说,理解像TensorMove这样的基础算子是如何工作的,是掌握整个深度学习计算栈的重要一步。通
本文主题在生产中可落地为端到端部署:以 OM 模型承载推理服务,接入 AIPP 完成图像或文本前处理,通过 ACL 管理设备资源与多流并发,结合容器与 K8s 形成弹性伸缩与资源隔离,在 CI/CD 中纳入性能基线,定期回归并输出报表。
PadV4Grad作为反射填充操作的反向传播实现,在深度学习训练流程中扮演着不可或缺的角色。通过深入了解其参数设计、约束条件和调用方式,开发者可以更有效地利用这一算子在各种AI应用中。随着CANN生态的不断完善,PadV4Grad等基础算子的优化和发展将继续推动整个AI计算领域的进步。对于希望深入探索PadV4Grad实现细节或贡献代码的开发者,可以参考CANN组织在AtomGit上的开源仓库,了