跳转到主要内容

重磅发布|玄铁端侧 AI 解决方案,为端侧 NPU 打造可编程底座

9 月 9 日,达摩院玄铁正式发布端侧 AI 解决方案。方案由 AI 定制调度核、Titan 高性能向量引擎、配套算子库与编译工具链三部分构成,为 NPU 厂商提供成熟、灵活、可配的可编程底座,让厂商把研发资源集中到 Tensor Engine 与存储系统等自有差异化能力上,加速端侧 AI 在穿戴设备、智能家居、智能安防、边缘计算、AI PC、智能座舱、具身智能等场景的落地。

端侧推理进入“组合爆炸”时代

NPU 面临全新考验

推理正在从云端走向端侧。低时延、数据隐私、离线运行与传输成本,共同推动 AI 能力向设备侧下沉。但这个“端”并非单一形态——从穿戴设备、智能家居、智能安防,到边缘计算、AI PC、智能座舱、具身智能,功耗与算力从 mW 级到车规级,跨越多个数量级。

与此同时,端侧算法日益多样:CNN 视觉之外,LLM、VLM、语音识别、语音合成、扩散生成、全模态模型接踵而至。算子构成差异极大——Softmax、归一化、RoPE、量化与数据重排的比重明显上升,且每年都在变化。场景与算法相互叉乘,同一颗端侧 NPU 要面对的组合正在快速放大。

三大板块接入

为端侧 NPU 打造可编程底座

一颗完整的 NPU,是控制、计算与数据供给三层协同的系统:Tensor Engine 提供峰值算力,但端到端推理时间由三层共同决定。对 NPU 厂商而言,真正的差异化在于 Tensor Engine 与存储系统;而调度、通用向量计算与配套软件,是需要长期工程积累的公共底座,自建周期长、验证成本高,往往成为产品上市节奏的瓶颈。

针对上述挑战,玄铁团队推出端侧 AI 方案,为端侧 NPU 打造可编程底座。通过提供经过验证的调度、向量与软件底座;厂商可直接接入,激活 Tensor Engine 与存储系统,各展所长。

AI 定制调度核:把可编程控制放进 NPU

基于玄铁 C 系列处理器为 NPU 调度场景深度定制。指令预取与 ITCM/DTCM 让控制程序与描述符常驻,访问延迟确定,命令生成不断供;循环分支控制、Tile/Shape/地址参数计算、宏命令封装与分发形成完整控制闭环;custom0–custom3 自定义指令直接转发,最多支持 32 个协处理器,命令语义可用寄存器操作数直接表达。模型变化的时候,改程序就行,不用改状态机。

Titan 高性能向量引擎:灵活计算、可整体选配

面向 AI、向量宽度 VLEN 可配 512 / 1024 / 4096 bit,达业界最宽档位;在 RVV 1.0 标准之上叠加 66 条玄铁 Vector 扩展指令:

  • 特殊函数指令 9 条:直接支撑 Softmax 与激活
  • 类型转换指令 9 条:支撑量化与反量化
  • 二维归约指令 24 条、点积与低精度整数指令 22 条:针对大模型场景优化

理论建模数据显示(Qwen3-1.7B、FP16、序列长度 4096 条件),向量宽度从 256 bit 加宽至 4096 bit,Softmax 耗时缩短至约 1/15,端到端首字时延(TTFT)提升 2.26 倍,序列越长收益越明显。

177 个算子与完备工具链:交付可运行、可调、可迭代的软件栈

算子库覆盖 12 个类别、177 个算子,从数学运算、张量操作、卷积融合到量化与类型转换,贯通完整推理链路,并为客户自定义算子提供统一基础;GCC / LLVM 编译工具链、Runtime、调试器与性能分析工具随方案一同交付。

算子库、编译工具链与硬件指令三层对齐,厂商选择不同向量宽度或裁剪能力时,改动收敛在编译期——裁剪不等于重新维护一套软件。

五个维度灵活可配

按场景选配,按需求裁剪

为适配端侧多样化的场景与需求,助力客户围绕自身目标场景,定义一颗性能、面积与功耗精准匹配且更具竞争力的芯片;该方案在五个维度提供灵活的可配可裁能力。

阿里巴巴达摩院玄铁 RISC-V IP 解决方案负责人黄怡皓表示:

端侧 NPU 的差异化,很大程度来自 Tensor Engine 与存储系统,这是厂商应当牢牢握在手中的核心竞争力。玄铁推出可编程底座,是希望把需要长期工程积累的调度、通用向量计算与配套软件承担起来,授人以渔,让 NPU 厂商用得方便、改得自由,把研发资源集中到最有价值的差异化创新上。这也是 RISC-V 架构开放、灵活特性在端侧 AI 时代的又一次生动实践。

来源:XuanTie玄铁