在上海和深圳举行的两场 Arm Create 活动中,开发者深入探讨了从基础设施、模型选择、部署、优化和验证等各个环节的关键决策,共同寻找将 AI 模型转化为现实软件应用的最佳路径。
一个性能出色的模型只是开始。构建人工智能(AI)应用,还需要围绕模型架构做出一系列关键决策。当延迟、成本、隐私、功耗以及部署场景等因素开始影响设计时,这些决策往往决定了应用最终的表现。
在 2026 Arm Create 上海站与深圳站的活动现场,开发者通过聆听主题演讲、合作伙伴分享、技术深度解析,以及参与动手实践环节,围绕云、边缘、移动端、图形处理以及物理 AI 等领域,共同探讨了这些相关设计决策。

图:Arm 开发者关系副总裁 Shantu Roy 在 Arm Create活动上发表主题演讲
Arm 最新发布的一系列软硬件成果,也是讨论的核心议题之一。Arm AGI CPU 与全新的 Neoverse CSS N4 为云基础设施提供更多选择;Arm 第二代移动终端计算子系统(CSS for Mobile 2)为移动端带来全新的端侧 AI 体验;Arm Mali G2-Ultra NX 则将神经处理能力引入移动端。与此同时,全新推出的 Arm AI Portal 帮助开发者发现经过验证并针对 Arm 平台优化的模型,了解其与目标平台的适配情况,并获取相关代码和部署工作流。
然而,对于开发者而言,关键并不在于各个平台或工具具备哪些功能,而在于它们能否帮助开发者做出决策、开展实验与测试,并持续优化软件。
在 Arm Create 上海站主题演讲中,Arm 围绕这一行业挑战提出四个关键问题:
- 哪种智能能力适配对应任务?
- 工作负载应当部署在何处?
- 各个组件如何实现系统级协同?
- 应用在真实目标硬件上能否达到预期性能?
随后,通过技术分享与实操实验,进一步总结出开发者构建和部署 AI 的五大关键启示。
一、确定智能体应用所需的基础设施
当应用具备智能体能力后,模型仅仅是挑战的一部分。智能体可动态生成代码、调用工具并执行动作,因此对底层基础设施提出了新的要求。
在 Arm Create 上海站活动中,腾讯云开源 AI Agent 安全沙箱 Cube Sandbox 带来了真实实践案例。现场围绕隔离、并发、安全、状态管理、资源管理、成本等关键问题展开讨论,并探讨了如何在平台层面实现不同工作负载的合理分配,帮助开发者将更多精力聚焦于应用创新本身。

图:腾讯云在 Arm Create 上海站分享了开源 AI Agent 安全沙箱 Cube Sandbox,以及支撑智能体应用所需的基础设施方案。
开发者从中得到的启示在于,智能体应用需要在模型之外搭建一个受控执行环境,从而随着应用规模增长,持续对工具调用、操作执行、状态信息和计算资源进行一致管理。
二、匹配工作负载,选择合适模型
模型选型要以工作负载为出发点,不能只看模型规模。移动应用中的即时响应功能、能够对海量文档进行云端推理的智能体,以及边缘视觉工作负载,都可能将模型选型引向截然不同的方向。
在 Arm Create 深圳站活动中,来自阿里巴巴通义千问、面壁智能、腾讯混元及 Ultralytics 的嘉宾共同参与专题讨论。讨论重点不再局限于模型之间的比较,而是聚焦于应用适配性:工作负载的需求、运行部署的位置,以及部署之后的实际表现。核心原则十分明确:让模型匹配任务,让任务运行在最合适的位置。
Arm AI Portal 正是围绕这一需求打造。它帮助开发者发现经过验证并针对Arm平台优化的模型,评估模型与目标硬件的适配性,并获取代码与部署信息,从而缩短从模型评估到实际落地的周期。

图:开发者可借助 Arm AI Portal,基于性能数据评估模型在特定 Arm 平台上的适配情况,从而为模型选型与部署决策提供参考。
三、评估并优化整个应用
当 AI 应用出现响应延迟、效率不佳等问题时,模型并非唯一的排查方向。运行时环境、数据传输、预处理流程、应用逻辑或底层计算,同样会消耗时间与资源。例如,语音助手的性能瓶颈可能出现在音频预处理环节;移动端 AI 功能持续运行时,则可能触及内存上限或散热限制。
因此,覆盖整个系统的性能分析与优化已成为开发流程的一部分。Arm 提供多款工具与技术支撑该流程:Arm Performix 和 Arm Performance Studio 可帮助开发者了解工作负载在何处消耗时间与资源;第二代 Arm 可伸缩矩阵扩展技术(SME2)和神经图形工具则提供了在基于 Arm 架构平台上提升性能的不同途径。真正有效的优化,应建立在工作负载分析所得数据的基础之上,并围绕最关键的约束条件展开,包括响应时延、功耗、成本、持续性能等方面。
对于云端工作负载而言,优化可能是定位 CPU 或内存热点,进而提升工作负载对现有计算资源的利用效率;对于移动 AI,这意味着在响应速度与功耗之间取得平衡;而对于图形工作负载,则需要在保持图像质量的同时兼顾画面流畅度和热裕量。
四、确定每项工作负载的最佳运行位置
并非所有 AI 应用组件都应该部署在同一位置。开发者需要判断:哪些工作负载应当在设备本地运行;哪些适合依托就近的边缘基础设施;哪些需要借助云端的规模化能力和共享服务。
计算能力决定了工作负载“能够”运行在何处,而产品需求则决定了它“应该”运行在何处。延迟、隐私保护、离线运行能力、本地控制、成本以及可用算力,都会影响这一部署选择。单个应用可把工作拆分至多个不同位置执行。目标并非为整个应用寻找单一部署地点,而是在每个功能模块的需求基础上,将其放置在最适合的位置。
Arm 计算平台覆盖云端、边缘、移动设备和图形计算等多种部署场景,而 Arm AI Portal 则帮助开发者将模型选择与具体的 Arm 目标平台及部署路径关联起来。
五、保持工作流可移植性,并在真实目标平台上验证
AI 应用很少会始终停留在同一个环境中。团队可能在本地完成原型开发,在云端开展测试,将部分工作负载迁移至设备端,再针对移动、边缘、图形或物理 AI 目标做优化。如果模型、运行时、工具链和性能工作流每次都要彻底更换,这种迁移就会带来更多工作量。
在 Arm Create 上海站对话环节中,阿斯顿·马丁沙特阿美 F1 车队的 Eric Ernst 与来自宇树科技的陈小立以 F1 赛车与人形机器人为例,探讨了一个工程挑战:软件、硬件、数据、传感器以及控制系统必须在复杂的真实物理环境中协同工作,而这些环境中的实际情况往往无法完全预测。

图:Arm、阿斯顿・马丁沙特阿美 F1 车队以及宇树科技,共同探讨复杂物理场景下软件与硬件如何实现协同运行。
这也使得可移植性与验证成为紧密关联的问题。如果模型、运行时环境、工具链和性能工作流不断变化,那么每一次在云端、边缘侧、移动端、图形和物理 AI 之间的迁移,都会带来额外的复杂性。因此,开发者需要尽可能采用能够随应用迁移而保持一致的工具、模型、库文件和工作流。同时,无论前期仿真和测试多么完善,最终验证仍然必须在产品实际运行的目标环境中完成。Arm Create 的物理 AI 动手实践课程进一步延伸了这一理念,涵盖从仿真到机器人的工作流、应用部署、信任机制、遥测能力、设备发现等主题开展实践。
在这一过程中,SME2、KleidiAI、Arm Performix、Arm 模型上下文协议(MCP)服务器、神经图形工具、Arm Device Connect 和 Arm AI Portal 分别支持工作流中的不同环节,帮助开发者完成从模型发现、工作负载优化和性能评测,到智能软件与设备连接的各项关键任务。

图:在 Arm Create 现场,Arm Device Connect 展示了用于连接 AI 智能体与物理设备的开放层。
归根结底,核心实践经验是:尽早考虑可移植性;在部署选择变化时尽可能保持工作流一致;并在最终目标平台上对完整系统进行验证。
为下一代创新而构建
展示 AI 开发的实际方法与最佳实践,正是 Arm Create活动的意义所在。在上海和深圳两场活动中,开发者从主题演讲中的理念出发,进一步参与技术深度解析、现场演示、动手实践课程以及与 Arm 工程师和生态合作伙伴的直接交流。这种沉浸式实践体验也为开发者后续的开发工作提供了清晰路径。在 Arm Create 上海站活动调查中,97% 的受访者表示,活动加深了他们对于如何在 Arm 平台上构建、优化和部署 AI 应用的理解。

图:Arm Create 活动中,在 Arm 平台优化代码的演示,吸引开发者驻足
随着 AI 应用覆盖越来越广泛的目标场景,开发者关注的目标已不再只是针对单一平台进行优化,而是在不同部署场景之间保障代码、工具、技能以及性能工作流的连续性。开发者需要的是一种能够伴随应用一起迁移的工作流,而不是每次切换部署场景都从头开始。统一的 Arm 架构和软件基础,正帮助开发者将已有成果持续延伸至云端、边缘、移动设备、图形计算和物理 AI 等不同应用部署场景。