从“看见风险”到“理解风险、规划任务并推动整改”,建筑安全正在成为AI智能体进入真实物理世界的一块试验田。更值得关注的是,这背后并不是简单地把一个大模型搬到工地,而是一场围绕异构算力、边缘部署、多模态感知和大小模型协同的系统重构。
9月17日,英特尔与深圳市震有智联科技有限公司宣布推出“智联建安”建筑施工安全管理垂直行业应用大模型及AI智能体系统。从产品表面看,这是一套面向建筑施工安全的AI方案:通过视觉、传感器、安全头盔等设备获取现场信息,再借助垂直大模型和AI智能体进行隐患识别、任务规划和安全管理。
但如果把视角拉高一些,会发现这件事的意义并不只在“建筑安全”。
过去几年,AI产业的主线一直是更大的模型、更强的GPU和更集中的云端算力。但当AI真正进入工地、工厂、交通、能源等物理场景之后,问题突然变了:
现场真的需要一个几万亿参数的模型吗?答案可能并不是。
对于一个建筑工地来说,更重要的往往是:能不能在网络不稳定时继续工作?能不能在几百毫秒甚至更低时延内发现风险?能不能同时处理视频、图像、传感器数据和文本规范?能不能理解企业自己的SOP?发现问题以后,能不能继续推动检查、整改和复核?
这也意味着,AI从“回答问题”走向“解决问题”之后,计算架构本身正在发生变化。
01、工地不是数据中心,AI进入物理世界后规则变了
英特尔中国行业与解决方案业务部总经理王景佳在现场谈到一个非常现实的问题:在互联网场景中,用户可以连接云端的大模型,但到了工业、建筑等物理场景,并不是所有问题都需要一个超大参数模型。
施工现场需要的是一个响应及时、能够离线运行、理解行业知识,并且能够在现场直接执行任务的AI系统。
这其实点出了AI从数字世界进入物理世界后的第一个变化。在ChatGPT式应用中,用户提出一个问题,模型给出答案,几十秒甚至几秒的等待可能都可以接受。
但在工地上,“有人进入吊装危险区域”与“有人进入吊装危险区域后几秒再提醒”,完全是两回事。
更不用说施工现场还有大量复杂条件:多路摄像头持续产生视频流;烟尘、遮挡、逆光影响视觉识别;安全帽、传感器等终端持续产生数据;现场网络条件并不稳定;不同任务对时延的要求完全不同;同时还存在视频编解码、数据存储、模型推理、智能体调度等传统计算任务。
因此,建筑安全AI面对的并不是单一的“大模型推理”问题,而是一个典型的混合负载计算问题。
震有智联CTO、首席工程师刘向华在媒体专访中明确提到,真实工业场景的负载并不只是模型推理,还包括工业传感器解析、视频编解码、边缘AI推理以及智能体调度。
这恰恰是“边缘智能体”与传统AI应用之间最大的区别之一。
02、AI智能体进入工地,CPU、GPU不再是“二选一”
如果把“智联建安”的计算架构拆开看,会发现它并没有试图用某一颗芯片解决所有问题,而是在构建一个典型的异构计算体系。
英特尔提供的行业大模型一体机,以至强处理器作为基础,并可以配置最多8块锐炫Pro B60 GPU。
其中,至强CPU承担通用计算、任务调度以及部分AI负载;锐炫GPU则承担更重的模型推理和多模态计算。B60拥有24GB显存、456GB/s显存带宽以及197 TOPS峰值算力,可以为本地多模态模型推理提供算力基础。
但更值得关注的其实不是这些硬件参数,而是背后的XPU思路。
王景佳在采访中提到,英特尔在AI场景下强调XPU,即CPU、GPU、NPU并不是互相替代,而是根据不同工作负载进行组合。建筑施工安全场景中,视频分析、Transformer任务、智能体调度等任务对于Token吞吐、并发和实时性的要求并不相同。
这意味着未来的行业AI服务器,很可能越来越不像传统意义上的“AI服务器”。
传统AI基础设施更关注一个核心问题:单位时间能够跑多少模型。而行业AI基础设施需要回答的是:一台设备同时能够把多少种任务跑起来,而且彼此不要互相拖累。比如:摄像头把视频送进来,首先需要视频编解码;视觉模型负责识别安全帽、人员、起重设备;传感器负责提供环境信息;CPU负责数据处理和任务调度;GPU负责较复杂的模型推理;更轻量的模型可以运行在NPU或者边缘设备上;智能体则进一步理解这些结果,决定“接下来应该做什么”。
所以,这里真正需要的不是单一算力峰值,而是计算资源调度能力。
这也是为什么英特尔强调,CPU、GPU、NPU可以被组合到同一个系统中,并根据负载灵活分工。
03、为什么“边缘智能体”比“边缘大模型”更值得关注?
如果只是把大模型部署到边缘设备,严格来说,这还只是“边缘AI”。真正发生变化的是AI开始拥有了任务规划能力。英特尔技术专家把边缘智能体描述为一种把大模型和智能体结合起来、进一步贴近用户实际场景的计算方式。
在这种架构中,终端设备负责感知和交互,而更强的边缘计算设备则承担类似“大脑”的角色,负责思考、规划、指挥、记忆和存储。
这与传统视频AI有明显区别。过去的系统可能是:摄像头 → AI算法 → 发现有人没戴安全帽 → 报警。现在的智能体系统则可能进一步变成:摄像头/传感器 → 多模态感知 → 判断风险 → 查询施工规范 → 分析风险等级 → 规划检查任务 → 通知安全员 → 要求整改 → 再次采集现场证据 → 判断是否完成整改。
这时候,AI的角色已经从“识别器”变成了“现场安全助手”。
刘向华介绍,“智联建安”会结合安全头盔、现场传感器等物联网能力,让智能体实时感知现场,自主采集现场证据,并安排当天需要重点关注的检查流程和注意事项。
这也是为什么“Agent”对于工业AI的重要性可能比对于普通办公场景更加明显。工业现场真正缺少的,往往不是一个会回答问题的AI,而是一个能够感知—判断—规划—执行—复核的系统。
04、垂直大模型真正的价值,不是“更大”,而是“更懂现场”
建筑安全AI还有一个很现实的问题:幻觉。刘向华表示一个通用大模型可以告诉你什么是“高处作业”,但真正到了施工现场,它必须知道:这个作业环境有什么风险?企业自己的SOP是什么?当前项目采用什么标准?类似隐患过去发生过多少次?这个风险应该由谁处理?整改之后如何验证?
这时候,模型参数量并不是决定效果的唯一因素。真正重要的是行业数据、行业知识和现场反馈形成的闭环。
刘向华表示其垂直模型使用了合作伙伴多年积累的项目隐患数据、图文数据、企业内部规定以及SOP等信息,同时结合保险公司关注的事故风险进行模型优化。
这实际上是一条非常典型的行业大模型路径:通用模型 → 行业数据 → 行业知识 → 专业模型 → 现场验证 → 反馈数据 → 持续迭代。尤其值得关注的是,震有并没有把模型训练看成一次性工作。在实际项目中,如果系统发现一个风险,可以通过现场传感器、照片以及人工巡检再次采集证据,然后进行复核。
这就形成了:发现问题 → 人工确认 → 现场复核 → 获得新数据 → 优化模型。这比简单地“拿行业资料训练一个模型”要更接近真正的工业AI闭环。
05、一个非常有意思的方向:大模型训练“小模型”
这套方案中还有一个值得行业关注的技术路线——大小模型协同。刘向华透露,震有会利用较大的模型进行数据标注和能力迭代,再训练更小的模型,最后把小模型部署到更加靠近现场的边缘盒子中,用于实时分析。
这其实解决了一个行业AI绕不开的问题:不是所有AI任务都值得调用大模型。比如,“有没有戴安全帽”这样的任务,如果一个轻量视觉模型已经能够高准确率完成,就没必要每次都调用一个大参数模型。
而当系统遇到复杂情况,比如:“某人员进入危险区域,同时现场存在吊装作业,这种情况下是否违反当前施工规范?”这时候才需要更复杂的模型和智能体进行推理。于是,一套成熟的边缘AI系统可能形成这样的层次:小模型负责高频、低时延任务;大模型负责复杂理解和推理;智能体负责任务编排;CPU负责系统调度;GPU负责高并发模型计算;传感器负责实时感知;云/数据中心负责更重的模型训练和复杂任务。
这比单纯讨论“GPU算力有多高”更加接近未来行业AI的真实形态。
06、多模态的下一步,不只是摄像头
建筑工地的另一个问题,是纯视觉并不可靠。烟尘、遮挡、夜间环境以及复杂施工条件,都可能让摄像头失效。
采访中,笔者询未来震有是否会纳入毫米波雷达、红外等感知手段,刘向华明确表示,纯视觉确实存在局限,而毫米波雷达具备穿透遮挡的能力,相关混合负载方案已经在其他项目中得到应用。
这意味着行业AI的“多模态”正在发生一个很有意思的变化。过去谈多模态,更多是:文字 + 图片 + 音频 + 视频。而进入物理世界之后,多模态开始变成:视觉 + 毫米波 + 红外 + IoT传感器 + 位置 + 环境参数 + 人的行为。再往前走,甚至还会加入机器人系统中的触觉、力学等数据。
王景佳也提到,随着行业AI发展,仅依靠文字语料已经不够,未来还需要视觉、各类传感器,以及具身智能中的触觉、力学等多样化数据输入。
所以,真正的“全模态AI”最终可能不是一个模型的问题,而是一个感知系统+计算系统+智能体系统的问题。
07、OpenVINO的意义:行业AI最后拼的不是Demo,而是单位成本下的效率
当模型进入真实工地,另一个问题马上出现:成本。如果每一个工地都部署一套昂贵的大模型服务器,商业模式很难成立。
所以,行业AI必须同时回答三个问题:准确率够不够?时延够不够低?成本能不能接受?英特尔在这一层提供的并不只是芯片。
王景佳介绍,英特尔通过OpenVINO等软件工具,对CPU、GPU等产品进行统一的软件优化,并针对行业模型进行量化、推理以及底层调度优化。
其中,量化尤其重要。模型越来越大,计算量越来越高,而行业现场又不可能无限增加算力,因此4bit、8bit等多精度量化技术就成为实际部署中的重要工具。
更关键的是,施工现场并不是纯AI计算环境。视频编解码、转码、视频分析、数据传输等任务本来就存在。所以真正的优化目标不是:让Transformer跑得最快。而是:让视频+AI+传感器+智能体+业务系统整体跑得更高效。这也是oneAPI等软件工具存在的重要价值——解决底层多路并发和业务调度问题。
换句话说,行业AI真正进入商业化阶段以后,拼的很可能不再只是TOPS,而是:TOPS/W、TOPS/元,以及一套系统究竟能够解决多少真实问题。
08、端、边、云:未来不会只有一个“AI大脑”
从部署形态来看,“智联建安”采用的是比较典型的端边云协同架构。
在工地现场,边缘盒子可以承担需要快速响应的任务,实现毫秒级处理;对于一些延迟要求相对宽松的隐患排查和复杂模型请求,则可以交给本地数据中心或私有云。
因此,未来行业AI很可能不是一个“大模型包打天下”的架构,而是一套分布式智能系统。
可以把它理解成:端——负责感知。边——负责实时判断和执行。中心——负责复杂推理和模型管理。训练系统——负责持续学习。
这也解释了为什么英特尔在此次方案中同时展示了酷睿Ultra、锐炫GPU、至强服务器以及不同形态的边缘设备。从边缘盒子、边缘工作站到边缘服务器,不同设备承担不同规模的模型和不同强度的工作负载。
这其实是一种非常典型的异构计算向行业纵深发展的趋势。
09、建筑安全只是开始,真正的目标是“AI+Vertical”
如果仅仅把这次合作理解成英特尔进入建筑安全市场,显然低估了它的意义。英特尔真正想验证的,是一套“AI+行业”的方法论。王景佳在现场提出三个判断标准:第一,必须解决真实问题,而不是“拿着榔头找钉子”;第二,技术上必须真正可达成;第三,商业上必须具备价值,不能只是一个炫酷Demo。
这三个标准,其实恰好也是今天整个行业AI正在经历的转折。
过去两年,AI产业最容易证明的是:“AI能做到什么。”接下来真正需要证明的则是:“AI能不能在一个具体行业里长期工作。”
这两者完全不是一个难度。
建筑工地只是一个非常典型的验证场景:环境复杂、数据多样、实时性要求高、网络条件不确定、设备成本敏感,而且安全场景本身对误报和漏报都非常敏感。
如果一套系统能够在这里跑通,它背后的计算架构、软件栈、模型压缩和端边云协同能力,就具备向更多物理行业迁移的可能。
事实上,英特尔已经明确表示,未来希望将相关能力从安全管理进一步拓展到质量管控、绿色施工和进度优化等场景。
10、AI真正进入产业深水区,拼的是“系统工程”
从这次英特尔与震有智联的合作来看,一个越来越明显的趋势正在出现:AI进入物理世界之后,竞争的核心正在从“谁的模型更大”,逐渐转向“谁能把模型、算力、数据、传感器、软件和行业流程真正连接起来”。
建筑安全只是一个缩影。它需要的不只是GPU,也不只是大模型。
需要CPU负责系统调度,需要GPU承担模型推理,需要轻量模型完成实时感知,需要传感器提供真实世界数据,需要OpenVINO等软件栈完成模型优化,需要智能体进行任务规划,还需要行业数据不断反馈模型。
最终形成的是一个完整闭环:感知 → 理解 → 推理 → 规划 → 执行 → 复核 → 学习。而这恰恰是AI从“数字助手”迈向“物理世界智能体”的关键一步。
对于英特尔而言,建筑安全也许不是一个单独的行业机会,而更像是一次架构验证:当AI不再只存在于数据中心,而是开始进入工地、工厂、交通和城市,CPU+GPU+NPU的异构计算,以及端+边+云的分布式部署,会成为支撑这类AI应用的重要底座。
这时候,AI算力的竞争也会发生变化。这或许才是AI真正进入千行百业之后,最值得关注的变化。大模型解决的是“懂不懂”,智能体解决的是“会不会做”,而边缘异构计算解决的,则是“能不能在真实世界里持续做”。
建筑安全,只是这场变化刚刚露出的一个切面。
注:本文为原创文章,未经作者授权严禁转载或部分摘录切割使用,否则我们将保留侵权追诉的权利。