作者:电子创新网张国斌
过去几年,具身智能最受关注的是大模型、算力、运动控制和执行器。但当机器人真正从实验室走向工厂、家庭和复杂环境,一个更底层的问题开始浮现:机器人究竟是靠什么“看懂”这个世界?
对于人类而言,大量外界信息来自视觉。机器人同样如此。摄像头采集真实世界,视觉算法完成理解,AI模型进行推理和规划,控制系统驱动机器人执行动作,再通过传感器获得新的环境信息。
由此,一个完整的物理AI闭环形成:感知—理解—决策—执行—再感知。
而在这个闭环的最前端,决定机器人究竟获得什么数据的,是CMOS图像传感器。这也是思特威正在切入具身智能的核心逻辑。

在近日ICDIA2026同期举办具身智能生态专题会议上,思特威(上海)电子科技股份有限公司产品总监胡泽望博士在演讲中分享了思特威围绕“高性能图像传感器,让具身智能更好地看到和认知世界”这一策略而展开的技术布局。
“从SmartGS全局快门、近红外增强、高动态范围HDR,到低噪声、低功耗以及视觉传感,思特威正在解决的并不是“机器人有没有摄像头”,而是一个更加底层的问题:机器人如何看得快、看得清、看得暗、看得准,并且看得足够久。”他强调。
一、物理AI的第一道门,是传感器
胡泽望表示,当前多模态大模型为机器人带来了越来越强大的“数字大脑”。模型可以理解场景、进行推理、制定行动计划,但模型本身并不能直接看到现实世界。机器人必须首先通过视觉传感器,把物理世界中的影像转化成数字世界中的数据。

这意味着,具身智能实际上存在一条非常清晰的信息链:现实世界→传感器→感知数据→AI理解→推理规划→控制执行。这与传统机器视觉存在明显区别。传统机器视觉通常针对相对确定的任务,例如检测一个零件、识别一个目标。具身智能面对的却是不断变化的真实环境。

“机器人可能高速转头,也可能快速移动;可能从室内走到室外,也可能突然面对强烈逆光;可能需要在夜间工作,也可能需要用视觉理解机械手与物体的接触。因此,机器人对图像传感器的需求正在从单纯的“成像质量”,变成更加复杂的综合能力。”他指出,“高速度、高感度、高动态范围、低噪声、低功耗,以及更强的环境适应能力是必须的指标。”
他表示与此同时,机器人规模化部署还会带来另一个变化。机器人既是大模型的使用者,也是现实世界数据的生产者。机器人采集真实环境数据,这些数据进入训练体系,模型能力提升后再下发到机器人,最终形成持续迭代的数据飞轮。因此,视觉传感器实际上成为物理AI数据闭环的第一入口。
二、机器人高速运动,需要依赖全局快门
机器人与固定摄像头最大的区别之一,是机器人本身在运动。如人形机器人快速转头,机械臂高速运动,四足机器人奔跑,轮式机器人移动,这些场景都会对图像传感器提出更高要求。
胡泽望指出传统Rolling Shutter(滚动快门)采用逐行曝光,不同行的曝光时间存在差异。当摄像头或者目标高速运动时,就容易产生运动畸变和果冻效应。对于普通影像而言,这可能只是画面不好看。但对于机器人而言,后果可能更加严重。因为这些畸变会进一步影响目标识别、VSLAM、双目定位以及主动避障。
“机器人看到的位置发生偏差,后面的定位、规划和动作都有可能受到影响。因此,Global Shutter(全局快门)成为机器人视觉的重要基础能力。”他指出。

胡泽望表示思特威在这一领域并非刚刚起步。其SmartGS技术平台较早开始探索基于BSI背照式平台的全局快门方案,并采用电压域架构设计,试图在实现全局快门的同时兼顾感度和噪声表现。
从2017年第一代SmartGS产品,到后续400万至900万像素产品,再到新一代产品,思特威持续推动Global Shutter向更高分辨率、高帧率方向发展。
这背后的意义在于:机器人视觉正在从“能看”,进入“高速运动中依然看得准”。
三、近红外增强,不只是为了“夜视”
机器人视觉的另一个特殊场景是低照度。地下车库、仓库、夜间道路,以及采用红外主动补光的环境,都要求Sensor具备更高的近红外感度。如果传感器对红外光的利用效率不足,系统只能通过增加补光强度来获得足够的图像信号。而更强的补光意味着更高的功耗。对于依靠电池工作的机器人而言,这最终会转化成续航问题。

所以,红外量子效率已经不再只是一个Sensor参数,而开始成为机器人系统级指标。胡泽望表示针对这一问题,思特威推出了Micro-Pillar红外增强技术。其思路是在硅表面进行特殊微结构设计,对入射光进行调制,并结合后续工艺和深槽隔离等技术,提高红外光的利用效率。
据介绍,该技术相比传统方案可以显著提升红外量子效率,在850nm波段可达到64%以上。
更重要的是,它带来了一个系统级收益:同样的补光,可以获得更高信噪比;同样的成像质量,则可以降低补光强度。
这意味着Sensor性能的提升最终可以转化为机器人功耗的下降。从产业角度看,这是一个很典型的变化:器件效率提升→补光需求降低→系统功耗下降→机器人续航提升。
四、HDR正在从“拍得好看”变成“看得准确”
实际上,真实世界中的光照环境远比实验室复杂。机器人可能从室内走到室外,也可能直接面对太阳、车灯或者窗户。如果动态范围不足,强光区域会过曝,暗部则容易丢失细节。对于机器人来说,这些丢失的信息并不仅仅影响画面观感,还可能影响目标检测、场景理解和路径规划。
因此,HDR高动态范围对于机器人视觉的意义,已经从“提升照片效果”变成:尽可能保留AI需要的信息。

胡泽望表示思特威在SmartGS平台上进一步加入HDR能力,通过像素层面的设计扩展动态范围,减少对后端多帧算法合成的依赖。他说这对于机器人尤其重要。传统多帧HDR虽然能够扩大动态范围,但面对运动场景时,不同曝光帧之间存在时间差,容易产生拖尾和鬼影,而机器人恰恰处于一个高运动环境。因此,机器人真正需要的HDR是:动态范围更高,同时不能牺牲运动成像。
五、把HDR做进Sensor,背后是另一场“算力战争”
胡泽望表示相比普通HDR技术,思特威另一个关注的方向是InSensor HDR。其核心思路是在Sensor内部实现多档可调HDR,并在保持10bit输出位宽的情况下完成原生HDR融合。

“为什么要把HDR能力前移?因为机器人本身就是一个算力密集型系统。视觉数据从Sensor出来后,还要经过ISP、DDR、AI加速器以及模型推理。每增加一次数据搬运,就意味着更高的带宽、内存和功耗成本。尤其当一个机器人同时搭载多颗甚至十几颗摄像头时,数据吞吐量会迅速增长。如果部分处理能力能够在Sensor端完成,就可以减少后端的数据搬运和DDR缓存压力。”他解释说,“因此,Sensor HDR的价值不仅是“图像更好”。更重要的是让感知能力向Sensor前移。”
这其实代表着机器人视觉传感器正在发生的一种重要变化:那就是Sensor不再只是数据采集器,而正在成为感知链路中的前端计算节点。
六、一台机器人,需要的不是一颗摄像头
胡泽望表示具身智能还有一个明显特点:机器人身上的摄像头会越来越多,而且不同位置承担不同任务。头部需要双目视觉和环境感知;胸部、腰部需要VSLAM和空间定位;手腕需要观察机械手与物体之间的关系;手部则需要近距离视觉;甚至关节位置也可能需要摄像头参与运动捕捉。
这意味着,机器人视觉不会存在“一颗Sensor打天下”的情况。不同位置需要不同的分辨率、感度、视场角、尺寸和功耗。
针对这个需求,思特威目前已经针对双目定位、VSLAM、小型化模组等不同场景布局产品,并覆盖人形机器人、轮式机器人、四足机器人、机械臂等应用。
其产品规划的特点也非常明显:不是围绕某一颗Sensor做文章,而是试图建立一套面向不同机器人部位的视觉产品矩阵。这对于机器人厂商而言可能更加重要。因为机器人最终需要的是一整套感知系统,而不是一颗孤立的图像传感器。
七、从“视觉”走向“视触觉”
如果说前面的技术解决的是机器人如何“看”,那么思特威进一步展示的视触觉方案,则开始进入一个更加值得关注的方向:机器人如何感受自己碰到了什么?
传统触觉传感器通常基于压力传感器,但机器人真正抓取一个物体时,需要获得的信息远不止压力大小。
它还需要知道:物体是否发生滑移?手指发生了怎样的形变?摩擦力来自哪个方向?接触面有什么纹理?压力具体分布在哪里?
胡泽望表示思特威展示的视触觉方案采用了一种不同的思路。在手指表面覆盖柔性硅胶层,并在其中设置标记点阵,再利用光学模组采集点阵在受力后的变化。通过视觉信息,就可以进一步计算压力分布、剪切力、纹理以及滑移趋势。
简单来说:就是用视觉传感器读取触觉,这是一种很有意思的技术路线。因为它把原本难以直接测量的机械形变,转化成了可以被图像传感器采集、处理和计算的视觉信息。
这也意味着机器人感知正在从单纯的视觉,走向:视觉+深度+触觉+力觉的多模态融合。而CMOS图像传感器可能成为其中一个基础感知元件。
八、思特威真正的优势,是技术“外溢”

如果观察思特威进入具身智能的路径,会发现它并不是完全从零开始打造机器人Sensor。恰恰相反,其优势来自过去多年在安防、手机、车载和工业视觉领域积累的技术能力。
安防领域的低照度成像能力,可以迁移到机器人夜间和室内场景;手机领域的低噪声和高动态范围技术,可以服务陪伴机器人、人机交互以及机器人拍摄;工业视觉中的Global Shutter,则天然适合高速运动机器人;近红外增强技术,可以服务主动补光和相关感知;InSensor HDR,则可以进一步降低机器人视觉链路的数据和算力压力。
甚至包括思特威在旗舰手机上量产的高动态范围技术,以及其低噪声技术,也都有向机器人场景外溢的空间。这实际上是一条非常现实的产业路线:不是为机器人重新造一套技术,而是把成熟的影像技术重新组合到机器人身上。
九、机器人的“眼睛”,正在从参数竞争进入系统竞争
过去谈CMOS图像传感器,人们关注的往往是像素尺寸、分辨率、量子效率、动态范围等参数。但进入具身智能之后,这些参数开始通过系统重新定义价值。Global Shutter决定机器人高速运动时能不能看准;红外QE决定暗光环境下能不能看清,以及需要消耗多少补光功耗;HDR决定强光和暗部环境下能否保留关键目标;InSensor HDR决定视觉数据需要占用多少带宽和内存;低噪声决定低照度环境下AI拿到的数据质量;视触觉则进一步决定机器人能否从“看到物体”走向“理解接触”。
这意味着,图像传感器正在从一个独立器件,变成机器人感知系统的一部分。
甚至可以说:未来CMOS图像传感器的竞争,不只是“谁能拍得更好”,而是“谁能让机器人获得更有价值的数据”。
结语:大模型在进化,机器人的“眼睛”也必须进化
胡泽望表示具身智能最终能否真正进入现实世界,并不只取决于模型有多大、算力有多强。它同样取决于机器人能否持续、准确、稳定地获得现实世界的信息。机器人看到什么,决定AI能够理解什么;AI理解什么,又决定机器人最终能够做什么。从这个角度看,思特威布局具身智能的意义,并不只是增加几款“机器人专用Sensor”。
更值得关注的是,它正在把Global Shutter、近红外增强、HDR、低噪声、低功耗以及视触觉等技术逐步组合起来,并根据机器人不同部位和不同任务建立感知产品体系。从头部到手部,从视觉到触觉,从“看见”到“感知”,机器人的感知系统正在变得越来越复杂。而这或许也是具身智能产业下一阶段真正值得关注的变化:
当大模型开始学会思考,机器人产业需要解决的下一个问题,就是让它真正看懂、感受到,并最终理解这个物理世界。
思特威正在做的,正是这条链路最前端的事情——重新定义机器人的“眼睛”。
注:本文为原创文章,未经作者授权严禁转载或部分摘录切割使用,否则我们将保留侵权追诉的权利