格灵深瞳 WAIC 首发 VE²S-GBOX,视觉 AI 落地业务现场

发布时间:2026/7/22 10:45:14
格灵深瞳 WAIC 首发 VE²S-GBOX,视觉 AI 落地业务现场 当 AI 开始走出数字世界进入真实业务现场行业关注的问题也正在从大模型能做什么转向模型能力如何变成可以长期、稳定运行的产品。一个新场景如何更快启动面对不断出现的长尾问题算法如何持续迭代在不同设备、算力与业务流程中模型能力又如何真正进入现场2026 WAIC 期间格灵深瞳以生态合作形式分别在百度、海光信息和瑞芯微展台展示视觉智能工坊 VE²S 及其在视频解析、泛安防和工业质检等场景中的应用。此次首次线下公开亮相的VE²S-GBOX也让从云端算法生产到现场推理、执行与数据回流的完整链路有了更加具象的产品载体。AI 原生架构构建视觉智能体系在百度展台格灵深瞳重点展示了视觉智能工坊 VE²S 的整体产品架构以及 VE²S-GBOX 的硬件形态。VE²S-GBOX 亮相百度展台现场但 VE²S 并不是一个盒子。它是一套面向真实行业场景打造的 AI 原生的视觉智能产品体系打通数据采集、智能标注、模型训练、算法运营、边缘部署、业务反馈与模型迭代帮助客户围绕自身业务持续生产、运营和优化视觉智能能力。在这套体系中MENTOR面向云端或中心侧负责数据处理、模型训练、效果评测与算法持续迭代EXPERT承接算法全生命周期运营将通用模型能力转化为适配客户业务的专属算法GBOX则进入靠近摄像头、产线和设备的业务现场完成设备接入、数据采集、边缘推理、事件判断、结果回传与数据回流。三者共同形成一条从“现场运行—数据回流—算法迭代—再部署”的持续进化链路也构成了视觉智能工坊 VE²S 的端到端产品体系。这里的端到端不仅是从模型训练到边缘执行的技术链路也是从客户提出需求到产品真正进入业务流程的落地链路。客户需要的不只是某一个算法而是从算法训练、算法运营到现场执行与反馈都有可使用、可持续的产品承接。正如格灵深瞳CEO吴一洲在 WAIC 现场接受采访时所说最终交付的不是一个模型或技术名词而是客户拿来就能用的产品。新场景可以先借助多模态能力完成冷启动再利用现场数据逐步提升效果高频、稳定的任务交给小模型实时运行复杂理解和长尾问题则由大模型参与分析与研判。大模型负责复杂理解小模型承担高频执行真实现场的数据再不断回到算法生产体系中推动能力持续迭代。全目标解析深入行业应用在海光信息展台格灵深瞳展示了全目标视频解析能力与深眸视觉智能工坊简称“深眸”。深眸亮相海光信息展台现场全目标视频解析可面向人脸、人体、车辆、非机动车及事件等目标进行统一结构化分析并结合海光信息的算力底座呈现视觉算法在多元算力生态中的适配与部署能力。在此基础上深眸进一步将视觉智能工坊 VE²S 的通用能力转化为面向泛安防场景的具体应用。它以公共安全算法为基础融合格灵深瞳自研的泛安防行业化多模态大模型贯通新场景模型训练、复杂任务编排、边缘推理与数据回流可应用于社会治安防控、重点区域管控、办案中心合规及城市治理等场景。面对人员聚集、异常行为、违规排查、生态治理、灾害预防等事件深眸不只识别目标还会结合多模型能力与业务规则对告警进行筛选和研判让识别结果真正进入业务流程。这也体现了格灵深瞳对“做深”的理解不是试图替代行业专家而是把从基础模型、工具链到落地产品的每一个环节做成可用的工具让技术人员与行业专家能够共同参与视觉能力的生产、运营与迭代。从技术团队帮助专家使用到陪伴专家使用再到行业专家能够围绕自身业务自主生产和运营所需能力正是 VE²S 面向大量行业长尾需求所要解决的问题。质检能力下沉扎进生产现场在瑞芯微展台格灵深瞳则以玩偶外观质检为例展示 VE²S-GBOX 如何进入工业质检现场。VE²S-GBOX 亮相瑞芯微展台现场VE²S-GBOX 在端侧完成采集、计算与推理对划痕、气泡、异色、缺胶等缺陷进行定位并输出检测结果。面对不同尺寸、造型和 SKU也可以通过切换采集配方与模型组合快速适配新的产品类型。质检过程中产生的疑难样本也不会停留在现场。这些数据可以持续回流至 MENTOR通过大小模型协同训练、评测和算法迭代形成适配客户生产需求的专属算法再部署回现场。由此形成一条能够伴随生产持续运行的数据闭环让质检能力可以随着真实业务不断进化。但 GBOX 的价值并不只是把算法装进一个盒子。吴一洲在采访中提到端侧产品不能仅停留在视觉算法和硬件形态上而要进一步形成业务层的判断、执行与反馈能力。只有模型、视觉智能、智能体与现场设备真正协同端侧交付的才不只是算法而是能够进入业务流程的判断结果与执行能力。自研模型筑基转化产品能力支撑这套产品体系持续运行的是格灵深瞳在视觉基础模型与多模态大模型方向的长期积累。自研视觉基础模型系列 GLINT-MVT为图像和视频理解提供通用视觉表征能力可支撑目标识别、分类、分割、检索及多模态应用。多模态大模型 GLINT-VL的相关成果先后以 LLaVA-OneVision-1.5 和 LLaVA-OneVision-2.0 的名义全面开源。其中LLaVA-OneVision-2.0 原生支持长视频全帧率理解在保留全帧率感知能力的同时有效降低视频 Token 消耗进一步提升长视频理解、目标追踪、空间定位及复杂事件分析等任务的处理效率。视觉智能工坊 VE²S 让模型与客户数据结合形成专属算法并贯通算法生产、运营与现场执行使技术真正转化为客户拿来就能用、可以持续运营和迭代的产品能力。从自研视觉模型出发经过算法生产与运营最终进入不同算力、设备和业务流程并在真实现场持续获得反馈与迭代这正是视觉智能工坊 VE²S 所构建的完整产品链路。未来格灵深瞳将继续围绕视觉智能工坊 VE²S推进视觉基础模型、多模态大模型、算法生产平台与边缘软硬件的协同创新让视觉智能从一次性交付走向可持续运营从“看见画面”进一步走向理解物理世界、服务真实业务。让视觉智能真正进入现场也在现场持续进化。