在5月8日至10日于武汉举办的VALSE2026(视觉与学习青年学者研讨会)上,极视角算法专家邓富城分享了该公司在视觉语言大模型(VLM)技术研发与工程化落地方面的实践路径。作为本届大会的深度合作单位,极视角携其算法开发者社区“极市平台”亮相,并展示了其面向产业侧自研的新一代多模态视觉语言大模型——星际视觉语言大模型。
结合极视角过去十年积累的AI视觉技术与产业场景经验,邓富城指出,当前产业领域的应用需求呈现明显的“二八原则”分布:约80%属于细粒度定位感知问题,20%属于复杂推理理解问题。
尽管通用小模型已有成熟的工程链路,大模型也展现出更强的泛化能力,但在真实多变的业务场景中,提升模型的细粒度感知与理解能力,仍是尚未被完全解决的关键问题。极视角研发“星际视觉语言大模型”的出发点,正是面向这一产业需求,重点解决细粒度图像与视频的感知理解。
在技术架构演进方面,多模态视觉大模型正从“闭集目标检测/分割”向“开集目标检测/分割(OVD/OVS)”、从“单词级别”向“短句级别(指代表达理解REC)”、从单任务向多任务多模态方向不断突破。
基于这一趋势,极视角选择了当前主流的拼接式架构,即“视觉编码器+投影器+语言模型”的经典结构。据悉,这一选择有助于继承每个阶段的技术成果,并将研发重心集中在后训练阶段进行针对性优化,使模型适配产业落地需求。
大模型训练依赖高质量数据与高效的数据处理流程。极视角基于多年来积累的超过10亿条真实业务原始数据,搭建了一套覆盖自动化清洗、标注、验证与迭代的全流程闭环数据引擎。
这一流程包括通过自动化清洗系统去除冗余与噪声,形成低重复、标准化的数据;再经由基于任务的自动化标注系统完成多模态数据标注;辅以人工验证环节确保准确性。此外,训练优化后的“星际视觉语言大模型”具备较强的图像理解和目标定位能力,可反哺自动化标注环节,形成数据正向循环,持续提升数据质量与模型能力。
在实际训练中,极视角的策略是在保持模型通用能力的同时,强化产业场景下的细粒度定位、感知与理解能力,并有针对性地抑制幻觉。为此,其采用互联网图文数据与大量产业真实场景数据混合训练,并采用分阶段策略:
在监督微调(SFT)阶段,先通过全量微调(Full Finetune)奠定通用能力基础,再使用高效微调(LoRA Finetune)进行性能优化。
在基于GSPO的强化学习(RL)阶段,重点强化定位类任务的学习,根据任务类型设计奖励函数,以提升定位精度与业务理解能力。
邓富城博士在分享中介绍了“星际视觉语言大模型”所具备的八大能力,并重点聚焦开放词汇目标检测(OVD)、指代表达理解(REC)与视觉问答(VQA)三个关键维度,旨在让大模型实现“理解深、看得懂、看得准”。
? 开放词汇目标检测(OVD):支持输入任意词汇指令,例如“车辆”“垃圾”“危险物品”“火焰”等,模型即可识别对应目标并输出定位框,覆盖从生活到产业的“万物识别”需求。
? 指代表达理解(REC):支持解析复杂自然语言指令,具备精准定位特定目标的能力。输入短语级描述,如“压线行驶的车辆”“河面上黄色的渔网”等,模型可快速识别对应目标并输出边界框坐标,满足复杂场景下的目标定位需求。
? 视觉问答(VQA):无需预设问题模板,支持基于图像内容的关联问答交互。模型可快速输出画面关联解读、结构化分析和推理分析,覆盖状态研判、数量统计与关系推理等多维任务需求。
谈及大模型的长远发展,邓富城表示,当前视觉语言大模型在产业领域的落地仍处于早期阶段。产业场景对高鲁棒性、高准确性的要求,决定了模型需要在细粒度感知与理解能力上实现更大突破。
此外,真实世界中的视频理解与动态分析任务,也对模型提出了新的技术挑战。极视角表示,愿与计算机视觉及大模型领域的专家、开发者持续合作,共同推动视觉语言大模型的技术创新与产业应用。
ICP经营许可证:鄂B2-20080078
(于2003年首获许可证:鄂B2-20030029)
鄂公网安备:420100003343号
© 2002-2026 武汉制信科技有限公司 版权所有
投诉举报电话:027-87592219