杭州团队 Om AI 发布端侧流式多模态模型 VLX
Om AI 推出三款端侧流式多模态模型 VLX-Flow、VLX-Seek、VLX-Go,覆盖感知、定位与行动闭环,主打…
杭州 AI 团队 Om AI 近日发布端侧流式多模态模型系列 VLX,包含 VLX-Flow、VLX-Seek、VLX-Go 三款模型,分别对应持续感知、精准定位与行动决策,构成从"看见"到"行动"的完整能力链。该系列主打机器人、无人机、摄像头等物理世界设备的端侧部署需求,强调从模型架构设计之初就面向端侧算力约束,而非将云端模型压缩移植。
围绕物理世界的能力闭环
VLX 提出的核心问题是:通用视觉语言模型(VLM)虽然擅长看图问答,但在面对真实世界时存在明显短板——视频一长就丢前文信息、定位偏差大、最终只能停留在文字回答。VLX 将流式多模态能力拆为三个环节:
- 感知(VLX-Flow):以 Linear Attention 替代标准注意力机制,结合双层记忆,让视频流像水流一样持续进入模型而不会因上下文增长导致显存爆炸。官方称处理单路视频最快仅需 0.06 秒。
- 定位(VLX-Seek):用 Region Token 替代传统坐标生成,模型先产生候选区域再检索匹配,在保持识别能力的同时降低部署成本。Seek 以约 3B 参数规模在开放词汇检测等任务上声称达到甚至超过更大规模通用模型。
- 行动(VLX-Go):将单目视频、历史视觉记忆与自然语言指令直接转化为机器人可执行的短时航点,结合离线轨迹学习与在线强化学习,仅用 0.6B 参数完成实时运动规划。
三款模型共享同一基座,在同一条视频流上完成端到端协作,覆盖从持续感知、精准定位到行动决策的全链路。
端侧原生的设计取舍
与行业常见的"先训练大模型、再量化压缩到端侧"的路径不同,VLX 从 Day 1 起就以端侧算力为约束进行架构设计。其逻辑是:机器人跟随目标时等不起云端往返延迟,无人机巡检避障也无法将感知与行动拆成两个离线步骤;网络、隐私、算力限制使很多场景必须本地化运行。Om AI 认为,"小而准"在端侧场景下优于"大而全"。
团队背景与此前工作
Om AI 来自杭州,创始人兼 CEO 赵天成为 CMU 计算机博士、吴文俊人工智能科技进步奖得主,团队成员来自 CMU、清华、浙大、微软、阿里云等机构。公司早在 2022 年就获得工信部首张多模态模型认证。
此前,Om AI 开源的 VLM-R1 是首个将 DeepSeek R1 强化学习范式引入视觉语言模型的项目,上线 12 小时获得超 2000 颗 GitHub Star,48 小时登顶 GitHub 全球趋势榜,至今累计 6000+ Star。VLX 被视为该团队在多模态方向上的最新迭代。
定位与待验证之处
文章引述 CVPR 数据称,VLM/多模态相关论文占比已从去年的 4.9% 增长到 10.6%,实时感知与定位是当前最受关注的方向之一。VLX 的差异化在于把流式多模态与端侧原生设计结合起来,试图回答"如何让模型真正活在物理世界里"这道题。
需要指出的是,文中"全球首个端侧流式多模态模型系列"的表述来自厂商自身宣称,尚未见到独立的第三方 benchmark 对比;部分性能数据(如 0.06 秒、0.6B 参数下的导航表现)也缺乏对照基线与测试条件说明,读者宜结合后续开源内容与第三方评测再做判断。
