- UAV-TRACKVLA // W7
- Python 实现
- ANIMA
UAV-TRACKVLA
语言指令驱动的追踪,目标绝不丢失
持续监视 UAV 会在遮挡、转向或操作员交接时丢失追踪目标。重新捕获需要人工介入,耗费宝贵的数秒。在动态追踪中——车辆冲卡逃逸、关注人员穿行人群——这几秒决定任务成败。UAV-TRACKVLA(代号:Tengu)实现 UAV-Track VLA(arXiv:2604.02241),将冻结的 SigLIP 视觉骨干与时序压缩及双解码器头相融合:一个解码器负责定位(目标在哪里),另一个负责流匹配动作生成(UAV 如何移动以保持跟随)。
模块状态: 生产就绪架构
单次前向
- 部门
- 通用
- 波次
- W7
- 领域
- 通用
- 第7波 // ANIMA 套件
- 基础层 — UAV-TRACKVLA
我们解决的问题
持续监视 UAV 会在遮挡、转向或操作员交接时丢失追踪目标。重新捕获需要人工介入,耗费宝贵的数秒。在动态追踪中——车辆冲卡逃逸、关注人员穿行人群——这几秒决定任务成败。
单名操作员即可用自然语言给追踪 UAV 下达任务,并放心让它在复杂机动中保持锁定——降低 ISR 出动的人机比,减轻高强度作战中的认知负担。
UAV-TRACKVLA 提供什么
UAV-TRACKVLA(代号:Tengu)实现 UAV-Track VLA(arXiv:2604.02241),将冻结的 SigLIP 视觉骨干与时序压缩、双解码器头相融合:一个负责定位(目标在哪里),一个负责流匹配动作生成(UAV 如何移动以保持跟踪)。
能力
- 实现 UAV-Track VLA(arXiv:2604.02241),融合冻结 SigLIP 视觉骨干、时序压缩与双解码器头:一个负责定位(目标在哪),一个负责流匹配动作生成(UAV 如何跟住目标)
- 自然语言指令实时更新定位目标,动作解码器直接输出连续飞行指令,无需独立规划模块
- 统一架构消除了“检测-规划-执行”串联管线的延迟。
为什么这很难
构建 UAV-TRACKVLA 需要解决多个耦合问题:
- 01持续监视 UAV 会在遮挡、转向或操作员交接时丢失追踪目标
- 02重新捕获需要人工介入,耗费宝贵的数秒
- 03实现 UAV-Track VLA(arXiv:2604.02241),融合冻结 SigLIP 视觉骨干、时序压缩与双解码器头:一个负责定位(目标在哪),一个负责流匹配动作生成(UAV 如何跟住目标)
- 04自然语言指令实时更新定位目标,动作解码器直接输出连续飞行指令,无需独立规划模块
UAV-TRACKVLA 通过精心的架构设计和严格的验证来解决这些问题。
用数据说话
关键性能指标:
| 指标 | 数值 |
|---|---|
| 架构 | 统一 VLA——一次前向传播完成定位 + 动作生成,无需管线串联 |
| 动作生成 | 流匹配解码器输出平滑连续的飞行指令——没有离散规划带来的滞后 |
| 骨干 | 冻结 SigLIP(无微调成本)——仅训练时序模块与解码器头 |
| 防务价值 | 持续 ISR 追踪、冲卡逃逸目标重新捕获、多操作员 UAV 任务分配 |
已构建的功能
| 组件 | 状态 | 说明 |
|---|---|---|
| 架构 | 已完成 | 统一 VLA——一次前向传播完成定位 + 动作生成,无需管线串联 |
| 动作生成 | 已完成 | 流匹配解码器输出平滑连续的飞行指令——没有离散规划带来的延迟 |
| 骨干 | 进行中 | 冻结 SigLIP(无微调成本)——仅训练时序模块与解码器头 |
| 防务价值 | 进行中 | 持续 ISR 追踪、冲卡逃逸目标重新捕获、多操作员 UAV 任务分配 |
UAV-TRACKVLA 部署场景
- APP_01
自主系统
单名操作员即可用自然语言给追踪 UAV 下达任务,并放心让它在复杂机动中保持锁定——降低 ISR 架次的人机比,并减轻高强度行动中的认知负荷。
- APP_02
研究实验室
UAV-TRACKVLA(代号:Tengu)实现 UAV-Track VLA(arXiv:2604.02241),将冻结的 SigLIP 视觉骨干与时序压缩及双解码器头相融合:一个解码器负责定位(目标在哪里),另一个负责流匹配动作生成(UAV 如何移动以保持跟随)。
- APP_03
边缘计算
能听懂“跟上那辆正在左转的白色 SUV”并立即执行的空中追踪器——在一个冻结骨干中融合语言、视觉与飞行控制。