跳至正文
RFL_GLOBAL
EN
  • GS-OVIE // W7
  • Python 实现
  • ANIMA

GS-OVIE

一张照片,重建任意场景

侦察图像往往十分稀少:一次卫星过境、一张航拍照片、一张从被控设备截获的图像。规划突击或撤离路线的作战人员需要推断拐角后面有什么——但从单张图像生成多个合成视角,过去要么依赖 3D 重建(昂贵且缓慢),要么依赖逐场景训练(事先无法进入现场就无从谈起)。

模块状态: 生产就绪

输入要求

单张图像

部门
通用
波次
W7
领域
通用
第7波 // ANIMA 套件
基础层 — GS-OVIE
GS-OVIE // W7 // 003/012
01核心挑战

我们解决的问题

侦察图像往往十分稀少:一次卫星过境、一张航拍照片、一张从被控设备截获的图像。规划突击或撤离路线的作战人员需要推断拐角后面有什么——但从单张图像生成多个合成视角,过去要么依赖 3D 重建(昂贵且缓慢),要么依赖逐场景训练(事先无法进入现场就无从谈起)。

情报分析人员可从单张源图像合成目标地点的多个视角,对传感器难以覆盖的环境开展虚拟侦察,提升任务前规划的保真度。

02解决方案

GS-OVIE 提供什么

GS-OVIE(代号:Kaguya)实现 OVIE(arXiv:2603.23488),一种完全基于单目数据训练的位姿条件新视角生成模型——无需立体图像对、无需深度监督、无需多视角采集设备。模型从多样化的训练分布中学习视角合成先验,从而泛化到真实开放场景,并根据目标相机位姿生成合理的新视角。

能力

  • 实现 OVIE(arXiv:2603.23488)位姿条件新视角生成模型,完全基于单目数据训练——无需立体图像对、深度监督或多视角采集设备
  • 从多样化训练分布中学习视角合成先验,泛化到真实开放场景,并按目标相机位姿生成合理新视角
  • 无需逐场景微调。
03工程挑战

为什么这很难

构建 GS-OVIE 需要解决多个耦合问题:

  1. 01侦察图像往往十分稀少:一次卫星过境、一张航拍照片、一张从被控设备截获的图像
  2. 02规划突击或撤离路线的作战人员需要推断拐角后面有什么——但从单张图像生成多个合成视角,过去要么依赖 3D 重建(昂贵且缓慢),要么依赖逐场景训练(事先无法进入现场就无从谈起)。
  3. 03实现 OVIE(arXiv:2603.23488)位姿条件新视角生成模型,完全基于单目数据训练——无需立体图像对、深度监督或多视角采集设备
  4. 04从多样化训练分布中学习视角合成先验,泛化到真实开放场景,并按目标相机位姿生成合理新视角

GS-OVIE 通过精心的架构设计和严格的验证来解决这些问题。

04性能基准

用数据说话

关键性能指标:

用数据说话
指标数值
输入要求单张 RGB 图像——无需深度、立体或多视角输入
泛化能力真实开放场景,无需逐场景重新训练
训练范式仅需单目监督——可用任意单图数据集训练
防务价值稀疏图像侦察合成、目标地点虚拟化,以及基于有限 ISR 数据的任务前规划
05构建状态

已构建的功能

已完成 2/4 个组件
已构建的功能
组件状态说明
输入要求已完成单张 RGB 图像——无需深度、立体或多视角输入
泛化能力已完成真实开放场景,无需逐场景重新训练
训练范式进行中仅需单目监督——可用任意单图数据集训练
防务价值进行中稀疏图像侦察合成、目标地点虚拟化、基于有限 ISR 数据的任务前规划
06应用场景

GS-OVIE 部署场景

  • APP_01

    自主系统

    情报分析人员可从单张源图像合成目标地点的多个视角,对传感器难以覆盖的环境开展虚拟侦察,并提升任务前规划的精度。

  • APP_02

    研究实验室

    GS-OVIE(代号:Kaguya)实现 OVIE(arXiv:2603.23488),一种完全基于单目数据训练的位姿条件新视角生成模型——无需立体图像对、无需深度监督、无需多视角采集装置。

  • APP_03

    边缘计算

    一张图像足矣——单目新视角合成,可泛化到从未见过的环境。