- GS-OVIE // W7
- Python 实现
- ANIMA
GS-OVIE
一张照片,重建任意场景
侦察图像往往十分稀少:一次卫星过境、一张航拍照片、一张从被控设备截获的图像。规划突击或撤离路线的作战人员需要推断拐角后面有什么——但从单张图像生成多个合成视角,过去要么依赖 3D 重建(昂贵且缓慢),要么依赖逐场景训练(事先无法进入现场就无从谈起)。
模块状态: 生产就绪输入要求
单张图像
- 部门
- 通用
- 波次
- W7
- 领域
- 通用
- 第7波 // ANIMA 套件
- 基础层 — GS-OVIE
GS-OVIE // W7 // 003/012
01核心挑战
我们解决的问题
侦察图像往往十分稀少:一次卫星过境、一张航拍照片、一张从被控设备截获的图像。规划突击或撤离路线的作战人员需要推断拐角后面有什么——但从单张图像生成多个合成视角,过去要么依赖 3D 重建(昂贵且缓慢),要么依赖逐场景训练(事先无法进入现场就无从谈起)。
情报分析人员可从单张源图像合成目标地点的多个视角,对传感器难以覆盖的环境开展虚拟侦察,提升任务前规划的保真度。
02解决方案
GS-OVIE 提供什么
GS-OVIE(代号:Kaguya)实现 OVIE(arXiv:2603.23488),一种完全基于单目数据训练的位姿条件新视角生成模型——无需立体图像对、无需深度监督、无需多视角采集设备。模型从多样化的训练分布中学习视角合成先验,从而泛化到真实开放场景,并根据目标相机位姿生成合理的新视角。
能力
- 实现 OVIE(arXiv:2603.23488)位姿条件新视角生成模型,完全基于单目数据训练——无需立体图像对、深度监督或多视角采集设备
- 从多样化训练分布中学习视角合成先验,泛化到真实开放场景,并按目标相机位姿生成合理新视角
- 无需逐场景微调。
03工程挑战
为什么这很难
构建 GS-OVIE 需要解决多个耦合问题:
- 01侦察图像往往十分稀少:一次卫星过境、一张航拍照片、一张从被控设备截获的图像
- 02规划突击或撤离路线的作战人员需要推断拐角后面有什么——但从单张图像生成多个合成视角,过去要么依赖 3D 重建(昂贵且缓慢),要么依赖逐场景训练(事先无法进入现场就无从谈起)。
- 03实现 OVIE(arXiv:2603.23488)位姿条件新视角生成模型,完全基于单目数据训练——无需立体图像对、深度监督或多视角采集设备
- 04从多样化训练分布中学习视角合成先验,泛化到真实开放场景,并按目标相机位姿生成合理新视角
GS-OVIE 通过精心的架构设计和严格的验证来解决这些问题。
04性能基准
用数据说话
关键性能指标:
| 指标 | 数值 |
|---|---|
| 输入要求 | 单张 RGB 图像——无需深度、立体或多视角输入 |
| 泛化能力 | 真实开放场景,无需逐场景重新训练 |
| 训练范式 | 仅需单目监督——可用任意单图数据集训练 |
| 防务价值 | 稀疏图像侦察合成、目标地点虚拟化,以及基于有限 ISR 数据的任务前规划 |
05构建状态
已构建的功能
已完成 2/4 个组件
| 组件 | 状态 | 说明 |
|---|---|---|
| 输入要求 | 已完成 | 单张 RGB 图像——无需深度、立体或多视角输入 |
| 泛化能力 | 已完成 | 真实开放场景,无需逐场景重新训练 |
| 训练范式 | 进行中 | 仅需单目监督——可用任意单图数据集训练 |
| 防务价值 | 进行中 | 稀疏图像侦察合成、目标地点虚拟化、基于有限 ISR 数据的任务前规划 |
06应用场景
GS-OVIE 部署场景
- APP_01
自主系统
情报分析人员可从单张源图像合成目标地点的多个视角,对传感器难以覆盖的环境开展虚拟侦察,并提升任务前规划的精度。
- APP_02
研究实验室
GS-OVIE(代号:Kaguya)实现 OVIE(arXiv:2603.23488),一种完全基于单目数据训练的位姿条件新视角生成模型——无需立体图像对、无需深度监督、无需多视角采集装置。
- APP_03
边缘计算
一张图像足矣——单目新视角合成,可泛化到从未见过的环境。