概览
VGGT 将多个三维几何任务放进同一个前馈网络中处理。给定一张或多张场景图片,模型可以输出相机相关参数和像素对应的几何信息。对于已经收集了多视图照片的项目,它提供了一个直接观察几何预测的入口,帮助团队检查相机分布、场景结构和不同视角之间的关系。 实际使用时,重点是把图片输入、坐标约定、预测置信度和导出格式串起来。点图适合快速观察结构,深度和相机参数可以用于后续几何计算;仓库还提供 COLMAP 格式输出的路径,便于继续进入其他重建工具。
主要功能
- 在同一模型中预测相机参数、深度图与点图等几何输出。
- 支持通过查询点预测多视图中的点轨迹。
- 提供图像加载和预处理函数,组织多视图输入。
- 支持按需要调用不同预测分支并读取对应置信度。
- 提供交互式可视化演示,观察相机与场景点。
- 提供 COLMAP 格式导出及可选的 bundle adjustment 路径。
要求、安装和快速入门
通过 git clone https://github.com/facebookresearch/vggt.git 获取项目,进入目录后运行 pip install -r requirements.txt。需要交互演示时,再安装 requirements_demo.txt 中的依赖。
按 README 加载所选检查点,准备少量具有重叠视野的图片。首次运行会下载模型,提前安排缓存空间。推理精度与设备设置应按显卡能力选择;用于商业用途的检查点有独立入口和访问流程,应与模型文件一起记录。
按 README 加载所选检查点,准备少量具有重叠视野的图片。首次运行会下载模型,提前安排缓存空间。推理精度与设备设置应按显卡能力选择;用于商业用途的检查点有独立入口和访问流程,应与模型文件一起记录。
用法
实践案例:用一组桌面物体照片检查三维结构。
1. 围绕静止物体拍摄多个视角,让相邻图片保留足够重叠,尽量保持光照和焦距稳定。
2. 去掉明显模糊、重复或遮挡严重的图片,先使用较小的图片集合。
3. 通过 load_and_preprocess_images 组织输入,加载模型并执行几何预测。
4. 在可视化中查看相机分布和点云轮廓,观察是否存在漂浮点、重复结构或断裂区域。
5. 结合置信度和输入质量筛选结果;如需接入其他重建程序,再采用仓库的 COLMAP 导出流程。
6. 保存输入顺序、模型名称、预处理方式和输出坐标说明,便于下一步重建或团队复核。
建议先围绕一个静态小场景完成输入到导出的整条流程,再增加视角数量和场景复杂度。
工作原理
模型对多张图片进行特征聚合,再由相机、深度、点图与跟踪分支输出对应信息。相机参数和深度图还可以结合生成三维点。处理不同输出时需要关注坐标方向与张量维度,避免把图像坐标、相机坐标和世界坐标混用。
适合谁使用
三维视觉、场景重建和机器人感知研究者,以及准备把多视图照片接入后续几何处理程序的开发团队。
环境与输入
Python、PyTorch、TorchVision、模型权重和图像依赖。多视图任务需要规划显存与图片数量,交互展示还需额外的演示依赖。
具体使用场景
• 几何预览:从照片初步观察相机布局和场景结构。
• 重建输入:导出相机和几何结果,交给后续重建程序继续处理。
• 算法研究:比较不同图片选择和预处理方式对预测结构的影响。
实施要点
反光、透明、动态物体和重叠不足的视角需要重点检查。增加图片数量时,同时观察显存消耗与有效信息量。用于度量任务时应加入尺度、坐标和参考物的校准步骤。
常见问题
问:先看点图还是深度图?
快速检查整体结构可以看点图;需要与相机参数进行几何计算时,可从深度图和对应坐标信息开始。
问:如何接入其他重建工具?
先查看仓库的 COLMAP 导出示例,再按目标工具要求核对文件格式和坐标约定。
关联项目与搭配思路
facebookresearch/sam2:可以作为前处理环节帮助筛选场景区域,掩码如何用于重建由应用自行组织。
gradio-app/gradio:适合为图片上传和重建结果展示制作交互界面,几何计算与文件管理保留在后端。
1. 围绕静止物体拍摄多个视角,让相邻图片保留足够重叠,尽量保持光照和焦距稳定。
2. 去掉明显模糊、重复或遮挡严重的图片,先使用较小的图片集合。
3. 通过 load_and_preprocess_images 组织输入,加载模型并执行几何预测。
4. 在可视化中查看相机分布和点云轮廓,观察是否存在漂浮点、重复结构或断裂区域。
5. 结合置信度和输入质量筛选结果;如需接入其他重建程序,再采用仓库的 COLMAP 导出流程。
6. 保存输入顺序、模型名称、预处理方式和输出坐标说明,便于下一步重建或团队复核。
建议先围绕一个静态小场景完成输入到导出的整条流程,再增加视角数量和场景复杂度。
工作原理
模型对多张图片进行特征聚合,再由相机、深度、点图与跟踪分支输出对应信息。相机参数和深度图还可以结合生成三维点。处理不同输出时需要关注坐标方向与张量维度,避免把图像坐标、相机坐标和世界坐标混用。
适合谁使用
三维视觉、场景重建和机器人感知研究者,以及准备把多视图照片接入后续几何处理程序的开发团队。
环境与输入
Python、PyTorch、TorchVision、模型权重和图像依赖。多视图任务需要规划显存与图片数量,交互展示还需额外的演示依赖。
具体使用场景
• 几何预览:从照片初步观察相机布局和场景结构。
• 重建输入:导出相机和几何结果,交给后续重建程序继续处理。
• 算法研究:比较不同图片选择和预处理方式对预测结构的影响。
实施要点
反光、透明、动态物体和重叠不足的视角需要重点检查。增加图片数量时,同时观察显存消耗与有效信息量。用于度量任务时应加入尺度、坐标和参考物的校准步骤。
常见问题
问:先看点图还是深度图?
快速检查整体结构可以看点图;需要与相机参数进行几何计算时,可从深度图和对应坐标信息开始。
问:如何接入其他重建工具?
先查看仓库的 COLMAP 导出示例,再按目标工具要求核对文件格式和坐标约定。
关联项目与搭配思路
facebookresearch/sam2:可以作为前处理环节帮助筛选场景区域,掩码如何用于重建由应用自行组织。
gradio-app/gradio:适合为图片上传和重建结果展示制作交互界面,几何计算与文件管理保留在后端。
模型兼容性与使用场景
VGGT 的结构、预处理和检查点需要配套使用。原始 VGGT-1B 与 VGGT-1B-Commercial 有不同的许可条件,选择前先确定实际要加载的模型。
许可证与风险说明
项目采用 VGGT 自定义许可。README 说明代码支持符合条款的商业使用,商业检查点为 VGGT-1B-Commercial,并有访问申请流程;原始检查点仍有非商业条件。完整范围见 LICENSE.txt 和对应模型页。
VGGT License / VGGT 自定义许可