toolin.ai logo
toolin.ai
首页
AI工具
AI技能包
AI提示词
提交AI工具提交
toolin.ai logo
toolin.ai

AI玩家的创作利器库,发现最佳AI工具组合,提升您的创作效率

AI工具1,424个
技能包11个
产品功能
  • AI工具
  • AI技能包
  • AI快讯
  • AI资讯
  • 精选推文
  • 提交AI工具
  • 推广AI工具
关于我们
  • 关于Toolin
  • 联系我们
  • 合作洽谈
  • 更新日志
关注我们
© 2025 toolin.ai. All rights reserved.
服务条款隐私政策

UniWorld-View:单张图/视频生成任意相机轨迹,登顶 WorldScore 全开源

2026/07/24
·toolin小编

北大+兔展+鹏城实验室开源的 UniWorld-View,单图/视频生成任意相机轨迹新视角视频,登顶李飞飞团队 WorldScore 榜单,代码权重 Apache-2.0 全开源,支持一键下载。

UniWorld-View:单张图/视频生成任意相机轨迹,登顶 WorldScore 全开源
UniWorld-View:单张图/视频生成任意相机轨迹,登顶 WorldScore 全开源
2026/07/24

UniWorld-View:单张图/视频生成任意相机轨迹,登顶 WorldScore 全开源

北大+兔展+鹏城实验室开源的 UniWorld-View,单图/视频生成任意相机轨迹新视角视频,登顶李飞飞团队 WorldScore 榜单,代码权重 Apache-2.0 全开源,支持一键下载。

UniWorld-View 是什么技术亮点开始前的准备第一步:克隆仓库第二步:一键下载权重第三步:跑推理验证结果应用场景常见问题写在最后
AI产品
所有文章

作者

avatar for toolin小编
toolin小编

分类

  • AI产品
UniWorld-View 是什么技术亮点开始前的准备第一步:克隆仓库第二步:一键下载权重第三步:跑推理验证结果应用场景常见问题写在最后

相关文章

一下午用 Codex 从零开发完整游戏
AI教程

一下午用 Codex 从零开发完整游戏

用 OpenAI Codex 一句话启动游戏开发,自动生成素材、抠图、配乐,一个下午做出可发布的完整游戏

avatar for toolin小编
toolin小编
2026/05/02
Vidu Q3:面向商业场景的 AI 视频生成
AI产品

Vidu Q3:面向商业场景的 AI 视频生成

生数科技 Vidu Q3 上线参考生视频功能,围绕广告、漫剧、短剧、影视四类商业场景优化,解决 AI 视频从能生成到能卖钱的跨越

avatar for toolin小编
toolin小编
2026/05/02
Claude Code 高效用法:构建 AI 工程基础设施
AI教程

Claude Code 高效用法:构建 AI 工程基础设施

围绕 CLAUDE.md、skills 和 hooks 三大机制,搭建让 Claude Code 越用越聪明的项目级 AI 工程体系

avatar for toolin小编
toolin小编
2026/05/02

如果你做 3D 重建、影视特效、空间计算或游戏预演,应该早就被"单图生成任意视角视频"这件事折磨过。UniWorld-View 是北大(袁粒课题组)+ 兔展智能 + 鹏城实验室联合开源的一个世界模型,输入一段随手拍的单目视频甚至一张图,输出任意相机轨迹下的新视角视频(Novel View Synthesis,NVS)+ 4D 重建。它在李飞飞团队维护的 WorldScore 榜单上排名第一,代码和权重以 Apache-2.0 全开源,适配国产昇腾算力。这篇带你把它在本地跑通。

UniWorld-View 是什么

一句话定位:单图/视频 → 任意相机轨迹新视角视频生成器。

它解决的是 NVS(Novel View Synthesis)的核心难题——你只看到一个视角下的画面,模型要脑补出从其他任意角度看到的、几何与外观都合理一致的视频。和"图生视频"模型不一样,UniWorld-View 强调几何一致性,可直接服务于 4D 重建、空间资产生产、虚拟拍摄预演。

官方原话:"ranked 1st on the WorldScore Leaderboard (by Stanford Prof. Fei-Fei Li's Team)"——也就是李飞飞团队维护的世界模型评测榜单第一名。

技术亮点

两个关键设计决定了它的生成质量:

  • 遮挡感知点云渲染(Occlusion-aware Point Cloud Rendering):先把输入图像/视频反推成带遮挡信息的点云,再从中渲染新视角,避免"凭空脑补"导致几何穿模。
  • 双流条件注入(Dual-stream Conditioning):拆成**几何流(geometry stream)+ 外观流(appearance stream)**两路,几何流走 Ref-DiT 模块控制结构,外观流负责颜色与纹理,两路条件同时灌给生成主干,避免"形状对、纹理飞"或反过来。

这种几何/外观解耦的思路,是它能拿 WorldScore 第一的结构性原因。

开始前的准备

  • GPU:官方推荐显存 ≥ 60GB 才能流畅推理(A100 80G / H100 是理想配置)。显存更小的卡可以试,但不是推荐路径。
  • Python 环境:按仓库 README 配置(PyTorch + 对应 CUDA)。
  • 存储:权重体积较大,预留足够磁盘空间。
  • 国产昇腾算力:仓库声明支持适配,相关说明见 README。

项目仓库:https://github.com/PKU-YuanGroup/UniWorld-View (Apache-2.0) 模型权重:https://huggingface.co/Drexubery/UniView

第一步:克隆仓库

git clone https://github.com/PKU-YuanGroup/UniWorld-View.git
cd UniWorld-View

第二步:一键下载权重

仓库自带脚本,从 HuggingFace 把所有 checkpoint 拉下来:

bash checkpoints/download_hf.sh

下载完后权重会落在 checkpoints/ 目录下,运行时会自动加载。

第三步:跑推理

命令行推理(适合批处理):

bash run_infer.sh

Gradio 可视化界面(适合交互调参):

bash run_app.sh

跑起来后,上传一张图或一段单目视频,指定你想要的相机轨迹(推、拉、绕飞、横移等),等待生成完成即可看到新视角视频。

💡 提示: 显存吃紧时,先在 Gradio 界面里把生成分辨率和帧数调小做迭代验证,确认相机轨迹合理后再上高质量参数跑最终结果。几何正确性比纹理细节更值得先验证。

验证结果

生成结果是一段视频,从你指定的相机轨迹展示输入场景的全新视角。判断是否成功的三条标准:

  1. 几何一致:场景中物体的相对位置、形状没有穿模或漂移。
  2. 外观一致:颜色、纹理、光照与输入图像保持一致。
  3. 轨迹可控:相机严格沿着你指定的轨迹运动,没有意外甩镜。

应用场景

  • 空间计算 / VR / AR 资产:单视角素材 → 多视角可漫游资产,省去完整 360° 拍摄。
  • 影视特效与虚拟拍摄预演:从一段实拍快速生成"另一台摄影机看到的画面",做预剪辑和构图验证。
  • 4D 重建 / 数字孪生:把 NVS 结果接进 4D 重建管线,得到时变几何。
  • 游戏预演与场景探索:从一张概念图快速生成多视角探索视频,验证关卡设计。

常见问题

  • 显存不足(OOM): 官方推荐 ≥ 60GB。40GB 级别的卡建议降分辨率、降帧数;消费级显卡(24GB)目前不是该项目推荐的目标硬件。
  • 下载脚本慢 / 超时: checkpoints/download_hf.sh 默认从 HuggingFace 拉,国内网络建议用镜像或代理。权重地址:https://huggingface.co/Drexubery/UniView
  • 生成几何漂移: 检查输入图像是否平面过多、纹理过少——几何流需要足够纹理特征做对齐,纯色墙面是大敌。
  • 昇腾算力适配: 仓库已声明支持昇腾,具体依赖版本和编译选项见 README 的相关章节。

写在最后

UniWorld-View 的工程完整度对得起"全开源"三个字:HuggingFace 权重 + 一键下载脚本 + 命令行 / Gradio 双入口 + Apache-2.0 协议,今天就能上手。如果你做 3D / 影视 / 空间计算相关的工作,把它拉下来跑一次 run_app.sh,亲手指定一条相机轨迹看结果,比读论文直观得多。

官方资源:

  • GitHub:https://github.com/PKU-YuanGroup/UniWorld-View
  • HuggingFace 权重:https://huggingface.co/Drexubery/UniView
  • 论文:见 GitHub README 顶部链接