HY-World 2.0 世界生成全流程指南:从全景图到可导航3D世界的5个阶段详解
发布时间:2026/10/2 9:01:52 作者:尧图编辑部 阅读量:1,286

HY-World 2.0 世界生成全流程指南从全景图到可导航3D世界的5个阶段详解【免费下载链接】HY-World-2.0HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds项目地址: https://gitcode.com/gh_mirrors/hy/HY-World-2.0HY-World 2.0 是一个多模态世界模型框架能够把一张图片或一段文字变成可编辑、可实时漫游的 3D 世界网格 / 3DGS 资产而不是一段看完就消失的视频。本文带你走通 HY-World 2.0 世界生成的完整工作流从 360° 全景图出发经过轨迹规划 → 轨迹渲染 → 世界扩展 → GS 数据准备 → 3DGS 训练共 5 个阶段最终得到一个可以在浏览器里自由行走、还能导入 Blender/Unity 的真实 3D 世界。全程只需按顺序运行 5 个脚本本文会逐一讲清每个阶段在做什么、为什么这么做、关键参数怎么配。为什么是3D 世界而不是视频多数世界模型输出的是像素级视频播放结束世界就消失而 HY-World 2.0 直接产出持久化的 3D 资产| | 视频世界模型 | HY-World 2.0 世界生成 | |--|---|---| | 输出 | 像素视频不可编辑 | 网格 / 3DGS完全可编辑 | | 生命周期 | 通常 1 分钟 | 永久保存 | | 渲染 | 逐帧推理延迟高 | 消费级 GPU 实时渲染 | | 可控性 | 弱无真实物理 | 精确控制 物理碰撞 | | 引擎兼容 | 仅视频文件 | 可导入 Blender / UE / Isaac Sim |这也是构建一个可玩的世界与录一段视频的本质区别。整体架构全景图驱动的完整流水线HY-World 2.0 的世界生成由 4 个核心模块串联全景生成HY-Pano 2.0文字/单图 → 360° 全景图轨迹规划WorldNavVLM 引导的相机路径设计世界扩展WorldStereo 2.0沿轨迹生成逼真视频关键帧世界组合WorldMirror 2.0 3DGS 学习把多视角画面固化成 3D 资产开源的世界生成模块hyworld2/worldgen/实现了从全景图开始的5 个可执行阶段对应 5 个脚本所有阶段共享同一个场景目录--target_path中间结果逐阶段累积阶段脚本做什么1. 轨迹规划traj_generate.pyVLM 引导的相机轨迹规划带避障导航2. 轨迹渲染traj_render.py多 GPU 点云渲染 VLM 轨迹描述3. 世界扩展video_gen.pyWorldStereo 2.0 生成逼真关键帧4. GS 数据准备gen_gs_data.py抽取帧、对齐深度/法线/相机参数5. 3DGS 训练world_gs_trainer.py优化并导出最终 3D 世界开始之前环境一键安装硬件CUDA 12.8、Python 3.11建议 ≥4 张 GPU官方在 8×H20 上验证依赖vLLM 服务承载 Qwen3-VL-8B 视觉语言模型供阶段 1、2 使用权重WorldStereo 2.0 等模型权重会在首次运行时自动下载安装命令参考根目录 README.md 的 Get Started 章节git clone https://gitcode.com/gh_mirrors/hy/HY-World-2.0 cd HY-World-2.0 conda create -n hyworld2 python3.11.15 conda activate hyworld2 pip install -r requirements.txt pip install --no-build-isolation -r requirements_git.txt git submodule update --init --recursive # 编译自定义 gsplatMaskGaussian与 navmesh 扩展 cd hyworld2/worldgen/third_party/gsplat_maskgaussian pip install -e . --no-build-isolation cd ../../navmesh pip install . --no-build-isolation阶段 1、2 需要一台运行 vLLM 的 VLM 服务如 Qwen3-VL-8B把地址、端口、模型名通过--llm_addr / --llm_port / --llm_name传给对应脚本即可。输入准备用 HY-Pano 2.0 生成 360° 全景图世界生成的原材料是一张等距柱状ERP全景图默认分辨率 1920×960。你可以自备全景图也可以用 HY-Pano 2.0 从单张普通照片甚至文字一步生成——它提供两个后端HunyuanImage-3 后端pipeline.py带思考→重写提示词→扩散推理链语义更连贯Qwen-Image-Edit 后端pipeline_with_qwen_image.py轻量 LoRA 方案加载更快python pipeline.py --image input.png --save output_panorama.png生成后将全景图放入场景目录并命名为panorama.png例如仓库自带的示例 examples/worldgen/case000/panorama.png全景图细节可参考 hyworld2/panogen/README.md。阶段一轨迹规划——让虚拟相机学会看世界目标在世界里设计一批值得拍摄的相机路径。工作原理traj_generate.py src/navi_utils.pyVLMQwen3-VL先看懂全景图识别出有趣的拍摄目标结果存入objects.jsonSAM3 语义分割 NavMesh 导航网格做避障路径规划自动绕开墙壁和障碍物产出 4 类多样化轨迹环绕surround、探索wonder、目标聚焦target、重建视角reconstruct同步由全景图恢复出全局点云global_pcd.ply、全局网格与全场景深度作为后续阶段的几何地基python traj_generate.py --target_path $TARGET_PATH \ --llm_addr $LLM_ADDR --llm_port $LLM_PORT --llm_name $LLM_NAME \ --apply_nav_traj --apply_up_route --apply_recon_iteration --force_vlm每条轨迹的相机内外参会写入camera.json单 GPU 即可运行。阶段二轨迹渲染——为生成模型绘制草稿底图目标把规划好的每条轨迹渲染成视频作为世界扩展阶段的几何条件。traj_render.py 会加载阶段一的全局点云用多 GPU 点云 splatting沿每条轨迹渲染出render.mp4与遮挡掩码render_mask.mp4同时把渲染视频喂给 VLM自动生成一段轨迹文字描述traj_caption.json比如镜头沿走廊缓缓前移让后续生成在内容上贴合场景。torchrun --nproc_per_node 8 traj_render.py --target_path $TARGET_PATH \ --llm_addr $LLM_ADDR --llm_port $LLM_PORT --llm_name $LLM_NAME阶段三世界扩展——WorldStereo 2.0 生成逼真关键帧目标把粗糙的点云渲染视频升级为照片级真实感的视频让点云覆盖不到的区域也被合理补全——世界就这样被扩展出来了。video_gen.py 加载 WorldStereo 2.0约 17B 参数的扩散视频模型其三大关键机制相机嵌入 ControlNet 条件以点云渲染帧为几何约束保证生成画面与真实点云严丝合缝PanoramaMemoryBank 记忆库检索注入参考全景图保证多条轨迹之间外观一致不会出现换个角度墙的颜色变了DMD 四步蒸馏推理默认worldstereo-memory-dmd模式仅 4 步采样即可出片速度大幅提升模型支持 FSDP 分片8 卡并行推理torchrun --nproc_per_node 8 video_gen.py --target_path $TARGET_PATH --fsdp输出为每条轨迹一个*_result.mp4并汇入全局生成库generation_bank_*。阶段四GS 数据准备——为 3DGS 训练组装教材目标把生成的视频变成 3DGS 训练能直接吃的数据集图像、深度、法线、相机参数一一对齐。gen_gs_data.py 完成 4 件事从每条轨迹视频中按间隔抽帧保存 RGB 图像用 MoGe 深度模型预测每帧深度并与阶段一的全场景深度对齐--save_normal同时导出法线图汇总所有轨迹的相机参数输出 COLMAP 风格目录结构天空分离--split_sky把天空点云单独存为sky_points.ply训练时天空与地面分别处理避免几何污染torchrun --nproc_per_node 8 gen_gs_data.py \ --root_path $TARGET_PATH --save_normal --split_sky产物就是训练入口$TARGET_PATH/gs_data/内含images/、depths/、normals/等子目录。阶段五3DGS 训练——把视频固化为可实时渲染的世界目标以 3D 高斯泼溅3D Gaussian Splatting优化出最终世界资产。world_gs_trainer.py 是项目中最重的一步核心配置MaskGaussian 自适应剪枝基于自定义 gsplat 分支third_party/gsplat_maskgaussian/训练过程中概率性地剔除冗余高斯模型更小更干净深度 法线 LPIPS 三重正则让几何真实、表面平滑、观感逼真天空感知训练天空单独用点云表达地面正常优化多格式导出.ply、压缩版.spz、TSDF 融合网格可直接导入 Blender / Unity / UnrealGPU 数量与训练步数按比例换算8 卡 1500 步 → 4 卡 2000 步 → 2 卡 4000 步 → 1 卡 8000 步完整推荐参数见 hyworld2/worldgen/README.mdpython -m world_gs_trainer default \ --data_dir $TARGET_PATH/gs_data --result_dir $RESULT_DIR \ --max_steps 1500 --save_ply --convert_to_spz --export_mesh \ --depth_loss --normal_loss --use_mask_gaussian走进你的世界可视化与应用训练完成后用浏览器查看器实时漫游自己的 3D 世界——基于 viser nerfview 构建支持自由视角交互python show_gs.py --port 8081 --gpu_id 0 \ --ckpt $RESULT_DIR/ckpts/ckpt_1499_rank*.pt导出网格后可作为真实 3D 资产长期使用导入游戏引擎做场景搭建、做数字孪生、或直接分享.spz文件数据目录速览与进阶阅读运行完 5 个阶段后场景目录会自然长成这样每个阶段认领自己的一层scene_dir/ ├── panorama.png # 输入全景图 ├── objects.json # 阶段1VLM 检测的目标 ├── render_results/ # 阶段2-3点云、渲染视频、生成视频 │ ├── global_pcd.ply │ └── view{N}/traj{M}/ # 每条轨迹的 camera.json / 渲染 / 生成结果 ├── gs_data/ # 阶段43DGS 训练数据集 └── result_dir/ # 阶段53DGS 输出ply/spz/网格想继续深挖推荐按此顺序阅读世界生成总览与完整参数hyworld2/worldgen/README.mdHY-Pano 2.0 全景生成双后端文档hyworld2/panogen/README.md项目级完整 API 参考含世界重建 WorldMirror 2.0DOCUMENTATION.md示例场景examples/worldgen/case000/ 与 examples/worldgen/case001/常见问题速查GPU 不够怎么办阶段 1、2 单卡可跑阶段 3、5 至少 2 卡起步并按上文规则增加训练步数。模型权重去哪了全部首次运行自动下载WorldStereo 2.0 等见根 README 的 Model Zoo 章节无需手动搬运。轨迹穿墙了确认阶段一已加--apply_nav_trajNavMesh 避障与--apply_recon_iteration迭代修正。生成画面前后不一致这是记忆库PanoramaMemoryBank的职责保持阶段三使用默认worldstereo-memory-dmd模型即可。按这 5 个阶段跑完你就把一张全景图长成了真正的 3D 世界——从轨迹规划到 3DGS 训练每一步都可单独重跑、逐步调试。Happy world building! 【免费下载链接】HY-World-2.0HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds项目地址: https://gitcode.com/gh_mirrors/hy/HY-World-2.0创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考