Video Generation Models are General-Purpose Vision Learners
发布时间:2026/10/7 21:15:10 作者:尧图编辑部 阅读量:1,286

《Video Generation Models are General-Purpose Vision Learners》论文完整梳理一、论文核心内容总览1. 研究背景与核心论点NLP依靠下一个token预测预训练实现了大一统通用基础模型;但计算机视觉仍停留在任务专用模型阶段(深度、分割、位姿各一套独立模型)。本文核心猜想:大规模文生视频扩散模型是视觉领域等价于NLP next-token预测的通用预训练范式,它天然满足通用视觉智能三大刚需:时空演化建模:生成视频强制模型学习4D时序因果、3D几何、物体恒存、物理交互先验;视觉-语言对齐:原生文本条件生成,天然绑定语言语义与视觉;可规模化:文生视频标注成本低、商业化驱动海量数据与算力训练,具备涌现能力基础。团队基于该猜想提出GenCeption通用视觉感知框架:将预训练视频扩散DiT主干改造为单步前向推理感知模型,仅通过文本指令切换任务,一套统一架构、统一损失、统一解码器处理稠密/稀疏视觉任务。2. GenCeption整体方案预训练底座/