5分钟跑通InternVideo2_CLIP_S:从零搭建视频文本检索Demo(附完整代码)
发布时间:2026/8/22 14:05:09 作者:尧图编辑部 阅读量:1,286
)
5分钟跑通InternVideo2_CLIP_S从零搭建视频文本检索Demo附完整代码【免费下载链接】InternVideo2_CLIP_S项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVideo2_CLIP_SInternVideo2_CLIP_S 是上海人工智能实验室 OpenGVLab 团队开源的轻量级视频-文本检索模型输入一句文字描述就能从一堆视频中找出语义最匹配的片段。它采用 CLIP 双塔结构把视频8帧和文本映射到同一个 512 维语义空间用余弦相似度即可完成检索广泛用于视频搜索、多模态检索与智能媒资管理。本文带你从零搭建环境5 分钟跑通一个完整可运行的视频文本检索 Demo。项目文件结构一览InternVideo2_CLIP_S 里有什么 项目说明模型架构InternVideo2_CLIP_small双塔 CLIP 结构视觉编码器InternVideo2 ViT24 层 / 1024 维 / patch 14文本编码器MobileCLIP 风格 Transformer12 层 / 512 维 / 词表 49408视频输入均匀采样 8 帧分辨率 224×224特征维度视频与文本共享 512 维空间L2 归一化后做余弦相似度文本长度最长 32 个 token上下文 77评测基准MSRVTT、DiDeMo 视频文本检索许可证Apache-2.0环境搭建一条命令装好全部依赖模型基于 HuggingFace Transformers 的自定义代码机制加载config.json中的auto_map字段声明了自定义配置与模型类因此对 Transformers 版本有要求建议使用 4.51.3pip install transformers4.51.3 torch torchvision decord av imageio numpy然后获取项目源码其中包含完整的使用示例demo.py与交互式版test.ipynbgit clone https://gitcode.com/hf_mirrors/OpenGVLab/InternVideo2_CLIP_S⚠️ 注意model.safetensors权重文件需完整放置在模型目录下与config.json、各.py源码文件同级加载时直接传入该目录路径即可。三步跑通视频文本检索 Demo第一步加载 InternVideo2_CLIP_S 模型 ⚡from transformers import AutoConfig, AutoModel MODEL_DIR InternVideo2_CLIP_S # 模型目录config.json .py 源码 权重 config AutoConfig.from_pretrained(MODEL_DIR, trust_remote_codeTrue) model AutoModel.from_pretrained(MODEL_DIR, trust_remote_codeTrue).to(config.device) model.eval()trust_remote_codeTrue必不可少本项目通过config.json的auto_map指向config.py与modeling_internvideo2encoder.py中的自定义实现必须显式信任并执行这些代码。第二步提取视频特征——抽 8 帧 视觉编码InternVideo2_CLIP_S 不直接读视频文件而是均匀抽取 8 帧送入视觉编码器。用decord抽帧模型自带的model.transform会自动完成 224×224 缩放与像素归一化import numpy as np import torch import decord from decord import VideoReader decord.bridge.set_bridge(torch) def encode_video(model, video_path, num_frames8): reader VideoReader(video_path) vlen len(reader) indices np.linspace(0, vlen - 1, numnum_frames).astype(int) # 均匀抽 8 帧 frames reader.get_batch(indices).permute(0, 3, 1, 2) # (T, C, H, W) frames model.transform(frames).unsqueeze(0).to(model.device) # 缩放 归一化 with torch.no_grad(): return model.encode_vision(frames, testTrue) # 视频特征 (1, 512)encode_vision是核心 API定义于modeling_internvideo2encoder.py当输入只有 1 帧时还会自动切换为图像编码模式所以这个模型同样能做图片检索。第三步提取文本特征并做 Top-K 检索 文本侧走model.tokenizer→model.encode_text两侧特征各自 L2 归一化后一次矩阵乘法就得到相似度矩阵import torch.nn.functional as F def encode_text(model, texts): text_input model.tokenizer(texts).to(model.device) with torch.no_grad(): return model.encode_text(text_input) # 文本特征 (B, 512) videos [video1.mp4, video2.mp4] queries [a person talking, a building] text_features F.normalize(encode_text(model, queries), dim-1) video_features F.normalize(torch.cat([encode_video(model, p) for p in videos], 0).to(text_features.dtype), dim-1) sim text_features video_features.T # 余弦相似度矩阵 topk torch.topk(sim, k2, dim1).indices # 每条查询取 Top-2 for i, q in enumerate(queries): print(q, -, [videos[j] for j in topk[i]])运行后即可得到类似结果a person talking - [video1.mp4, video2.mp4] a building - [video2.mp4, video1.mp4]把上面三段代码按顺序拼在一起就是一个完整的视频文本检索脚本。完整代码在哪看demo.py 与 test.ipynb仓库内附有两个开箱即用的官方示例建议对照阅读demo.py完整检索示例。其中read_frames_decord封装了帧采样支持rand随机采样、middle中间采样、fps0.5按帧率采样三种策略见get_frame_indices函数get_top_videos输出 Top-5 视频及 softmax 概率值检索结果更直观。test.ipynb与demo.py完全一致的 Notebook 交互版本适合在浏览器里逐单元格调试、观察中间特征形状。核心源码导读每个文件负责什么 文件作用config.jsonHuggingFace 模型配置auto_map声明自定义配置类与模型类config.pyInternVideo2Config配置类含set_num_frames等便捷方法modeling_internvideo2encoder.py主模型InternVideo2_CLIP_small提供encode_vision/encode_text两大 APIinternvideo2_clip_vision.pyInternVideo2 视频视觉编码器24 层 ViT CLIP 对齐投影internvideo2.py完整 InternVideo2 ViT 实现含 1B / 6B 规格mobile_clip.py文本编码器TextTransformer与ClipTokenizermobile_clip_transformer.py文本 Transformer 的基础构件pos_embed.py1D / 2D / 3D 位置编码及插值工具flash_attention_class.pyFlashAttention 加速实现demo.py/test.ipynb视频文本检索示例脚本版 / Notebook 版常见问题 FAQ ❓Q1为什么必须加trust_remote_codeTrue本仓库使用 Transformers 的远程代码机制模型结构由仓库内的config.py、modeling_internvideo2encoder.py等自定义文件实现不加该参数会因找不到模型类而报错。Q2显存不够OOM怎么办视频编码器属于 1B 规模可先用config.set_num_frames(4)把抽帧数从 8 降到 4同时减小 batch size推理时保持 bf16/fp16 精度也有明显收益。Q3只有一张图片能检索吗可以。encode_vision检测到输入帧数T1时会自动进入图像编码分支use_imageTrue把图片当作单帧视频传入即可。Q4视频很长8 帧够吗Demo 默认均匀抽 8 帧足够短视频检索。长视频可参考demo.py中的fps采样策略按帧率取帧或分段抽帧后拼接特征。Q5model.safetensors加载后结果不对请确认目录下是完整的官方权重文件而不是占位文件权重缺失或不全会直接导致输出无意义。下一步用视频文本检索模型还能做什么 搭建视频搜索服务离线批量跑encode_video把视频特征存入向量数据库线上只需编码文本即可毫秒级检索图文混检同一 512 维空间天然支持图片、视频与文本三者互检领域微调仓库配置中已内置训练超参AdamW、余弦退火、多任务损失权重等可基于自己的数据对投影层做领域适配。InternVideo2_CLIP_S 以8 帧 一段文字的极简输入提供了工业级可用的视频文本检索能力——按本文步骤走一遍你的检索 Demo 就已经在跑了。【免费下载链接】InternVideo2_CLIP_S项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVideo2_CLIP_S创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考