模型缓存管理命令全清单:spark-vllm-docker的hf-download.sh下载、集群分发与备份恢复教程
发布时间:2026/10/5 7:31:20 作者:尧图编辑部 阅读量:1,286

模型缓存管理命令全清单spark-vllm-docker的hf-download.sh下载、集群分发与备份恢复教程【免费下载链接】spark-vllm-dockerDocker configuration for running VLLM on dual DGX Sparks项目地址: https://gitcode.com/gh_mirrors/sp/spark-vllm-docker在 spark-vllm-docker 项目中hf-download.sh是管理模型缓存的一站式命令它可以在单台 DGX Spark 上下载 Hugging Face 模型把模型分发到集群内所有节点并支持列出、删除、备份与恢复整个缓存。本教程整理全部缓存管理命令让你从零完成下载、集群分发、空间清理与备份恢复。为什么需要专用的模型缓存管理工具大模型动辄几十上百 GBDGX Spark 的存储空间十分宝贵。spark-vllm-docker 把常用的缓存操作封装进了 hf-download.sh 这一个脚本底层配合 hf-cache.py 完成缓存清点、备份校验等工作你无需手动去翻~/.cache/huggingface目录。它解决三类常见痛点下载慢、重复下载集群里每台节点都要一份完整模型手动拷贝容易出错空间不够用多个模型、多个版本revision堆在缓存里不知道哪些可以删️误删没救删除前可以先备份到外接盘需要时一键恢复。下载模型一步到位本地与集群分发只下载本机./hf-download.sh QuantTrio/MiniMax-M2-AWQ下载并分发到集群推荐加上-c参数脚本会读取.env中的COPY_HOSTS配置找不到就自动发现autodiscovery同网段的 Spark 节点逐台分发模型./hf-download.sh -c QuantTrio/MiniMax-M2-AWQ多台节点并行传输加--copy-parallel所有节点同时接收多节点集群上明显更快./hf-download.sh -c --copy-parallel QuantTrio/MiniMax-M2-AWQ手动指定节点自动发现不适用的拓扑才需要./hf-download.sh -c 192.168.177.12,192.168.177.13 QuantTrio/MiniMax-M2-AWQ几个贴心细节脚本会自动检查各节点上uvx是否可用缺失时会静默安装不用你逐个节点处理下载前会检测缓存目录归属发现 root 等错误属主时会借助 Docker 镜像或sudo自动修复避免 vLLM 读不到缓存传输基于rsync可断点续传、进度可见使用--config /path/to/cluster.env可切换自定义的集群配置文件。集群节点间的网络配置SSH 免密、InfiniBand 连接请参考 docs/NETWORKING.md。查看缓存清单--list 命令想知道缓存里现在有什么、各占多大空间用--list./hf-download.sh --list # 本机缓存 ./hf-download.sh --list -c # 全集群缓存每个模型版本单独一行默认按大小降序排列-c时还会显示该版本存放在哪些节点上。想导出给别的工具或文档用可以切换输出格式和排序./hf-download.sh --list -c --format json --sort name ./hf-download.sh --list -c --format csv models.csv ./hf-download.sh --list -c --format md--format支持console、csv、json、md四种--sort支持size、name、accessed、modified可加:asc或:desc。清理缓存空间--delete 与 --cleanup删除指定模型删除前会询问确认./hf-download.sh --delete QuantTrio/MiniMax-M2-AWQ # 仅本机 ./hf-download.sh --delete QuantTrio/MiniMax-M2-AWQ -c # 本机 所选节点 ./hf-download.sh --delete QuantTrio/MiniMax-M2-AWQ -c --force # 跳过确认只删某一个版本用--revision指定 commit 哈希、7 位以上前缀或已缓存的分支/标签如main其余版本保留./hf-download.sh --delete QuantTrio/MiniMax-M2-AWQ --revision COMMIT_HASH -c如果该哈希同时属于其他缓存仓库脚本会拒绝删除防止误伤。清理无引用的旧版本--cleanup移除没有任何分支/标签指向的模型版本保留正在使用的部分./hf-download.sh --cleanup ./hf-download.sh --cleanup -c --force注意--cleanup不清理不完整的下载也不会清空整个缓存目录。备份与恢复--backup 与 --restore外接盘挂载好后目录必须已存在、且不在缓存目录内部一条命令完成备份./hf-download.sh --backup QuantTrio/MiniMax-M2-AWQ --backup-dir /mnt/ssd/models备份完顺带删掉缓存确认备份完整覆盖后再删除覆盖检查失败则拒绝删除./hf-download.sh --backup QuantTrio/MiniMax-M2-AWQ --backup-dir /mnt/ssd/models --delete -c只备份指定版本./hf-download.sh --backup QuantTrio/MiniMax-M2-AWQ --revision main --backup-dir /mnt/ssd/models查看备份里有什么 / 恢复模型./hf-download.sh --list-backup --backup-dir /mnt/ssd/models ./hf-download.sh --restore QuantTrio/MiniMax-M2-AWQ --backup-dir /mnt/ssd/models ./hf-download.sh --restore QuantTrio/MiniMax-M2-AWQ --backup-dir /mnt/ssd/models -c --copy-parallel恢复会把备份写回头节点缓存原有其他版本不受影响加-c后可像下载一样重新分发到全集群。备份在不支持符号链接的外接盘上会自动改为普通文件布局功能完全一致。常用选项速查表选项作用--list/--list-backup查看缓存 / 备份中的模型版本--delete删除模型可与--backup连用先备后删--backup/--restore备份到 / 从--backup-dir恢复--cleanup清理无引用的旧版本--revision ref按哈希、前缀或分支/标签选中单个版本--force跳过删除、清理确认-c, --copy-to [hosts]把操作扩展到集群节点--copy-parallel并行分发到所有节点--format/--sort列表的输出格式与排序--config file指定.env配置文件-u, --user user指定 SSH 用户名相关文件与延伸阅读主脚本hf-download.sh缓存清点与备份逻辑在 hf-cache.py节点自动发现与.env配置autodiscover.sh完整的命令说明与集群操作章节README.md双节点与多节点网络配置docs/NETWORKING.md集群启动脚本launch-cluster.sh掌握以上命令后配合./run-recipe.sh recipe --setup的一键流程模型从下载到集群分发、清理再到备份恢复都能用最少的命令完成。【免费下载链接】spark-vllm-dockerDocker configuration for running VLLM on dual DGX Sparks项目地址: https://gitcode.com/gh_mirrors/sp/spark-vllm-docker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考