Xinference 部署 DeepSeek-V3.2-Exp 完全指南:671B MoE 模型的规格、引擎选择与启动配置
发布时间:2026/9/16 13:36:28 作者:尧图编辑部 阅读量:1,286

Xinference 部署 DeepSeek-V3.2-Exp 完全指南671B MoE 模型的规格、引擎选择与启动配置【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference本篇以 Xinference 内置模型文档 DeepSeek-V3.2-Exp 为主体完整解析该模型的上下文长度、能力标签、两套部署规格pytorch 与 AWQ 量化及对应的xinference launch启动命令并结合 llm_family.json 与 Backends 的源码级证据说明引擎vLLM / Transformers选择规则背后的判定逻辑帮助你在多卡集群上正确拉起这一 671B 参数的稀疏注意力实验模型。模型概览DeepSeek-V3.2-Exp 是什么DeepSeek-V3.2-Exp 是 DeepSeek 官方发布的实验性版本模型。按照官方描述它构建在 V3.1-Terminus 之上作为迈向下一代架构的中间步骤核心引入点是DeepSeek Sparse Attention稀疏注意力——一种面向长上下文场景、用于探索并验证训练与推理效率优化的稀疏注意力机制。在 Xinference 的模型族定义中该模型的关键元数据如下属性取值模型名称DeepSeek-V3.2-Exp上下文长度163840约 160K tokens支持语言en、zh能力标签chat、reasoning、hybrid、tools架构DeepseekV32ForCausalLM总参数量671BMoE激活参数量37B几点值得注意163840 的上下文长度正是稀疏注意力优化长上下文的直接体现Xinference 会依据该值进行 KV cache 与显存估算671B 总参数、37B 激活参数表明这是一个超大规模 MoEMixture-of-Experts模型——每个 token 只读取约 37B 的激活权重推理显存占用主要取决于总参数权重必须全部驻留而计算量接近一个 37B 稠密模型能力标签中的reasoninghybrid意味着它支持思考模式与非思考模式切换tools表示支持工具调用这些字段并非人工维护的文档而是由 llm_family.json 中的模型族定义自动生成到 模型索引 与各模型页面的文档与运行行为共享同一数据源。两套部署规格与启动命令Xinference 为该模型注册了两套 Model Spec对应不同的模型格式、量化方式与可用引擎。Spec 1pytorch 格式原始权重属性取值模型格式pytorch模型规模671B量化方式none可用引擎vLLM、TransformersModel IDdeepseek-ai/DeepSeek-V3.2-Exp模型来源Hugging Face、ModelScope启动命令xinference launch --model-engine ${engine} --model-name DeepSeek-V3.2-Exp \ --size-in-billions 671 --model-format pytorch --quantization ${quantization}由于该规格下 quantization 只有none一种取值实际执行时${quantization}固定替换为none--model-engine二选一# 使用 vLLM推荐支持 PagedAttention 与连续批处理 xinference launch --model-engine vllm --model-name DeepSeek-V3.2-Exp \ --size-in-billions 671 --model-format pytorch --quantization none # 或使用 Transformers xinference launch --model-engine Transformers --model-name DeepSeek-V3.2-Exp \ --size-in-billions 671 --model-format pytorch --quantization noneSpec 2AWQ 量化格式属性取值模型格式awq模型规模671B量化方式AWQ、AWQ-Lite可用引擎TransformersModel IDQuantTrio/DeepSeek-V3.2-Exp-{quantization}Hugging Face、tclf90/DeepSeek-V3.2-Exp-{quantization}ModelScope启动命令xinference launch --model-engine Transformers --model-name DeepSeek-V3.2-Exp \ --size-in-billions 671 --model-format awq --quantization AWQ # 或 --quantization AWQ-Lite为什么 AWQ 规格只有 Transformers 引擎这个差异不是文档疏漏而是由 Xinference 的引擎选择规则决定的。Backends 文档给出了 Xinference 选择 vLLM 的条件模型格式为pytorch、gptq、awq、fp4、fp8或bnb之一当格式为pytorch时量化必须是none当格式为awq时量化必须是Int4系统为 Linux 且至少有一块 CUDA 设备内置模型的名称出现在 vLLM 支持列表中。DeepSeek-V3.2-Exp已列入 vLLM 支持列表pytorch none的规格满足全部条件但 AWQ 规格的量化取值是AWQ/AWQ-Lite而非Int4不满足第三条 awq 子条件因此该规格只能落到 Transformers 引擎。这也解释了为什么文档中 Spec 2 的引擎列表只有 Transformers。关于虚拟环境模型族定义中为 DeepSeek-V3.2-Exp 声明了按引擎区分的依赖Transformers 引擎安装#transformers_dependencies#vLLM 引擎安装#vllm_dependencies#与#system_numpy#。从源码结构看这对应 Xinference 的 per-model 虚拟环境机制——拉起该模型时会在隔离环境中同步对应引擎的依赖版本避免 671B 大模型所需的引擎依赖污染全局环境。模型族定义中的推理行为细节llm_family.json 中的完整定义还决定了该模型在推理服务层的若干行为这些对使用者是可观察、可依赖的思考模式定义了reasoning_start_tag为think、reasoning_end_tag为 【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考