298  
查询码: 00000579
双机部署qwen3.5模型 (SDK4.4.0)
专家 2026年05月13日 发布 ,于 2026年05月13日 编辑

前提已安装4.4.0驱动 

如未安装SDK,请参考如下指南:

https://ixkb.iluvatar.com.cn:9443/webdoc/view/Pub8a16948a9a4cb023019cad9168850f71.html (mr系列)

或者

https://ixkb.iluvatar.com.cn:9443/webdoc/view/Pub8a16948a9a4cb023019cad814ae40f5d.html(天垓150系列)  进行安装

镜像下载

没有网的情况下可以sftp上下载放到服务器上

密码 联系天数售后工程师
sftp -P 29880 iluvatar_mr@iftp.iluvatar.com.cn 
get /client_tmp/support/4.4/vllm0.11.2-4.4.0-x86.v9.tar /home
导入镜像
docker load -i /home/vllm0.11.2-4.4.0-x86.v9.tar

服务器能连外网情况下可以直接使用docker pull进行镜像拉取

docker pull registry.iluvatar.com.cn:10443/customer/sz/vllm0.11.2-4.4.0-x86:v9

模型下载(在两台机器容器内)

docker exec -it Qwen3 bash

mkdir -p /data/model

pip install modelscope
modelscope download --model iluvatar-corex/Qwen3.5-122B-A10B-W4A8 --local_dir ./Qwen3.5-122B-A10B-W4A8

创建容器 (data是数据盘,根据实际数据盘进行调整)

机器1创建容器

docker run -dit -v /usr/src:/usr/src -v /lib/modules:/lib/modules -v /dev:/dev -v /home:/home -v /data:/data --network=host --name=Qwen3 --pid=host --ipc=host --privileged --cap-add=ALL registry.iluvatar.com.cn:10443/customer/sz/vllm0.11.2-4.4.0-x86:v9 /bin/bash

机器2创建容器

docker run -dit -v /usr/src:/usr/src -v /lib/modules:/lib/modules -v /dev:/dev -v /home:/home -v /data:/data --network=host --name=Qwen3 --pid=host --ipc=host --privileged --cap-add=ALL registry.iluvatar.com.cn:10443/customer/sz/vllm0.11.2-4.4.0-x86:v9 /bin/bash

创建脚本

在机器1(主节点)Qwen3容器内创建脚本

docker exec -it Qwen3 bash
cd /home
vi run.sh
export NCCL_SOCKET_IFNAME=ens24f0
export NCCL_NET=Socket
export NCCL_DEBUG=INFO
export GLOO_SOCKET_IFNAME=ens24f0

export VLLM_W8A8_MOE_USE_W4A8=1
export VLLM_ENGINE_ITERATION_TIMEOUT_S=1800
export VLLM_ENGINE_READY_TIMEOUT_S=1800

vllm serve /data/models/Qwen3.5-122B-A10B-w4a8  \
 --served-model-name  qwen3 \
 --pipeline-parallel-size 4 --tensor-parallel-size 4  \
 --trust-remote-code --max-model-len 262144  \
 --gpu-memory-utilization 0.8 \
 --enable-prefix-caching \
 --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "level": 0}' \
 --port=8000 \
 --max-num-batched-tokens 20384 --max-num-seqs 80 \
 --enforce-eager \
 --nnodes 2 --node-rank 0 --master-addr 172.16.0.101

在机器2(从节点)Qwen3容器内创建脚本

docker exec -it Qwen3 bash
cd /home
vi run.sh
export NCCL_SOCKET_IFNAME=ens24f0
export NCCL_NET=Socket
export NCCL_DEBUG=INFO
export GLOO_SOCKET_IFNAME=ens24f0

export VLLM_ENGINE_ITERATION_TIMEOUT_S=1800
export VLLM_ENGINE_READY_TIMEOUT_S=1800
export VLLM_W8A8_MOE_USE_W4A8=1

vllm serve /data/models/Qwen3.5-122B-A10B-w4a8  \
 --served-model-name  qwen3 \
 --pipeline-parallel-size 4 --tensor-parallel-size 4  \
 --trust-remote-code --max-model-len 262144  \
 --gpu-memory-utilization 0.8 \
 --enable-prefix-caching \
 --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "level": 0}' \
 --port=8000 \
 --max-num-batched-tokens 20384 --max-num-seqs 80 \
 --enforce-eager \
 --nnodes 2 --node-rank 1 --master-addr  172.16.0.101   --headless

运行模型

在机器1(主节点)Qwen3容器内运行脚本

docker exec -it Qwen3 bash
bash /home/run.sh

在机器2(从节点)Qwen3容器内运行脚本

docker exec -it Qwen3 bash
bash /home/run.sh
笔记



  目录
    天数智芯知识库系统 -V 5.2.7 -wcp