702  
查询码: 00000588
mr100_bi150+arm容器上运行Qwen3.6(SDK4.4.0)
专家 2026年05月18日 发布 ,于 2026年06月04日 编辑

前提:已安装4.4.0驱动 

如未安装SDK,请参考如下指南:

https://ixkb.iluvatar.com.cn:9443/webdoc/view/Pub8a16948a9a4cb023019cad4d85300ef9.html(mr系列)

或者

https://ixkb.iluvatar.com.cn:9443/webdoc/view/Pub8a16948a9a4cb023019cad5937ca0f13.html(天垓150系列)  进行安装

镜像下载

没有网的情况下可以sftp上下载放到服务器上

密码 联系天数售后工程师
sftp -P 29880 iluvatar_mr@iftp.iluvatar.com.cn 
get /client_tmp/support/4.4/vllm0.17.0-4.4.0-aarch64.v6.tar /home
导入镜像
docker load -i /home/vllm0.17.0-4.4.0-aarch64.v6.tar

服务器能连外网情况下可以直接使用docker pull进行镜像拉取

docker pull registry.iluvatar.com.cn:10443/customer/sz/vllm0.17.0-4.4.0-aarch64:v6

创建容器 (data是数据盘,根据实际数据盘进行调整)

docker run -dit -v /usr/src:/usr/src -v /lib/modules:/lib/modules -v /dev:/dev -v /home:/home -v /data:/data --network=host --name=Qwen --pid=host --ipc=host --privileged --cap-add=ALL registry.iluvatar.com.cn:10443/customer/sz/vllm0.17.0-4.4.0-aarch64:v6 /bin/bash

模型下载(容器内)

docker exec -it Qwen bash


mkdir -p /data/model

cd /data/model

pip install modelscope

modelscope download --model Qwen/Qwen3.6-27B  --local_dir ./Qwen3.6-27B

modelscope download --model iluvatar-corex/Qwen3.6-27B-W8A8 --local_dir ./Qwen3.6-27B-W8A8

modelscope download --model Qwen/Qwen3.6-35B-A3B --local_dir ./Qwen3.6-35B-A3B

modelscope download --model iluvatar-corex/Qwen3.6-35B-A3B-W4A8 --local_dir ./Qwen3.6-35B-A3B-W4A8 

部署模型(容器内)

docker exec -it Qwen bash

Qwen3.6-27B-W8A8

export VLLM_RPC_TIMEOUT=50000
export VLLM_ENFORCE_CUDA_GRAPH=1
export VLLM_KV_DISABLE_CROSS_GROUP_SHARE=1

vllm serve  /data/model/Qwen3.6-27B-W8A8  --trust-remote-code -tp 2 --max-num-seqs 64  --enable-chunked-prefill --max-model-len 16384  --host 0.0.0.0 --port 1234 --gpu-memory-utilization 0.90 --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "level": 0}'

Qwen3.6-27B

export VLLM_RPC_TIMEOUT=50000
export VLLM_ENFORCE_CUDA_GRAPH=1
export VLLM_KV_DISABLE_CROSS_GROUP_SHARE=1

vllm serve  /data/model/Qwen3.6-27B --trust-remote-code -tp 4 --max-num-seqs 64  --enable-chunked-prefill --max-model-len 16384  --host 0.0.0.0 --port 1234 --gpu-memory-utilization 0.90   --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "level": 0}'

Qwen3.6-35B-A3B-W4A8

export VLLM_RPC_TIMEOUT=50000
export VLLM_ENFORCE_CUDA_GRAPH=1 
export VLLM_W8A8_MOE_USE_W4A8=1
export VLLM_KV_DISABLE_CROSS_GROUP_SHARE=1

vllm serve  /data/model/Qwen3.6-35B-A3B-W4A8 --trust-remote-code  -tp 1 --max-num-seqs 64  --enable-chunked-prefill --max-model-len 16384  --host 0.0.0.0 --port 1234 --gpu-memory-utilization 0.90   --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "level": 0}'

Qwen3.6-35B-A3B 

export VLLM_RPC_TIMEOUT=50000
export VLLM_ENFORCE_CUDA_GRAPH=1 
export VLLM_KV_DISABLE_CROSS_GROUP_SHARE=1

vllm serve  /data/model/Qwen3.6-35B-A3B  --trust-remote-code   -tp 4 --max-num-seqs 64  --enable-chunked-prefill --max-model-len 16384  --host 0.0.0.0 --port 1234 --gpu-memory-utilization 0.90   --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "level": 0}'

客户端进行测试

再起一个窗口,不进入容器,输入下面命令

curl http://0.0.0.0:1234/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "/data/model/Qwen3.6-27B",
    "messages": [
      {
        "role": "user",
        "content": "介绍一下湖南省常德市美食"
      }
    ],
    "temperature": 0.0,
    "chat_template_kwargs": {
      "enable_thinking": false
    },
    "max_tokens": 1024
  }'


笔记



  目录
    天数智芯知识库系统 -V 5.2.7 -wcp