582  
查询码: 00000575
Qwen3.6-27B-W8A8模型部署(SDK 4.4.0)
专家 2026年05月07日 发布 ,于 2026年06月03日 编辑

一、测试条件

sdk4.4版、X86环境 、MR100卡、镜像registry.iluvatar.com.cn:10443/customer/sz/vllm0.11.2-4.4.0-x86:v9

二、创建容器

1、获取镜像

docker pull registry.iluvatar.com.cn:10443/customer/sz/vllm0.11.2-4.4.0-x86:v9

2、创建容器

docker run -dit -v /usr/src:/usr/src -v /lib/modules:/lib/modules -v /dev:/dev -v /data:/data -v /home:/home --network=host --name=sdk440V9 --ipc=host --privileged --cap-add=ALL --pid=host registry.iluvatar.com.cn:10443/customer/sz/vllm0.11.2-4.4.0-x86:v9 /bin/bash

3、进入容器

docker exec -it sdk440V9 bash

三、启动服务

1、魔搭上下载权重

pip install modelscope
pip install --upgrade modelscope
modelscope download --model iluvatar-corex/Qwen3.6-27B-W8A8 --local_dir /data/models/Qwen3.6-27B-W8A8

2、启动模型

#Qwen3.6-27B-W8A8
export VLLM_RPC_TIMEOUT=50000
export VLLM_ENFORCE_CUDA_GRAPH=1
export VLLM_KV_DISABLE_CROSS_GROUP_SHARE=1
vllm serve /data/models/Qwen3.6-27B-W8A8 \
--port 8000 \
-tp 8 \
--max-model-len 262144 \
--reasoning-parser qwen3 \
--enable-chunked-prefill \
--enable-prefix-caching \
--swap-space 16 \
--api-server-count 4 \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "level": 0}'

四、curl请求测试

1、普通Curl请求测试

#使用v1 chat接口

-H "Content-Type: application/json" \
-d '{
"model": "/data/models/Qwen3.6-27B-W8A8",
"messages": [
{"role": "user", "content": "请详细介绍人工智能"}
],
"max_tokens": 1024
}'

#使用v1 completions接口

-H "Content-Type: application/json" \
-d '{
"model": "/data/models/Qwen3.6-27B-W8A8",
"prompt": "请详细介绍人工智能",
"max_tokens": 1024,
"temperature": 0.7,
"top_p": 0.9
}'

2、使用jq格式化curl输出

1)、安装jq

apt-get update
apt-get install jq

2)、curl请求测试

-H "Content-Type: application/json" \
-d '{
"model": "/data/models/Qwen3.6-27B-W8A8",
"prompt": "请介绍一下人工智能\n",
"temperature": 0.0,
"max_tokens": 512
}' | jq -r '.choices[0].text'

五、Benchmark测试

1、benchmark工具下载

sftp -P 29880 iluvatar_mr@iftp.iluvatar.com.cn    (访问密码请咨询天数售后)

get /client_tmp/support/kk/vllm_benchmark.tar.gz

2、进入容器,执行测试

docker exec -it sdk440V9 bash
cd /data/models/vllm_benchmark
python3 benchmark_serving.py --model /data/models/Qwen3.6-27B-W8A8 --dataset-name random --random-input-len 1024 --random-output-len 1024 --num-prompts 1 --host "0.0.0.0" --port 8000
笔记



  目录
    天数智芯知识库系统 -V 5.2.7 -wcp