Qwen3.5_35B_A3B模型部署(SDK 4.4.0 + X86)
一、测试条件
- SDK版本:4.4.0
- GPU型号:MR100
- 模型所需最低GPU数量:4
- CPU架构:X86_64
二、创建容器
1、获取镜像
docker pull registry.iluvatar.com.cn:10443/customer/sz/vllm0.23.0-4.4.0-x86:v1
2、创建容器
docker run -dit -v /usr/src:/usr/src -v /lib/modules:/lib/modules -v /dev:/dev -v /data:/data -v /home:/home --network=host --name=Qwen3.5-35B-A3B-test1 --ipc=host --privileged --cap-add=ALL --pid=host registry.iluvatar.com.cn:10443/customer/sz/vllm0.23.0-4.4.0-x86:v1 /bin/bash
3、进入容器
docker exec -it
Qwen3.5-35B-A3B-test1 bash
三、启动服务
1、魔搭上下载权重
pip install modelscope
pip install --upgrade modelscope
modelscope download --model Qwen/Qwen3.5_35B_A3B --local_dir /data/models/
Qwen3.5_35B_A3B
2、启动模型
export VLLM_RPC_TIMEOUT=50000
export VLLM_ENFORCE_CUDA_GRAPH=1
export VLLM_KV_DISABLE_CROSS_GROUP_SHARE=1
vllm serve /data/models/Qwen3.5-35B-A3B --trust-remote-code --tensor-parallel-size 4 --max-num-seqs 64 --enable-chunked-prefill --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --host 0.0.0.0 --port 8001 --gpu-memory-utilization 0.90 --allowed-local-media-path /data --media-io-kwargs '{"video": {"num_frames": -1}}' --compilation-config '{"mode": 0, "cudagraph_mode": "FULL_DECODE_ONLY"}' --allowed-local-media-path /data
四、curl请求测试
1、普通Curl请求测试
#使用v1 chat接口
"model": "/data/models/Qwen3.5-35B-A3B",
"messages": [{
"role": "user",
"content": [
{
"type": "video_url",
"video_url": {
}
},
{
"type": "text",
"text": "请简要描述这个视频的内容。"
}
]
}],
"max_tokens": 512,
"temperature": 0.7
}'