337  
查询码: 00000651
Qwen3.5_35B_A3B模型部署(SDK4.4.0+X86)
2026年07月13日 发布 ,于 2026年07月13日 编辑

Qwen3.5_35B_A3B模型部署(SDK 4.4.0 + X86)

一、测试条件

  • SDK版本:4.4.0
  • GPU型号:MR100
  • 模型所需最低GPU数量:4
  • CPU架构:X86_64

二、创建容器

1、获取镜像

docker pull registry.iluvatar.com.cn:10443/customer/sz/vllm0.23.0-4.4.0-x86:v1

2、创建容器

docker run -dit -v /usr/src:/usr/src -v /lib/modules:/lib/modules -v /dev:/dev -v /data:/data -v /home:/home --network=host --name=Qwen3.5-35B-A3B-test1 --ipc=host --privileged --cap-add=ALL --pid=host registry.iluvatar.com.cn:10443/customer/sz/vllm0.23.0-4.4.0-x86:v1 /bin/bash

3、进入容器

docker exec -it Qwen3.5-35B-A3B-test1 bash

三、启动服务

1、魔搭上下载权重

pip install modelscope
pip install --upgrade modelscope
modelscope download --model Qwen/Qwen3.5_35B_A3B --local_dir /data/models/ Qwen3.5_35B_A3B

2、启动模型

export VLLM_RPC_TIMEOUT=50000
export VLLM_ENFORCE_CUDA_GRAPH=1

export VLLM_KV_DISABLE_CROSS_GROUP_SHARE=1


vllm serve /data/models/Qwen3.5-35B-A3B --trust-remote-code --tensor-parallel-size 4 --max-num-seqs 64 --enable-chunked-prefill --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --host 0.0.0.0 --port 8001 --gpu-memory-utilization 0.90 --allowed-local-media-path /data --media-io-kwargs '{"video": {"num_frames": -1}}' --compilation-config '{"mode": 0, "cudagraph_mode": "FULL_DECODE_ONLY"}' --allowed-local-media-path /data

四、curl请求测试

1、普通Curl请求测试

#使用v1 chat接口
curl http://127.0.0.1:8001/v1/chat/completions -H 'Content-Type: application/json' -d '{
"model": "/data/models/Qwen3.5-35B-A3B",
"messages": [{
"role": "user",
"content": [
{
"type": "video_url",
"video_url": {
}
},
{
"type": "text",
"text": "请简要描述这个视频的内容。"
}
]
}],
"max_tokens": 512,
"temperature": 0.7
}'


笔记



  目录
    天数智芯知识库系统 -V 5.2.7 -wcp