一、测试条件
sdk4.4版、X86环境
、MR100卡、镜像harbor.iluvatar.com.cn:10443/saas/mr-bi150-4.4.0-x86-ubuntu20.04-py3.10-poc-llm-infer:v1.2.3
二、创建容器
1、获取镜像
docker pull harbor.iluvatar.com.cn:10443/saas/mr-bi150-4.4.0-x86-ubuntu20.04-py3.10-poc-llm-infer:v1.2.3
2、创建容器
docker run -dit -v /usr/src:/usr/src -v /lib/modules:/lib/modules -v /dev:/dev -v /data:/data -v /home:/home --network=host --name=sdk440llminfer123 --ipc=host --privileged --cap-add=ALL --pid=host e72981920bdb /bin/bash
三、启动服务
1、魔搭上下载权重
pip install modelscope
modelscope download --model Qwen/Qwen3.5-4B --local_dir /data/models/
Qwen3.5-4B
modelscope download --model tclf90/Qwen3.5-4B-AWQ --local_dir /data/models/
Qwen3.5-4B-AWQ
2、环境准备
下载并安装vllm和numpy1.26.4
pip uninstall vllm && pip install vllm-0.11.2+corex.4.4.0-py3-none-any.whl
pip install numpy==1.26.4
或从此下载
sftp -P 29880 iluvatar_mr@iftp.iluvatar.com.cn (访问密码请咨询天数售后)
get /client_tmp/support/vllm_solution/vllm-0.11.2+corex.4.4.0-py3-none-any.whl

vllm-0.11.2+corex.4.4.0-py3-none-any.whl
下载 详情
3、启动模型
#Qwen3.5-4B
export VLLM_ENFORCE_CUDA_GRAPH=1
export VLLM_KV_DISABLE_CROSS_GROUP_SHARE=1
vllm serve /data/models/Qwen3.5-4B --trust-remote-code -tp 1 --max-num-seqs 64 --enable-chunked-prefill --max-model-len 16384 --host 0.0.0.0 --gpu-memory-utilization 0.90 --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "level": 0}'
#Qwen3.5-4B-AWQ
export VLLM_ENFORCE_CUDA_GRAPH=1
export VLLM_KV_DISABLE_CROSS_GROUP_SHARE=1
vllm serve /data/models/Qwen3.5-4B-AWQ \
--trust-remote-code \
-tp 1 \
--max-num-seqs 64 \
--enable-chunked-prefill \
--max-model-len 16384 \
--host 0.0.0.0 \
--gpu-memory-utilization 0.90 \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "level": 0}' \
--quantization awq
四、curl请求测试
1、普通Curl请求测试
#Qwen3.5-4B
-H "Content-Type: application/json" \
-d '{
"model": "/data/models/Qwen3.5-4B",
"prompt": "请详细介绍人工智能",
"max_tokens": 512,
"temperature": 0.7,
"top_p": 0.9
}'
#Qwen3.5-4B-AWQ
-H "Content-Type: application/json" \
-d '{
"model": "/data/models/Qwen3.5-4B-AWQ",
"prompt": "请详细介绍人工智能",
"max_tokens": 512,
"temperature": 0.7,
"top_p": 0.9
}'
2、使用jq格式化curl输出
1)、安装jq
apt-get update
apt-get install jq
2)、curl请求测试
#Qwen3.5-4B
-H "Content-Type: application/json" \
-d '{
"model": "/data/models/Qwen3.5-4B",
"prompt": "请介绍一下人工智能\n",
"temperature": 0.0,
"max_tokens": 512
}' | jq -r '.choices[0].text'
#Qwen3.5-4B-AWQ
-H "Content-Type: application/json" \
-d '{
"model": "/data/models/Qwen3.5-4B-AWQ",
"prompt": "请介绍一下人工智能\n",
"temperature": 0.0,
"max_tokens": 512
}' | jq -r '.choices[0].text'
五、Benchmark测试
1、benchmark工具下载
sftp -P 29880 iluvatar_mr@iftp.iluvatar.com.cn 访问密码请咨询天数售后
get /client_tmp/support/kk/vllm_benchmark.tar.gz /home/
2、进入容器,执行测试
docker exec -it sdk440llminfer123 bash
cd /data/models/vllm_benchmark
python3 benchmark_serving.py --model /data/models/Qwen3.5-4B --dataset-name random --random-input-len 4096 --random-output-len 4096 --num-prompts 1 --host "0.0.0.0" --port 8000