一、测试条件
- SDK版本:4.5.0
- GPU型号:MR100
- 模型所需最低GPU数量:4
- CPU架构:X86_64
二、安装SDK4.5.0
sftp -P 29880 iluvatar_mr@iftp.iluvatar.com.cn
# 密码请咨询天数售后
get /client_tmp/support/kk/corex-driver-linux64-4.5.0.20260619_x86_64.run
bash corex-driver-linux64-4.5.0.20260619_x86_64.run --disable-dkms
三、创建容器
1、获取镜像
docker pull registry.iluvatar.com.cn:10443/vllm_plugin/corex_vllm_plugin:0.23.0-corex-4.5.0.20260619-ubuntu24.04-py3.12-x86_64-v1
2、创建容器
docker run -dit -v /usr/src:/usr/src -v /lib/modules:/lib/modules -v /dev:/dev -v /data:/data -v /home:/home --network=host --name=gpt-oss-120b-W4A8 --ipc=host --privileged --cap-add=ALL --pid=host harbor.iluvatar.com.cn:10443/saas/mr-bi150-4.4.0-x86-ubuntu20.04-py3.10-poc-llm-infer:v1.2.4 /bin/bash
3、进入容器
docker exec -it gpt-oss-120b-W4A8 bash
四、启动服务
1、魔搭上下载权重
pip install modelscope
pip install --upgrade modelscope
modelscope download --model iluvatar-corex/gpt-oss-120b-W4A8 --local_dir /data/models/gpt-oss-120b-W4A8
2、启动模型
export VLLM_ENFORCE_CUDA_GRAPH=1
export VLLM_KV_DISABLE_CROSS_GROUP_SHARE=1
export VLLM_W8A8_MOE_USE_W4A8=1
export MOE_USE_W4A8=1
export VLLM_RPC_TIMEOUT=50000
vllm serve /data/models/gpt-oss-120b-W4A8 \
--host 0.0.0.0 \
--port 8000 \
--trust-remote-code \
--tensor-parallel-size 4 \
--gpu-memory-utilization 0.90 \
--max-model-len 8192 \
--max-num-seqs 64 \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--enable-chunked-prefill \
--enable-prefix-caching
五、curl请求测试
1、普通Curl请求测试
#使用v1 chat接口
curl -s -X POST "http://localhost:8000/v1/chat/completions" -H "Content-Type: application/json" -d '{
"model": "'"/data/models/gpt-oss-120b-W4A8"'",
"messages": [
{
"role": "user",
"content": "你好,请介绍一下人工智能"
}
],
"temperature": 0.0,
"chat_template_kwargs": {"enable_thinking": true}
}'
2、使用jq格式化curl输出
1)、安装jq
apt-get update
apt-get install jq
2)、curl请求测试
curl -s -X POST "http://localhost:8000/v1/chat/completions" -H "Content-Type: application/json" -d '{
"model": "'"/data/models/gpt-oss-120b-W4A8"'",
"messages": [
{
"role": "system",
"content": "You are a helpful assistant."
},
{
"role": "user",
"content": "请介绍一下人工智能"
}
],
"temperature": 0.0,
"chat_template_kwargs": {"enable_thinking": true}
}' | jq -r '.choices[0].message.content'
六、Benchmark测试
1、进入容器,执行测试
docker exec -it gpt-oss-120b-W4A8 bash
vllm bench serve --model /data/models/gpt-oss-120b-W4A8 --num-prompt 1 --max-concurrency 1 --port 8000 --random_input_len 1024 --random_output_len 1024