166  
查询码: 00000635
在mr100_bi150+x86上部署Qwen3-30B-A3B-Instruct-2507-w4a8 (SDK4.4.0)
专家 2026年07月06日 发布 ,于 2026年07月06日 编辑

一、测试环境

  • SDK版本:4.4.0
  • GPU型号:MR100
  • CPU架构:x86_64
  • 模型所需最低GPU数量:1

二、创建容器

1. 获取镜像

通过SFTP从指定服务器下载基础镜像文件:

sftp -P 29880 iluvatar_mr@iftp.iluvatar.com.cn
密码:请咨询天数售后
get /SDK_4.4.0/x86/sdk/corex-docker-installer-4.4.0-10.2-ubuntu20.04-llm-py3.10-x86_64.run

2. 部署镜像

执行安装脚本完成镜像部署:
bash corex-docker-installer-4.4.0-10.2-ubuntu20.04-llm-py3.10-x86_64.run

3. 创建容器

使用以下命令创建并启动容器:

docker run -dit \
-v /usr/src:/usr/src \
-v /lib/modules:/lib/modules \
-v /dev:/dev \
-v /data:/data \
-v /home:/home \
--network=host \
--name=qwen3 \
--ipc=host \
--privileged \
--cap-add=ALL \
--pid=host \
corex:4.4.0 \
/bin/bash

三、模型部署

以下操作在容器内执行

#进入容器

docker exec -it qwen3 bash

量化模型

模型下载
mkdir -p /data/models

cd /data/models

pip3 install modelscope

modelscope download --model Qwen/Qwen3-30B-A3B-Instruct-2507  --local_dir ./Qwen3-30B-A3B-Instruct-2507
下载量化脚本
密码联系天数工程师
sftp -P 29880 iluvatar_mr@iftp.iluvatar.com.cn 

get /client_tmp/support/w4a8/bf16toInt4.py /home/

量化模型

python3 bf16toInt4.py --input-fp8-hf-path /data/models/Qwen3-30B-A3B-Instruct-2507/ --output-int8-hf-path /data/models/Qwen3-30B-A3B-w4a8 --group-size -1 --format TN --version 2

部署模型

2. 启动模型

export VLLM_ENFORCE_CUDA_GRAPH=1
export TORCHDYNAMO_DISABLE=1
export VLLM_W8A8_MOE_USE_W4A8=1
export PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True

vllm serve /data/models/Qwen3-30B-A3B-w4a8 \
  --trust-remote-code \
  --tensor-parallel-size 1 \
  --max-model-len 8192 \
  --enable-chunked-prefill \
  --gpu-memory-utilization 0.95 \
  --disable-cascade-attn \
  --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "level": 0}' \
  --host 127.0.0.1 \
  --port 12345


四、测试验证

1. 基础curl请求测试

curl 127.0.0.1:12345/v1/completions -H "Content-Type: application/json" -d '{"model":"/data/models/Qwen3-30B-A3B-w4a8", "prompt":"介绍一下湖南常德美食", "temperature":0.0, "max_tokens":1024}'


笔记



  目录
    天数智芯知识库系统 -V 5.2.7 -wcp