135  
查询码: 00000612
mr100_bi150+x86通过sglang运行qwen3-32B模型(SDK4.4.0)
专家 2026年06月10日 发布 ,于 2026年06月10日 编辑


一、测试环境

  • SDK版本:4.4.0
  • GPU型号:MR100、BI150、BI150s
  • 模型所需最低GPU数量:4卡BI150、8卡MR100
  • CPU架构:X86_64
  • Docker镜像:corex-docker-installer-4.4.0-10.2-ubuntu20.04-llm-py3.10-x86_64.run

二、创建容器

1. 获取镜像

离线环境通过SFTP从指定服务器下载基础镜像文件:

sftp -P 29880 iluvatar_mr@iftp.iluvatar.com.cn # 密码:请联系天数售后工程师 

get /SDK_4.4.0/x86/sdk/corex-docker-installer-4.4.0-10.2-ubuntu20.04-llm-py3.10-x86_64.run /home

2. 部署镜像

镜像部署:


bash /home/corex-docker-installer-4.4.0-10.2-ubuntu20.04-llm-py3.10-x86_64.run --silent

3. 创建容器

使用以下命令创建并启动容器:
docker run -dit \ -v /usr/src:/usr/src \ -v /lib/modules:/lib/modules \ -v /dev:/dev \ -v /data:/data \ -v /home:/home \ --network=host \ --name=sglang \ --ipc=host \ --privileged \ --cap-add=ALL \ --pid=host \ corex:4.4.0 \ /bin/bash

三、模型部署

以下操作在容器内执行

#进入容器

docker exec -it sglang bash

1. 下载权重

通过ModelScope下载模型权重:

mkdir -p /data/models
cd /data/models/
modelscope download --model Qwen/Qwen3-32B --local_dir ./Qwen3-32B

2. 启动模型

export SGLANG_KV_CACHE_FORMAT=NHD
python3 -m sglang.launch_server --model-path /data/models/Qwen3-32B \
    --host 0.0.0.0 \
    --port 30000 \
    --tp 8 \
    --chunked-prefill-size 2048 \
    --attention-backend triton\
    --page-size 16 \
    --mem-fraction-static 0.9 \
    --trust-remote-code \
    --disable-custom-all-reduce \
    --disable-cuda-graph \
    --disable-radix-cache

四、测试验证

1. 基础curl请求测试

curl http://localhost:30000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
     "model": "/data/models/Qwen3-32B",
     "messages": [
       {"role": "user", "content": "你好,请介绍一下湖南省常德市。"}
     ],
     "temperature": 0.7,
     "max_tokens": 2048
   }'

笔记



  目录
    天数智芯知识库系统 -V 5.2.7 -wcp