486  
查询码: 00000502
MR100+GLM-4.7-Flash-w4a8模型部署(SDK4.4.0)
2026年03月04日 发布 ,于 2026年06月12日 编辑

一、测试条件

sdk4.4版、X86环境、MR100卡

镜像下载

离线下载

sftp -P 29880 iluvatar_mr@iftp.iluvatar.com.cn   访问密码请联系天数售后

get /client_tmp/support/4.4/vllm0.17.0-4.4.0-x86.v6.tar /home/

docker load -i vllm0.17.0-4.4.0-x86.v6.tar

或者在线获取

docker pull registry.iluvatar.com.cn:10443/customer/sz/vllm0.17.0-4.4.0-x86:v6

二、创建容器

docker run -dit -v /usr/src:/usr/src -v /lib/modules:/lib/modules -v /dev:/dev -v /data:/data -v /home:/home --network=host --name=glm-4.7-test --ipc=host --privileged --cap-add=ALL --pid=host registry.iluvatar.com.cn:10443/customer/sz/vllm0.17.0-4.4.0-x86:v6  /bin/bash

进入容器

docker exec -it glm-4.7-test /bin/bash

三、启动服务

1)魔搭上下载权重
参考此命令下载
pip install modelscope

modelscope download --model ZhipuAI/GLM-4.7-Flash --local_dir /home/models/GLM-4.7-Flash

直接下载已量化权重

modelscope download --model iluvatar-corex/GLM-4.7-Flash-W4A8 /home/models/GLM-4.7-Flash-W4A8

2)权重量化

先下载量化脚本

密码 联系天数售后工程师
sftp -P 29880 iluvatar_mr@iftp.iluvatar.com.cn 

get /client_tmp/support/quant/w4a8_w8a8_quant.tar.gz /home

量化模型

cd /home

tar -zxvf w4a8_w8a8_quant.tar.gz

修改模型量化前和量化后的目录

vi  /home/dev/configs/w4a8_int/glm4_7_flash.yml    # 修改路径 和 生成路径

paths:

  checkpoint_dir: /home/models/GLM-4.7-Flash
  output_dir: /home/models/GLM-4.7-Flash-w4a8

runtime:
  num_workers: 4              # 加速卡数量

python3 main.py --config glm4_7_flash.yml   # 注意glm4_7_flash.yml 文件可以写绝对路径,或者和main.py文件同目录
3)执行

export VLLM_W8A8_MOE_USE_W4A8=1

export VLLM_ENFORCE_CUDA_GRAPH=1 

export VLLM_USE_V1=0

vllm serve /home/models/GLM-4.7-Flash-w4a8/ -tp 4 -pp 1 --gpu-memory-utilization 0.9 --max-model-len 16384 --max-num-seqs 64 --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY","level": 0}'

四、测试

1、普通Curl请求测试(/v1/chat接口)

curl -X POST "http://localhost:8000/v1/completions" \
-H "Content-Type: application/json" \
-d '{
  "model": "/home/models/GLM-4.7-Flash-w4a8/",
  "prompt": "请详细介绍一下人工智能\n",
  "temperature": 0.0,
  "max_tokens": 512
}'
2、使用jq格式化curl输出

1)、安装jq
    apt-get update
    apt-get install jq  
2)、curl请求测试
    curl -s -X POST "http://localhost:8000/v1/completions" \
    -H "Content-Type: application/json" \
    -d '{
      "model": "/home/models/GLM-4.7-Flash-w4a8/",
      "prompt": "请介绍一下人工智能\n",
      "temperature": 0.0,
      "max_tokens": 512
    }' | jq -r '.choices[0].text'

2、使用benchmark测试

python3 benchmark_serving.py --model /home/models/GLM-4.7-Flash-w4a8/ --dataset-name random --random-input-len 4096 --random-output-len 1024 --num-prompts 1 --host "0.0.0.0" --port 8000


笔记



  目录
    天数智芯知识库系统 -V 5.2.7 -wcp