83  
查询码: 00000613
GLM-4.5-Air-w4a8(x86_SDK4.4.0)
2026年06月11日 发布 ,于 2026年06月12日 编辑

GLM-4.5-Air-w4a8模型部署(SDK4.4.0)

一、测试环境

  • SDK版本:4.4.0
  • GPU型号:MR100
  • CPU架构:x86_64
  • 模型所需最低GPU数量:4

二、创建容器

1. 获取镜像


docker pull registry.iluvatar.com.cn:10443/customer/sz/vllm0.17.0-4.4.0-x86:v5

2. 创建容器

使用以下命令创建并启动容器:

docker run -dit \
-v /usr/src:/usr/src \
-v /lib/modules:/lib/modules \
-v /dev:/dev \
-v /data:/data \
-v /home:/home \
--network=host \
--name=test \
--ipc=host \
--privileged \
--cap-add=ALL \
--pid=host \
registry.iluvatar.com.cn:10443/customer/sz/vllm0.17.0-4.4.0-x86:v5 \
/bin/bash

三、模型部署

以下操作在容器内执行

#进入容器

docker exec -it test bash

1. 下载权重

通过ModelScope下载GLM-4.5-Air模型权重:

pip install modelscope 

modelscope download --model  ZhipuAI/GLM-4.5-Air --local_dir /data/models/GLM-4.5-Air

或直接下载量化权重

modelscope download --model Ma315235133/GLM-4.5-Air-w4a8 --local_dir /data/models/GLM-4.5-Air-w4a8

2. 量化模型

通过SFTP从指定服务器下载量化脚本:
sftp -P 29880 iluvatar_mr@iftp.iluvatar.com.cn
密码:请咨询天数售后
get /client_tmp/jt/quant.tar.gz /home

cd /home

tar xvf quant.tar.gz

cd quant

python3 main.py --config configs/w4a8_int/glm4_5-air.yml

注意:根据环境,修改configs/w4a8_int/glm4_5-air.yml,指定模型权重路径

paths:
  checkpoint_dir: /data/models/GLM-4.5-Air
  output_dir: /data/models/GLM-4.5-Air-w4a8


3. 启动模型

export VLLM_ENFORCE_CUDA_GRAPH=1

export VLLM_W8A8_MOE_USE_W4A8=1
export VLLM_ATTENTION_BACKEND=FLASH_ATTN

vllm serve /data/models/GLM-4.5-Air-w4a8 -tp 2 -pp 2  --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "level": 0}'  --disable_cascade_attn

四、测试验证

curl请求测试

curl -s -X POST http://127.0.0.1:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "/data/models/GLM-4.5-Air-w4a8",
    "messages": [
      {"role": "user", "content": "请给我简单介绍一下大型语言模型。"}
    ],
    "temperature": 0.0,
    "top_p": 0.95,
    "top_k": 20,
    "max_tokens": 4096
  }'


笔记



  目录
    天数智芯知识库系统 -V 5.2.7 -wcp