71  
查询码: 00000611
GLM-4.5-Air(x86_SDK4.4.0)
2026年06月10日 发布 ,于 2026年06月10日 编辑

GLM-4.5-Air模型部署(SDK4.4.0)

一、测试环境

  • SDK版本:4.4.0
  • GPU型号:MR100
  • CPU架构:x86_64
  • 模型所需最低GPU数量:16

二、创建容器

1. 获取镜像

docker pull registry.iluvatar.com.cn:10443/customer/sz/vllm0.17.0-4.4.0-x86:v5

2. 创建容器

使用以下命令创建并启动容器:

docker run -dit \
-v /usr/src:/usr/src \
-v /lib/modules:/lib/modules \
-v /dev:/dev \
-v /data:/data \
-v /home:/home \
--network=host \
--name=test \
--ipc=host \
--privileged \
--cap-add=ALL \
--pid=host \
registry.iluvatar.com.cn:10443/customer/sz/vllm0.17.0-4.4.0-x86:v5 \
/bin/bash

三、模型部署

以下操作在容器内执行

#进入容器

docker exec -it test bash

1. 下载权重

通过ModelScope下载GLM-4.5-Air模型权重:

pip install modelscope 

modelscope download --model  ZhipuAI/GLM-4.5-Air --local_dir /data/models/GLM-4.5-Air

2. 启动模型

export VLLM_ENFORCE_CUDA_GRAPH=1

export TORCHDYNAMO_DISABLE=1


vllm serve /data/models/GLM-4.5-Air -tp 4 -pp 4  --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "level": 0}'  --disable_cascade_attn

四、测试验证

curl请求测试

curl -s -X POST http://127.0.0.1:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "/data/models/GLM-4.5-Air",
    "messages": [
      {"role": "user", "content": "请给我简单介绍一下大型语言模型。"}
    ],
    "temperature": 0.0,
    "top_p": 0.95,
    "top_k": 20,
    "max_tokens": 4096
  }'


笔记



  目录
    天数智芯知识库系统 -V 5.2.7 -wcp