00000613
docker run -dit \
-v /usr/src:/usr/src \
-v /lib/modules:/lib/modules \
-v /dev:/dev \
-v /data:/data \
-v /home:/home \
--network=host \
--name=test \
--ipc=host \
--privileged \
--cap-add=ALL \
--pid=host \
registry.iluvatar.com.cn:10443/customer/sz/vllm0.17.0-4.4.0-x86:v5 \
/bin/bash
#进入容器
docker exec -it test bash
pip install modelscope
modelscope download --model ZhipuAI/GLM-4.5-Air --local_dir /data/models/GLM-4.5-Air
或直接下载量化权重
通过SFTP从指定服务器下载量化脚本:
sftp -P 29880 iluvatar_mr@iftp.iluvatar.com.cn
密码:请咨询天数售后
get /client_tmp/jt/quant.tar.gz /home
cd /home
tar xvf quant.tar.gz
cd quant
python3 main.py --config configs/w4a8_int/glm4_5-air.yml
注意:根据环境,修改configs/w4a8_int/glm4_5-air.yml,指定模型权重路径
paths: checkpoint_dir: /data/models/GLM-4.5-Air output_dir: /data/models/GLM-4.5-Air-w4a8
export VLLM_ENFORCE_CUDA_GRAPH=1
export VLLM_W8A8_MOE_USE_W4A8=1
export VLLM_ATTENTION_BACKEND=FLASH_ATTN
vllm serve /data/models/GLM-4.5-Air-w4a8 -tp 2 -pp 2 --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "level": 0}' --disable_cascade_attn
curl -s -X POST http://127.0.0.1:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "/data/models/GLM-4.5-Air-w4a8",
"messages": [
{"role": "user", "content": "请给我简单介绍一下大型语言模型。"}
],
"temperature": 0.0,
"top_p": 0.95,
"top_k": 20,
"max_tokens": 4096
}'