00000502
sdk4.4版、X86环境、MR100卡
镜像下载
离线下载
sftp -P 29880 iluvatar_mr@iftp.iluvatar.com.cn 访问密码请联系天数售后
get /client_tmp/support/4.4/vllm0.17.0-4.4.0-x86.v6.tar /home/
docker load -i vllm0.17.0-4.4.0-x86.v6.tar
或者在线获取
docker pull registry.iluvatar.com.cn:10443/customer/sz/vllm0.17.0-4.4.0-x86:v6
docker run -dit -v /usr/src:/usr/src -v /lib/modules:/lib/modules -v /dev:/dev -v /data:/data -v /home:/home --network=host --name=glm-4.7-test --ipc=host --privileged --cap-add=ALL --pid=host registry.iluvatar.com.cn:10443/customer/sz/vllm0.17.0-4.4.0-x86:v6 /bin/bash
进入容器
docker exec -it glm-4.7-test /bin/bash
modelscope download --model ZhipuAI/GLM-4.7-Flash --local_dir /home/models/GLM-4.7-Flash
直接下载已量化权重
modelscope download --model iluvatar-corex/GLM-4.7-Flash-W4A8 /home/models/GLM-4.7-Flash-W4A8
2)权重量化
先下载量化脚本
密码 联系天数售后工程师
sftp -P 29880 iluvatar_mr@iftp.iluvatar.com.cn
get /client_tmp/support/quant/w4a8_w8a8_quant.tar.gz /home
量化模型
cd /home
tar -zxvf w4a8_w8a8_quant.tar.gz
修改模型量化前和量化后的目录
vi /home/dev/configs/w4a8_int/glm4_7_flash.yml # 修改路径 和 生成路径
paths:
checkpoint_dir: /home/models/GLM-4.7-Flash
output_dir: /home/models/GLM-4.7-Flash-w4a8
runtime:
num_workers: 4 # 加速卡数量
export VLLM_W8A8_MOE_USE_W4A8=1
export VLLM_ENFORCE_CUDA_GRAPH=1
export VLLM_USE_V1=0
curl -X POST "http://localhost:8000/v1/completions" \
-H "Content-Type: application/json" \
-d '{
"model": "/home/models/GLM-4.7-Flash-w4a8/",
"prompt": "请详细介绍一下人工智能\n",
"temperature": 0.0,
"max_tokens": 512
}'
2、使用jq格式化curl输出
2、使用benchmark测试
python3 benchmark_serving.py --model /home/models/GLM-4.7-Flash-w4a8/ --dataset-name random --random-input-len 4096 --random-output-len 1024 --num-prompts 1 --host "0.0.0.0" --port 8000