一、测试条件
sdk4.4版、X86环境、MR100卡、基础镜像corex-docker-installer-4.4.0-10.2-ubuntu20.04-llm-py3.10-x86_64.run
二、创建容器
sftp -P 29880 iluvatar_mr@iftp.iluvatar.com.cn (访问密码请联系天数售后获取)
get /SDK_4.4.0/x86/sdk/corex-docker-installer-4.4.0-10.2-ubuntu20.04-llm-py3.10-x86_64.run
docker run -dit -v /usr/src:/usr/src -v /lib/modules:/lib/modules -v /dev:/dev -v /data:/data -v /home:/home --network=host --name=sdk440llm --ipc=host --privileged --cap-add=ALL --pid=host corex:4.4.0 /bin/bash
三、下载权重+量化
1、魔搭上下载权重
参考此命令下载
pip install modelscope
modelscope download --model MiniMax/MiniMax-M2.5 --local_dir /data/models/MiniMax-M2.5
modelscope download --model iluvatar-corex/MiniMax-M2.5-W4A8 --local_dir /data/models/MiniMax-M2.5-W4A8
2、量化模型
1)量化脚本下载
sftp -P 29880 iluvatar_mr@iftp.iluvatar.com.cn
get /client_tmp/support/quant/w4a8_w8a8_quant.tar.gz
2)下载后上传至服务器
3)进入/data/quant/configs/w4a8_int路径,修改Minimax量化脚本minimax_m2_5.yml
paths:
checkpoint_dir: /data/models/MiniMax-M2.5
output_dir: /data/models/MiniMax-M2.5-w4a8
注意:
根据自己的实际路径修改。
4)进入已经创建好的容器sdk440llm。
5)执行pip install natsort,安装量化需要的natsort
6)进入量化工具路径cd /data/quant/
7)量化模型
python3 main.py --config configs/w4a8_int/minimax_m2_5.yml
三、启动服务
1、启动服务
export VLLM_ENFORCE_CUDA_GRAPH=1
export TORCHDYNAMO_DISABLE=1
export VLLM_W8A8_MOE_USE_W4A8=1
vllm serve /data/models/MiniMax-M2.5-w4a8/ -tp 4 -pp 2 --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY","level": 0}' --trust-remote-code --disable-cascade-attn --dtype half --quantization compressed-tensors --max-model-len 16384 --host 0.0.0.0 --reasoning-parser minimax_m2
#注:--reasoning-parser 参数根据自己实际情况去加
四、curl请求测试
curl -X POST "http://localhost:8000/v1/chat/completions" \
-H "Content-Type: application/json" \
-d '{
"model": "/data/models/MiniMax-M2.5-w4a8/",
"messages": [
{"role": "user", "content": "请详细介绍人工智能"}
],
"max_tokens": 512
}'