1355  
查询码: 00000368
MR100_BI150+x86容器上运行Qwen2.5-vl模型(SDK4.3.0)
2025年09月05日 发布 ,于 2026年01月22日 编辑

确保已安装docker

下载Qwen2.5-VL模型权重

apt-get install git-lfs 或者yum install git-lfs 

mkdir -p /home/Qwen/

cd /home/Qwen/

git clone https://www.modelscope.cn/Qwen/Qwen2.5-VL-32B-Instruct.git

git clone https://www.modelscope.cn/Qwen/Qwen2.5-VL-72B-Instruct.git

git clone https://www.modelscope.cn/Qwen/Qwen2.5-VL-72B-Instruct-AWQ.git

准备镜像

联网拉取镜像

  • 拉取淄博镜像

docker pull harbor.iluvatar.com.cn:10443/saas/mr-bi150-4.3.0-x86-ubuntu20.04-py3.10-poc-llm-infer:v1.2.3

离线导入镜像

在windows上通过FileZilla工具下载,文件->站点管理器->新站点

协议:选择SFTP-SSH File Transfer Protocol

通过SFTP下载,SFTP下载地址和密码,请联系天数售后工程师获取



在远程站点内输入/client_tmp/support/,把mr-bi150-4.3.0-x86-ubuntu20.04-py3.10-poc-llm-infer:v1.2.3.tar文件拷贝到windows本地目录上,然后放到服务器/home目录下

执行 docker load -i /home/mr-bi150-4.3.0-x86-ubuntu20.04-py3.10-poc-llm-infer:v1.2.3.tar

粘贴图片

启动容器

docker run -dit -v /usr/src:/usr/src -v /lib/modules:/lib/modules -v /dev:/dev -v /home:/home --network=host --name=Qwen3 --ipc=host --privileged --cap-add=ALL --pid=host harbor.iluvatar.com.cn:10443/saas/mr-bi150-4.3.0-x86-ubuntu20.04-py3.10-poc-llm-infer:v1.2.3 /bin/bash

api测试

#server 端(容器内执行)

登录容器:

docker exec -it Qwen3 /bin/bash


按不同模型权重选择执行下面的命令:

Qwen2.5-VL-32B

export ENABLE_FLASH_ATTENTION_WITH_HEAD_DIM_PADDING=1

python3 -m vllm.entrypoints.openai.api_server --model /home/Qwen/Qwen2.5-VL-32B-Instruct/ --limit-mm-per-prompt image=5 --tensor_parallel_size 4 --gpu-memory-utilization 0.95 --host 0.0.0.0 --port 9997 --dtype bfloat16 --max-model-len 16384

Qwen2.5-VL-72B-Instruct

export ENABLE_FLASH_ATTENTION_WITH_HEAD_DIM_PADDING=1

python3 -m vllm.entrypoints.openai.api_server --model /home/Qwen/Qwen2.5-VL-72B-Instruct/ --limit-mm-per-prompt image=5 --tensor_parallel_size 8 --gpu-memory-utilization 0.95 --host 0.0.0.0 --port 9997 --dtype bfloat16 --max-model-len 16384


Qwen2.5-VL-72B-Instruct-AWQ

export ENABLE_FLASH_ATTENTION_WITH_HEAD_DIM_PADDING=1

python3 -m vllm.entrypoints.openai.api_server --model /home/Qwen/Qwen2.5-VL-72B-Instruct-AWQ/ --limit-mm-per-prompt image=5 --tensor_parallel_size 4 --gpu-memory-utilization 0.95 --host 0.0.0.0 --port 9997 --dtype bfloat16 --max-model-len 16384


client 端(宿主机执行)

可以访问互联网的情况下,对不同权重的模型选择执行下面的命令:

Qwen2.5-VL-32B

curl http://localhost:9997/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "/home/Qwen/Qwen2.5-VL-32B-Instruct/",
"messages": [

{
"role": "user",
"content": [
{"type": "text", "text": "描述这张图片"},
{"type": "image_url", "image_url": {"url": "https://img-s-msn-com.akamaized.net/tenant/amp/entityid/AAOEcgc.img"}}]}]}'


Qwen2.5-VL-72B-Instruct

curl http://localhost:9997/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "/home/Qwen/Qwen2.5-VL-72B-Instruct/",
"messages": [

{
"role": "user",
"content": [
{"type": "text", "text": "描述这张图片"},
{"type": "image_url", "image_url": {"url": "https://img-s-msn-com.akamaized.net/tenant/amp/entityid/AAOEcgc.img"}}]}]}'


Qwen2.5-VL-72B-Instruct-AWQ

curl http://localhost:9997/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "/home/Qwen/Qwen2.5-VL-72B-Instruct-AWQ/",
"messages": [

{
"role": "user",
"content": [
{"type": "text", "text": "描述这张图片"},
{"type": "image_url", "image_url": {"url": "https://img-s-msn-com.akamaized.net/tenant/amp/entityid/AAOEcgc.img"}}]}]}'


无法访问互联网的情况下,执行下面的命令:

准备一张jpg图片,名称改为test.jpg,放在home目录下

把该图片生成base64,写入payload.json文件(执行下列命令):

b64=$(base64 -w 0 /home/test.jpg)


cat > payload.json <<EOF
{
  "model": "/home/Qwen/Qwen2.5-VL-32B-Instruct/",
  "messages": [
    {
      "role": "user",
      "content": [
        {"type": "text", "text": "描述这张图片"},
        {"type": "image_url", "image_url": {"url": "data:image/png;base64,$b64"}}
      ]
    }
  ]
}
EOF


说明 "model": "/home/Qwen/Qwen2.5-VL-32B-Instruct/",这一行内容要根据不同的模型权重修改一下。

curl测试

curl http://localhost:9997/v1/chat/completions -H "Content-Type: application/json" -d @payload.json


笔记



 附件

附件类型

JPGJPG

天数智芯知识库系统 -V 5.2.7 -wcp