00000368
apt-get install git-lfs 或者yum install git-lfs
mkdir -p /home/Qwen/
cd /home/Qwen/
git clone https://www.modelscope.cn/Qwen/Qwen2.5-VL-32B-Instruct.git
git clone https://www.modelscope.cn/Qwen/Qwen2.5-VL-72B-Instruct.git
git clone https://www.modelscope.cn/Qwen/Qwen2.5-VL-72B-Instruct-AWQ.git
docker pull harbor.iluvatar.com.cn:10443/saas/mr-bi150-4.3.0-x86-ubuntu20.04-py3.10-poc-llm-infer:v1.2.3
在windows上通过FileZilla工具下载,文件->站点管理器->新站点
协议:选择SFTP-SSH File Transfer Protocol
通过SFTP下载,SFTP下载地址和密码,请联系天数售后工程师获取
在远程站点内输入/client_tmp/support/,把mr-bi150-4.3.0-x86-ubuntu20.04-py3.10-poc-llm-infer:v1.2.3.tar文件拷贝到windows本地目录上,然后放到服务器/home目录下
执行 docker load -i /home/mr-bi150-4.3.0-x86-ubuntu20.04-py3.10-poc-llm-infer:v1.2.3.tar
docker run -dit -v /usr/src:/usr/src -v /lib/modules:/lib/modules -v /dev:/dev -v /home:/home --network=host --name=Qwen3 --ipc=host --privileged --cap-add=ALL --pid=host harbor.iluvatar.com.cn:10443/saas/mr-bi150-4.3.0-x86-ubuntu20.04-py3.10-poc-llm-infer:v1.2.3 /bin/bash
登录容器:
docker exec -it Qwen3 /bin/bash
按不同模型权重选择执行下面的命令:
export ENABLE_FLASH_ATTENTION_WITH_HEAD_DIM_PADDING=1
python3 -m vllm.entrypoints.openai.api_server --model /home/Qwen/Qwen2.5-VL-32B-Instruct/ --limit-mm-per-prompt image=5 --tensor_parallel_size 4 --gpu-memory-utilization 0.95 --host 0.0.0.0 --port 9997 --dtype bfloat16 --max-model-len 16384
export ENABLE_FLASH_ATTENTION_WITH_HEAD_DIM_PADDING=1
python3 -m vllm.entrypoints.openai.api_server --model /home/Qwen/Qwen2.5-VL-72B-Instruct/ --limit-mm-per-prompt image=5 --tensor_parallel_size 8 --gpu-memory-utilization 0.95 --host 0.0.0.0 --port 9997 --dtype bfloat16 --max-model-len 16384
export ENABLE_FLASH_ATTENTION_WITH_HEAD_DIM_PADDING=1
python3 -m vllm.entrypoints.openai.api_server --model /home/Qwen/Qwen2.5-VL-72B-Instruct-AWQ/ --limit-mm-per-prompt image=5 --tensor_parallel_size 4 --gpu-memory-utilization 0.95 --host 0.0.0.0 --port 9997 --dtype bfloat16 --max-model-len 16384
可以访问互联网的情况下,对不同权重的模型选择执行下面的命令:
curl http://localhost:9997/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "/home/Qwen/Qwen2.5-VL-32B-Instruct/",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "描述这张图片"},
{"type": "image_url", "image_url": {"url": "https://img-s-msn-com.akamaized.net/tenant/amp/entityid/AAOEcgc.img"}}]}]}'
curl http://localhost:9997/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "/home/Qwen/Qwen2.5-VL-72B-Instruct/",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "描述这张图片"},
{"type": "image_url", "image_url": {"url": "https://img-s-msn-com.akamaized.net/tenant/amp/entityid/AAOEcgc.img"}}]}]}'
curl http://localhost:9997/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "/home/Qwen/Qwen2.5-VL-72B-Instruct-AWQ/",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "描述这张图片"},
{"type": "image_url", "image_url": {"url": "https://img-s-msn-com.akamaized.net/tenant/amp/entityid/AAOEcgc.img"}}]}]}'
无法访问互联网的情况下,执行下面的命令:
b64=$(base64 -w 0 /home/test.jpg)
cat > payload.json <<EOF
{
"model": "/home/Qwen/Qwen2.5-VL-32B-Instruct/",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "描述这张图片"},
{"type": "image_url", "image_url": {"url": "data:image/png;base64,$b64"}}
]
}
]
}
EOF
说明: "model": "/home/Qwen/Qwen2.5-VL-32B-Instruct/",这一行内容要根据不同的模型权重修改一下。