1218  
查询码: 00000340
mr100_bi150+x86容器上运行DeepSeek蒸馏模型(SDK4.3.0)
专家 2025年07月21日 发布 ,于 2026年06月01日 编辑

确保已安装docker

下载DeepSeek模型权重

apt-get install git-lfs 或者yum install git-lfs 

cd /home/deepseek-ai/

git clone https://www.modelscope.cn/deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B.git

git clone https://www.modelscope.cn/deepseek-ai/DeepSeek-R1-Distill-Qwen-7B.git

git clone https://www.modelscope.cn/deepseek-ai/DeepSeek-R1-Distill-Qwen-14B.git

git clone https://www.modelscope.cn/deepseek-ai/DeepSeek-R1-Distill-Qwen-32B.git

git clone https://www.modelscope.cn/deepseek-ai/DeepSeek-R1-Distill-Llama-8B.git

git clone https://www.modelscope.cn/deepseek-ai/DeepSeek-R1-Distill-Llama-70B.git


 准备镜像

联网拉取镜像

拉取淄博镜像

docker pull harbor.iluvatar.com.cn:10443/saas/mr-bi150-4.3.0-x86-ubuntu20.04-py3.10-poc-llm-infer:v1.2.3

离线拉取镜像


在windows上通过FileZilla工具下载,文件->站点管理器->新站点

协议:选择SFTP-SSH File Transfer Protocol

通过SFTP下载,SFTP下载地址和密码,请联系天数售后工程师获取



在远程站点内输入/client_tmp/support/,把文件mr-bi150-4.3.0-x86-ubuntu20.04-py3.10-poc-llm-infer-v1.2.3.tar拷贝到windows本地目录上,然后放到服务器/home目录下

执行 docker load -i /home/mr-bi150-4.3.0-x86-ubuntu20.04-py3.10-poc-llm-infer-v1.2.3.tar

粘贴图片

启动容器

docker run -dit -v /usr/src:/usr/src -v /lib/modules:/lib/modules -v /dev:/dev -v /home:/home --network=host --name=test --ipc=host --privileged --cap-add=ALL --pid=host harbor.iluvatar.com.cn:10443/saas/mr-bi150-4.3.0-x86-ubuntu20.04-py3.10-poc-llm-infer:v1.2.3 /bin/bash


进入容器

docker exec -it test bash

运行offline_inference测试

export VLLM_ENFORCE_CUDA_GRAPH=1
export VLLM_FORCE_USE_CUDA_GRAPH=1 

cd /root/apps/llm-modelzoo/inference/Qwen/vllm


python3 offline_inference.py --model /home/deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B/ --max-tokens 256 --max-model-len 2048 -tp 1 --temperature 0.55


python3 offline_inference.py --model /home/deepseek-ai/DeepSeek-R1-Distill-Qwen-7B/ --max-tokens 256 -tp 1 --temperature 0.55 --max-model-len 2048


python3 offline_inference.py --model /home/deepseek-ai/DeepSeek-R1-Distill-Qwen-14B/ --max-tokens 256 -tp 2  --temperature 0.55 --max-model-len 2048


python3 offline_inference.py --model /home/deepseek-ai/DeepSeek-R1-Distill-Qwen-32B/ --max-tokens 256 -tp 4  --temperature 0.55 --max-model-len 2048


cd /root/apps/llm-modelzoo/inference/LLama/vllm


python3 offline_inference.py --model /home/deepseek-ai/DeepSeek-R1-Distill-Llama-8B --max-tokens 256 -tp 1 --temperature 0.55 --max-model-len 8192


python3 offline_inference.py --model /home/deepseek-ai/DeepSeek-R1-Distill-Llama-70B/ --max-tokens 256 -tp 8  --temperature 0.55 --distributed-executor-backend ray --max-seq-len 8192 --gpu-memory-utilization 0.97 --max-model-len 8192

api测试

(注:当前 --max-model-len≥8192时,需要加上--max-seq-len-to-capture=8192(这个值需要和max-model-len参数值对应,例如--max-model-len 10240 --max-seq-len-to-capture=10240)

cd ~/apps/llm-modelzoo/benchmark/vllm
# server 端

export VLLM_ENFORCE_CUDA_GRAPH=1
export VLLM_FORCE_USE_CUDA_GRAPH=1 


python3 -m vllm.entrypoints.openai.api_server --model /home/deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B/ --gpu-memory-utilization 0.9 --max-num-batched-tokens 5120 --max-model-len 2048 --max-num-seqs 256 --host 0.0.0.0 --port 1234 --trust-remote-code


python3 -m vllm.entrypoints.openai.api_server --model /home/deepseek-ai/DeepSeek-R1-Distill-Qwen-7B/ --gpu-memory-utilization 0.9 --max-num-batched-tokens 5120 --max-model-len 2048 --max-num-seqs 256 --host 0.0.0.0 --port 1234 --trust-remote-code


python3 -m vllm.entrypoints.openai.api_server --model /home/deepseek-ai/DeepSeek-R1-Distill-Qwen-14B/ --gpu-memory-utilization 0.9 --max-num-batched-tokens 5120 --max-model-len 2048 --max-num-seqs 256 -tp 2 --host 0.0.0.0 --port 1234 --trust-remote-code


python3 -m vllm.entrypoints.openai.api_server --model /home/deepseek-ai/DeepSeek-R1-Distill-Qwen-32B/ --gpu-memory-utilization 0.9 --max-num-batched-tokens 5120 --max-model-len 2048 --max-num-seqs 256 -tp 4 --host 0.0.0.0 --port 1234 --trust-remote-code


python3 -m vllm.entrypoints.openai.api_server --model /home/deepseek-ai/DeepSeek-R1-Distill-Llama-8B/ --gpu-memory-utilization 0.9 --max-num-batched-tokens 8192 --max-model-len 8192 --max-seq-len-to-capture=8192 --max-num-seqs 256 -tp 1 --host 0.0.0.0 --port 1234 --trust-remote-code


python3 -m vllm.entrypoints.openai.api_server --model /home/deepseek-ai/DeepSeek-R1-Distill-Llama-70B/ --gpu-memory-utilization 0.9 --max-num-batched-tokens 8192 --max-model-len 8192 --max-seq-len-to-capture=8192 --max-num-seqs 256 -tp 8 --host 0.0.0.0 --port 1234 --trust-remote-code

# client 端
python3 benchmark_serving_tokens.py --model /home/deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B/ --host 0.0.0.0 --port 1234 --num-prompts 32 --input-tokens 256 --output-tokens 128 --time-interval 0.5 


python3 benchmark_serving_tokens.py --model /home/deepseek-ai/DeepSeek-R1-Distill-Qwen-7B/ --host 0.0.0.0 --port 1234 --num-prompts 32 --input-tokens 256 --output-tokens 128 --time-interval 0.5


python3 benchmark_serving_tokens.py --model /home/deepseek-ai/DeepSeek-R1-Distill-Qwen-32B/ --host 0.0.0.0 --port 1234 --num-prompts 32 --input-tokens 256 --output-tokens 128 --time-interval 0.5


python3 benchmark_serving_tokens.py --model /home/deepseek-ai/DeepSeek-R1-Distill-Qwen-14B/ --host 0.0.0.0 --port 1234 --num-prompts 32 --input-tokens 256 --output-tokens 128 --time-interval 0.5


python3 benchmark_serving_tokens.py --model /home/deepseek-ai/DeepSeek-R1-Distill-Llama-8B/ --host 0.0.0.0 --port 1234 --num-prompts 32 --input-tokens 256 --output-tokens 128 --time-interval 0.5


python3 benchmark_serving_tokens.py --model /home/deepseek-ai/DeepSeek-R1-Distill-Llama-70B/ --host 0.0.0.0 --port 1234 --num-prompts 32 --input-tokens 256 --output-tokens 128 --time-interval 0.5

笔记




 附件

附件类型

PNGPNG

天数智芯知识库系统 -V 5.2.7 -wcp