1026  
查询码: 00000606
DeepSeek OCR模型部署(SDK4.4.0)
专家 2026年06月08日 发布 ,于 2026年06月10日 编辑

一、测试环境

  • SDK版本:4.4.0
  • GPU型号:MR100
  • 模型所需最低GPU数量:2
  • CPU架构:X86_64

二、创建容器

1. 获取镜像

通过SFTP从指定服务器下载基础镜像文件:
docker pull harbor.iluvatar.com.cn:10443/saas/mr-bi150-4.4.0-x86-ubuntu20.04-py3.10-poc-llm-infer:v1.2.3

2. 创建容器

使用以下命令创建并启动容器:
docker run -dit -v /usr/src:/usr/src -v /lib/modules:/lib/modules -v /dev:/dev -v /data:/data -v /home:/home --network=host --name=DeepSeek-OCR --ipc=host --privileged --cap-add=ALL --pid=host harbor.iluvatar.com.cn:10443/saas/mr-bi150-4.4.0-x86-ubuntu20.04-py3.10-poc-llm-infer:v1.2.3 /bin/bash

三、模型部署

以下操作在容器内执行

#进入容器 

docker exec -it DeepSeek-OCR bash

1. 下载权重

通过ModelScope下载DeepSeek-OCR模型权重:
pip install modelscope pip install --upgrade modelscope modelscope download --model deepseek-ai/DeepSeek-OCR --local_dir /data/models/DeepSeek-OCR

2. 启动服务

#设置环境变量
export VLLM_ENFORCE_CUDA_GRAPH=1
#启动API服务
vllm serve /data/models/DeepSeek-OCR --logits_processors vllm.model_executor.models.deepseek_ocr:NGramPerReqLogitsProcessor --no-enable-prefix-caching --mm-processor-cache-gb 0 --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "level": 0}' 

四、API功能验证

1. 基础连通性测试 

curl -s -X POST "http://localhost:8000/v1/chat/completions" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "/data/models/DeepSeek-OCR",
    "messages": [{"role": "user", "content": "hi"}],
    "max_tokens": 10
  }' | python3 -m json.tool

2. 图片识别测试(本地图片,注意修改图片路径)

curl -s -X POST "http://localhost:8000/v1/chat/completions" \
  -H "Content-Type: application/json" \
  -d "{
    \"model\": \"/data/models/DeepSeek-OCR\",
    \"messages\": [
      {
        \"role\": \"user\",
        \"content\": [
          {\"type\": \"text\", \"text\": \"Please extract all text from this image character by character, preserving the original layout\"},
          {\"type\": \"image_url\", \"image_url\": {\"url\": \"data:image/png;base64,$(base64 -w0 /data/test.png)\"}}
        ]
      }
    ],
    \"max_tokens\": 1024,
    \"temperature\": 0.0
  }"

五、性能基准测试

执行基准测试

进入容器执行性能测试。
vllm bench serve --model /data/models/DeepSeek-OCR --num-prompt 1 --max-concurrency 1 --port 8000 --random_input_len 1024 --random_output_len 1024


笔记



  目录
    天数智芯知识库系统 -V 5.2.7 -wcp