110  
查询码: 00000638
在mr100_bi150+x86上部署模型Llama-3.3-70B-Instruct (SDK4.4.0)
专家 2026年07月08日 发布 ,于 2026年07月08日 编辑

一、测试环境

  • SDK版本:4.4.0
  • GPU型号:BI150
  • CPU架构:x86_64
  • 模型所需最低GPU数量:8

二、创建容器

1. 获取镜像

通过SFTP从指定服务器下载基础镜像文件:

sftp -P 29880 iluvatar_mr@iftp.iluvatar.com.cn
密码:请咨询天数售后
get /SDK_4.4.0/x86/sdk/corex-docker-installer-4.4.0-10.2-ubuntu20.04-llm-py3.10-x86_64.run

2. 部署镜像

执行安装脚本完成镜像部署:
bash corex-docker-installer-4.4.0-10.2-ubuntu20.04-llm-py3.10-x86_64.run

3. 创建容器

使用以下命令创建并启动容器:

docker run -dit \
-v /usr/src:/usr/src \
-v /lib/modules:/lib/modules \
-v /dev:/dev \
-v /data:/data \
-v /home:/home \
--network=host \
--name=Llama \
--ipc=host \
--privileged \
--cap-add=ALL \
--pid=host \
corex:4.4.0 \
/bin/bash

三、模型部署

以下操作在容器内执行

#进入容器

docker exec -it Llama bash

1. 下载权重

通过ModelScope下载 Llama-3.3-70B-Instruct模型权重:

pip install modelscope

pip install --upgrade modelscope

mkdir -p /data/models

cd /data/models

modelscope download --model LLM-Research/Llama-3.3-70B-Instruct --local_dir ./Llama-3.3-70B-Instruct

2. 启动模型

export TORCHDYNAMO_DISABLE=1
export VLLM_KV_DISABLE_CROSS_GROUP_SHARE=1
export VLLM_ENFORCE_CUDA_GRAPH=1
python3 -m vllm.entrypoints.openai.api_server --model /data/models/Llama-3.3-70B-Instruct/ --gpu-memory-utilization 0.9 --max-model-len 8192 --max-num-seqs 256 -tp 8 -pp 2 --host 0.0.0.0 --port 1234 --trust-remote-code


四、测试验证

1. 基础curl请求测试

curl http://127.0.0.1:1234/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "/data/models/Llama-3.3-70B-Instruct/",
    "messages": [
      {
        "role": "system",
        "content": "You are a helpful assistant. Please provide detailed, well-structured answers in Chinese."
      },
      {
        "role": "user",
        "content": "请详细介绍湖南省常德市的美食,包括特色菜品、小吃和推荐地点,分点说明。"
      }
    ],
    "temperature": 0.7,
    "max_tokens": 2048
  }'

  


笔记



  目录
    天数智芯知识库系统 -V 5.2.7 -wcp