00000636
sftp -P 29880 iluvatar_mr@iftp.iluvatar.com.cn
密码:请咨询天数售后
get /SDK_4.4.0/x86/sdk/corex-docker-installer-4.4.0-10.2-ubuntu20.04-llm-py3.10-x86_64.run
docker run -dit \
-v /usr/src:/usr/src \
-v /lib/modules:/lib/modules \
-v /dev:/dev \
-v /data:/data \
-v /home:/home \
--network=host \
--name=Llama \
--ipc=host \
--privileged \
--cap-add=ALL \
--pid=host \
corex:4.4.0 \
/bin/bash
#进入容器
docker exec -it Llama bash
pip install modelscope
pip install --upgrade modelscope
mkdir -p /data/models
cd /data/models
modelscope download --model LLM-Research/Meta-Llama-3.1-8B-Instruct --local_dir ./Meta-Llama-3.1-8B-Instruct
export VLLM_RPC_TIMEOUT=50000
export VLLM_ENFORCE_CUDA_GRAPH=1
export VLLM_KV_DISABLE_CROSS_GROUP_SHARE=1
vllm serve /data/models/Meta-Llama-3.1-8B-Instruct --trust-remote-code -tp 1 --max-num-seqs 64 --enable-chunked-prefill --max-model-len 16384 --host 0.0.0.0 --port 1234 --gpu-memory-utilization 0.90 --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "level": 0}'
curl http://0.0.0.0:1234/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "/data/models/Meta-Llama-3.1-8B-Instruct",
"messages": [
{
"role": "user",
"content": "介绍一下湖南省常德市美食"
}
],
"temperature": 0.0,
"chat_template_kwargs": {
"enable_thinking": false
},
"max_tokens": 2048
}'