模型推理测试反馈结果为乱码,需要从系统环境配置、模型参数 两个维度去排查问题。
下面以Qwen3-8B模型推理测试为例:
测试环境
操作系统: Kylin V10 (GFB) 4.19.90-52.23.v2207.gfb08.ky10.aarch64
处理器:S5000C/64 aarch64
硬件加速卡 BI-V100 3.2.3 SDK
docker: 18.09.0
镜像: zibo.harbor.iluvatar.com.cn:30000/saas/bi100-3.2.3-aarch64-ubuntu20.04-py3.10-poc-llm-infer:v1.2.3
测试步骤
执行下面命令,导致乱码问题
python3 -m vllm.entrypoints.openai.api_server --model /share/fshare/common/models/Qwen/Qwen3-8B/ --gpu-memory-utilization 0.9 --max-num-batched-tokens 5120 --max-model-len 5120 --max-num-seqs 512 --host 127.0.0.1 --port 12345 --trust-remote-code -tp 2

解决方案
1、排查当前系统语言环境
local # 查看当前系统语言环境
#常用语言环境设置
export LANG=en_US.UTF-8
export LC_ALL=en_US.UTF-8
2、调整模型推理精度
调整参数--dtype bfloat16 不行
调整参数--dtype float16 推理结果正常