4900  
查询码: 00000403
天数智芯SDK安装实操手册V1.0
专家 2025年11月18日 发布 ,于 2026年03月25日 编辑


版权声明

未经天数智芯书面许可,不得以任何形式或方式将本文档的任何部分复制,传播,转录或翻译成任何语言。


免责声明

天数智芯可以随时对本文档或本文档中描述的产品进行改进和/或更改。本文档包括与天数智芯产品有关的信息,作为说明典型应用的一种方式。因此,不一定提供足以进行生产设计的完整信息。对于本文档中内容的准确性或完整性,天数智芯不做任何陈述或保证。


联系方式

地址:上海市闵行区陈行公路2168号3栋

电话: 021-68886607

网址:https://www.iluvatar.com/


版本:V1.0

日期:2025-11-18



1 安装概览

天数智算软件栈⽀持主流的x86、C86、ARM架构及其他非主流架构,本安装指南是关于主流x86、C86、ARM架构的安装说明,其他非主流架构设备的安装指南请联系天数售后工程师获取。

说明:

天数智算软件栈仅支持Linux系统。

安装天数智算软件栈需要root用户或者root权限,本文所有操作示例均在root用户权限下完成

安装组件

组件

内容

软件栈

包括天数智芯加速卡驱动、函数库、编译器、ixSMI、ixPROF、ixKN、 ixSYS、ixGDB等⼯具

测试工具

包括带宽测试工具、矩阵算力测试工具、P2P性能测试工具和通讯库性能测试工具

示例脚本(可选)

深度学习框架网络模型测试脚本、常用模型推理的示例脚本等corex-samples-*.run包)

2 软件包获取

2.1  天数智芯加速卡软件包获取方式

天数智芯官网 https://www.iluvatar.com/

注:非天数智芯官网注册用户,请自行注册。

2.2  CUDA头文件获取方式必须首先下载项

•  直接联系天数智芯售后获取


如果不清楚需要什么类型或版本的哪些包,请联系天数智芯售后工程师获得支持。

2.3 上传软件包

按照上述方法获取所有需要的软件包,然后上传到目标设备的操作系统下即可。


注意:

在上传到目标设备软件包的时候,必须遵守最终用户对数据传输的规范和制度,比如是否可以用U盘,是否可以用网络方式传输等。

前置条件检查

3.1 确认Above 4G Decoding项是否为Enabled

天数加速卡显存容量都大于4G,所以需要在BIOS下设置Above 4G Decoding项为Enabled,设置页面示例如下:

3-1:Above 4G Decoding项示例1

Resizable Bar Nvidia y AMD SAM | Placas Chinas

3-2:Above 4G Decoding项示例2

对于AMD系列CPU平台,可能需要设置下列所有项:

3-3:AMD平台Above 4G Decoding相关项示例

3.2 查看设备是否安装或识别到了天数加速卡

查询命令

lspci -n -d: | grep 1e3e

如果有返回结果,说明系统已经安装了天数加速卡,如下图:

3-4识别到16张智铠50加速卡


3-5:识别到8张天垓150S加速卡(该卡为1卡双芯)

注意

上述查询结果的第一列为加速卡的BDF,下文相关命令会用到这个值

3.3 确认加速卡的速率和带宽是否正常

天数加速卡PCIe速率和带宽均为PCIe Gen4和x16查看加速卡的速率及带宽是否正常。

查询命令:spci -vvs [加速卡BDF] | grep "LnkSta:",如:

lspci -vvs 19:00.0 | grep "LnkSta:"

正常信息如下:

LnkSta: Speed 16GT/s (ok), Width x16 (ok)

异常信息如下:

LnkSta: Speed 8GT/s (downgraded)), Width x16 (ok)     #降了速率

LnkSta: Speed 16GT/s (ok), Width x8 (downgraded    #降了带宽

如果只是一张卡出现了上述异常,请重新对加速卡进行插拔或对调一下位置,如果问题没有消失,而是跟着卡走,初步确认为加速卡本体不良。

如果全部卡出现的异常情况是一致的,请联系计算机整机厂商,确认问题所在,是否有修正方案。

3.4 确认加速卡内存地址分配是否正确

查看内存地址分配情况。运行天数智芯加速卡要求显卡内存32G部分型号的卡为16GB地址正确地分配在Region上。

查询命令

lspci -vvv -n -d: | grep -A 10 1e3e | grep -E "1e3e|Memory"

例如,您得到以下输出内容,则说明内存地址分配正确。

19:00.0 1200: 1e3e:0002

Region 0: Memory at 21f000000000 (64-bit, prefetchable)[size=32G]

Region 2: Memory at a5d00000 (32-bit, non-prefetchable) [size=256K]]

如果上述返回结果如下图:

19:00.0 1200: 1e3e:0002

Region 0: Memory at 21f000000000 (64-bit, prefetchable) [disableed] [size=32G]

Region 2: Memory at a5d00000 (32-bit, non-prefetchable) [disableed] [size=256K]]

则说明内存地址分配不正确,需要设置一下,命令为:setpci -s [BDF] command=0x06,如:

setpci -s 19:00.0 command=0x06

多张卡设置的执行命令为:

for I in ` lspci -n -d: | grep 1e3e | awk '{print $1}'`;do setpci -s $i command=0x06;done

3.5 关闭系统内核自动升级

3.5.1 使用yum作为软件包管理器的系统

关闭内核自动升级命令:

echo "exclude=kernel*" >>/etc/yum.conf

3.5.2使用apt作为软件包管理器的系统

关闭内核自动升级命令:

apt-mark hold linux-image-generic linux-headers-generic linux-headers-$(uname -r) linux-image-$(uname -r) linux-modules-$(uname -r) linux-modules-extra-$(uname -r)

3.6 设置 CPU 频率调节策略

通常CPU 频率调节策略有:performance(性能)、powersave(省电)、ondemand(按需)和 conservative(保守)四种模式,天数加速卡需要将CPU频率调整策略设置为performance模式。

3.6.1 查询当前系统的CPU 频率调节策略

不同的硬件平台和操作系统是否支持CPU 频率调节策略或支持调整哪些策略,可以用下面的命令来确认:

cat /sys/devices/system/cpu/cpufreq/policy0/scaling_available_governors

返回结果:

performance powersave

上述示例的返回信息,说明该平台支持performance powersave两种模式。

如果返回信息如下:

ls: 无法访问 '/sys/devices/system/cpu/cpu0/cpufreq/scaling_governor': 没有那个文件或目录

则说明该平台不支持或者在操作系统下不支持CPU频率调节策略。建议计算机厂家沟通是否能够将CPU调整为性能模式。

3.6.2 设置当前系统的CPU 频率调节策略

临时生效命令:

for i in `ls /sys/devices/system/cpu/ | grep cpu[0-9]`;do echo performance > /sys/devices/system/cpu/"$i"/cpufreq/scaling_governor;done

说明:该方法在系统重启后会失效,建议将该命令加入到root用户的环境变量中(普通用户无权限设置)。

3.7 检查系统依赖包

3.7.1 检查gcc和make是否已经安装。

检查命令:

gcc --version

make --version

如果上述命令没有返回gcc或make的版本信息,则说明系统没有安装。安装命令如下:

使用yum作为软件包管理器系统的安装命令:

yum install -y gcc make

使用apt作为软件包管理器系统的安装命令:

apt install -y gcc make


注意:

安装过程如果errorcode32,说明当前的kernel需要的gcc版本不低于12

gcc-12在线安装命令:

yum install -y gcc-12

apt install -y gcc-12 g++-12

如果原系统已经自带低于12版本的gcc,则需要替换源gcc的软链接:

cd /usr/bin

rm -f gcc

ln -s gcc-12 gcc

如果在线命令无法安装,说明当前系统软件仓库没有gcc-12的包,则需要添加其他软件仓库再安装或手动编译安装

因不同系统需要的依赖、软件仓库及安装方法有所差异,具体安装方法这里不再一一示例,请自行网络查询。

gcc-12离线安装包下载地址

wget https://mirrors.nju.edu.cn/gnu/gcc/gcc-12.1.0/gcc-12.1.0.tar.gz

3.7.2 检查kernel头文件是否已安装

检查是否安装与kernel版本一致的kernel头文件,命令为:

ls /lib/modules/$(uname -r)/build

返回结果示例:

3-6:kernel头文件查询结果

如果返回信息为空或者返回报错信息,则需要安装kernel头文件

使用yum作为软件包管理器系统的安装命令:

yum install -y kernel-devel-$(uname -r)  kernel-headers-$(uname -r)

使用apt作为软件包管理器系统的安装命令:

apt install linux-headers-$(uname -r)

加速卡固件检查和升级

4.1 加速卡固件版本和SDK版本的对应关系

低于4.3.0的SDK版本,加速卡固件和SDK版本没有特别要求,等于或高于4.3.0版本的SDK,则需要加速卡的固件为最新版本。要求如下:

加速卡型号

固件版本

加速卡型号简称

天垓150

v2.0.6

bi_v150

天垓150S

V2.0.0

bi_v150s

智铠100

v2.0.24

mr_100

智铠50

v2.0.20

mr_50

注意:

参考软件包获取章节下载固件。

4.2 加速卡固件升级

4.2.1 检查加速卡固件版本

固件检查方法,直接使用固件包检查,命令如下:

chmod +x ixfw-{gpu_type}-{fw_version}_{ARCH}.run

说明:{gpu_type}表示加速卡型号, {v.r.m}表示软件栈版本,{ARCH}表示适用的架构

./ ixfw-{gpu_type}-{fw_version}_{ARCH}.run-l示例如下:

4-1:加速卡固件查询结果

4.2.2 加速卡固件升级

如果加速卡固件版本不是目标版本,则需要升级固件

升级命令如下:

./ ixfw-{gpu_type}-{fw_version}_{ARCH}.run示例如下:

./ixfw-bi_v150s-2.0.0-x86_64.run

4-2:加速卡固件升级选择

用空格选择需要升级固件的加速卡,最后移到Upgrade这行回车即可。升级成功后会返回类似下图的信息:

4-3:加速卡固件升级成功返回的信息

如果让新固件生效,需要重启系统。

注意:如果之前已经安装加速卡驱动,升级固件前需要先卸载一下驱动,驱动卸载命令如下。

rmmod itr_peer_mem_drv

rmmod iluvatar

完成后再进行固件升级。

SDK安装

5.1 CUDA头文件安装必须首先执行这一步安装

unzip partial_install_cuda_header.zip

tar -zxvf partial_install_cuda_header.tar.gz

cd partial_install_cuda_header

bash install-cuda-header.sh

安装结果如下图:

5-1:CUDA头文件安装结果

5.2 驱动安装

5.2.1 只安装驱动(不含toolkit或toolbox

不包含toolkit或toolbox的驱动软件包,文件名通常是:

corex-driver-linux64- {v.r.m}_{ARCH}_10.2.run

比如:

corex-driver-linux64-4.3.0_x86_64_10.2.run

安装命令:

bash corex-driver-linux64- {v.r.m}_{ARCH}_10.2.run

示例如下:

图5-2:驱动安装(不含toolkit或toolbox)示例

5.2.2 含toolkit或toolbox驱动安装

包含toolkit或toolbox的驱动软件包,文件名通常是:

corex-installer-linux64- {v.r.m}_{ARCH}_10.2.run

比如:

corex-installer-linux64-4.3.0_x86_64_10.2.run

式安装方式

bash corex-installer-linux64- {v.r.m}_{ARCH}_10.2.run

示例如下:

bash corex-installer-linux64-4.3.0_x86_64_10.2.run

图5-3许可协议示例

输入accept后回车:

图5-4SDK安装勾选项示例

用空格勾选上述三项,然后将光标移到Install”行,回车,等待安装完成

图5-5:驱动安装成功后返回信息示例

安装完成。

修改环境变量:

vi /root/.bashrc

在最后添加如下内容:

export LD_LIBRARY_PATH=/usr/local/corex/lib:$LD_LIBRARY_PATH

export PATH=/usr/local/corex/bin:$PATH

示例如下:

图5-6系统变量修改示例

按Esc键,输入“:wq,回车。

source /root/.bashrc

输入ixsmi命令,能够显示输出界面则说明SDK安装成功,如下图:

图5-7:驱动安装成功后加速卡信息查询结果示例

静默安装方式

安装命令:

bash corex-installer-linux64- {v.r.m}_{ARCH}_10.2.run [选项一] [选项二] ……

说明

附加的安装选项因SDK版本的不同而异,可以通过下列命令查询某个版本SDK支持的选项,一般都支持--silent”、“--driver”、“--disable-dkms”这几个。

获取帮助信息的命令:

bash corex-installer-linux64- {v.r.m}_{ARCH}_10.2.run help

示例如下:

图5-8低版本SDK帮助信息示例

图5-9高版本SDK帮助信息示例

安装命令示例如下:

bash corex-installer-linux64-4.3.0_x86_64_10.2.run --silent --driver --toolkit --toolbox --disable-dkms

图5-10静默安装方式完成安装返回信息示例

修改环境变量及确认SDK安装是否成功,请参照上文内容操作。

5.3 驱动升级或重新安装

5.3.1 卸载驱动

在正常安装SDK后的系统,卸载SDK的方式如下:

卸载驱动

直接输入下面的命令:

corex-driver-uninstaller

示例如下:

图5-11卸载驱动返回信息示例

卸载toolkit、toolbox等其他SDK工具

如果在安装SDK时选择了toolkit、toolbox的,还需要运行下列命令进行卸载:

corex-uninstaller

示例如下:

图5-12卸载SDK其他工具返回信息示例

卸载残留目录

SDK卸载后,安装目录可能还会存在一个corex-{v.r.m}的目录,需要手动去删除一下(假如SDK默认安装路径为/usr/local):

cd /usr/local

rm -rf corex-{v.r.m} 如:rm -rf corex-4.3.0

5.3.2 升级或重新安装驱动

SDK卸载完成后,如果要升级或重新安装驱动,请按照上文驱动安装步骤操作。系统变量一般无需再次修改。

运行环境性能检测

6.1 测试工具

运行环境检测需要用到的工具为ix-gpu-tuner。该工具是一个综合性诊断工具,用于检查影响 D2H (Device to Host,设备到主机)H2D (Host to Device,主机到设备)P2P (Peer to Peer,点到点) 数据传输的系统设置PCIe配置以及GPU状态。4.3.0版本(含)之后的SDK,已经包含在toolbox内,工具路径为(驱动安装默认路径):

/usr/local/corex/toolbox/bin/

低于4.3.0版本的SDK,需要单独获取工具:

请联系天数智芯售后服务工程师获取。

6.2 测试方法

1. 进入工具目录

chmod +x ix-gpu-tuner #SDK自带工具的不用这一步

2. 执行命令

./ix-gpu-tuner --trace

返回结果示例如下:

6-1ix-gpu-tuner测试结果示例

6-2ix-gpu-tuner测试结果示例(延续图6-1内容)

6.3 测试结果说明

[IOMMU State]:

项为检测计算机IOMMU(ARM平台为SMMU)选项的状态。

天数智芯加速卡的运行环境要求非x86平台该项为OFF(包括C86),如果该项检测状态为ON,则需要在BIOS下设置为OFFx86平台不用off该项

[Broadcom Switch PEX89]:

的目的检测计算机的PEX89系列Switch芯片的运行模式。如果本机没有Switch芯片,会显示:No PCIe switch;如果没有PEX89系列Switch芯片,则该项不会显示任何信息

天数智芯的天垓150系列加速卡要求Switch芯片的运行模式为:Base Mode,如果不是这个模式,则需要联系服务器厂家调整为Base Mode模式(运行模式的更改需要用串口方式设置,比较麻烦,更推荐对switch芯片固件进行升级,目标版本为4.1.8以上)

[ACS State]:

检测计算机的PCIe访问控制服务(ACS)状态。

天数智芯加速卡的运行环境要求该项为OFF,如果该项检测状态为ON,可以在系统下使用天数ix-gpu-tuner工具设置为OFF,命令为

ix-gpu-tuner --disable-acs

[PCIe Extend Capabilities]:

该项为检测计算机的PCIe扩展功能。

建议这个功能设置为Enable状态,命令为

ix-gpu-tuner --enable-extend

[Completion Timeout Disable]:

该项为检测天数加速卡PCIeCompletion Timeout状态

建议这个功能设置为Disable状态,命令为

ix-gpu-tuner--set-timeoutDis 0

基本测试

基本测试工具路径:

SDK版本<4.0:

SDK安装路径(默认为/root/)/corex-samples-{v.r.m}-{ARCH}/test/

4.0≤SDK版本<4.3.0

SDK安装路径(默认为/usr/local)/corex-{v.r.m}/extras/test_demo/

SDK版本≥4.3.0

SDK安装路径(默认为/usr/local)/corex- {v.r.m}/toolbox/bin/

7.1 带宽测试

bandwidthTest测试工具可提供GPU memcpy带宽以及PCIe中的memcpy带宽数据,它能测试device到device之间的传输带宽, 也可测试分页内存和页锁定内存的host到device之间的传输带宽,以及分页内存和页锁定内存的device到host之间的传输带宽。

测试命令:

./bandwidthTest

测试结果示例:

7-1bandwidthTest测试结果示例

测试结果说明:

因GPU卡型号不同,这个测试结果也有所区别,只用关注:Result=是否为PASS即可。

7.2 矩阵算力测试

gemm_perf用于统计计算的GPU总用时以及TFlops/s

测试命令:

./gemm_perf --i --d UINT --l UINT

测试结果示例:

./gemm_perf --i 0 --d 2 --l 100

7-2gemm_perf测试结果示例1

7-3gemm_perf测试结果示例2

测试结果说明

每个型号GPU卡算力值及软硬件环境问题,算力结果有所差异,现场测试以能跑出算力结果即确定为PASS。如有算力值的疑问,请联系天数售后咨询。

gemm_perf相关参数说明:

7-4gemm_perf参数说明

使用--dur可指定测试时间,此方法适用于压测场景,示例:

./gemm_perf --i 0,1,2,3 --d 0 --dur 1

--i 0,1,2,3:指定了对0,1,2,3号卡进行测试。

--d 0:指定了采用FP32算力测试。

--dur 1:指定压测1小时(该值可以为小数,0.1代表6分钟)

注意:--l为定义测试循环次数,与--dur互斥,不能同时使用

7.3 P2P测试

p2pBandwidthTest工具提供基于DMA的天数智芯加速卡之间P2P传输性能测试。

测试命令:

./p2pBandwidthTest

测试结果示例输出内容的最后部分

7-5p2pBandwidthTest测试结果示例1

7-6p2pBandwidthTest测试结果示例2

测试结果说明

本测试旨在检测GPU卡之间的P2P通信性能。因每个型号计算机的设计差异,本测试没有标准的参考值,上图为一个比较理想的测试结果示例。

7.4 SimpleP2P测试

simpleP2P工具主要是为例检查P2P功能是否存在问题

SDK版本低于4.0的,没有自带工具请联系天数智芯售后服务工程师获取。

请拷贝至服务器后,执行chmod +x simpleP2P赋予simpleP2P工具执行权限。

其他版本SDK,该工具路径请参照本章《基本测试工具路径

测试命令:

./simpleP2P

测试结果示例:

7-7simpleP2P测试结果示例(2-1)

7-7simpleP2P测试结果示例(2-2)

测试结果说明

本测试主要是测试P2P功能是否存在问题,所以,测试结果中,只要每行测试数据为yes,及测试结果为:Test passed即可。如果测试结果出现fail的情况,结合ix-gpu-tuner工具的测试结果,非符合项予以修正后一般就没有问题了。

7.5 通讯库性能测试可选

通讯库性能测试,用于验证多卡通信OP的功能和性能基本测试工具all_reduce_perfSDK版本低于4.0的,没有自带工具,请联系天数智芯售后服务工程师获取

使用all_reduce_perf工具前,您需要确保如下基本操作已完成:

系统已经安装了openmpi

如果需要使用IB/ROCE网卡,您需要确保网卡驱动已安装、RDMA互通测试正常。

进行多机通信测试,需要配置SSH免密登录。

如果需要使用多进程多卡执行测试,需要确保环境中已安装Open MPI v4.0.7。

基本测试命令:

all_reduce_perf -b 8 -e 128M -f 2 -g "$gpus"#$gpus为GPU卡/核心数量

测试结果示例:

7-8all_reduce_perf测试结果示例

测试结果说明

如果能输出上述结果,说明通讯库可用,测试PASS。具体性能指标主要看上述第8列最下面的值,如:16.91。

自动化部署SDK

8.1 在线部署工具的使用

工具说明

在线部署工具可以在所有架构及常见系统自动安装所有依赖,检查并升级固件(需要之后重启生效)安装SDK,检查、检测并修正需要在BIOS修正项除外)上述手动安装所有执行项目,并自动生成检查、检测日志。

天数智芯GPU卡型号简称:

加速卡型号

型号简称

天垓150

bi_v150

天垓150S

bi_v150s

天垓150oam

bi_v150oam

天垓100

bi_v100

智铠100

mr_100

智铠100_duo

mr_100_duo

智铠50

mr_50

智铠50a

mr_50a

天垓200

tg_v200

天垓200oam

tg_v200oam

工具获取

工具名称:sdk_online_install_v1.0

下载地址:sftp -P 29880 iluvatar_corex@iftp.iluvatar.com.cn

所在目录:/client_tmp/shouhou/

登录密码:请联系天数智芯售后服务工程师获取

使用方法

1) 从天数官网或sftp下载对应GPU卡的固件包、SDK包,复制到sdk_online_install_v1.0/SDK/目录下对应型号的文件夹(参照上面的型号简称确认文件夹名称)

注:如果不清楚具体使用版本或需要哪些包,可以联系天数售后获得支持。

2) 将整个工具包sdk_online_install_v1.0复制到目标计算机系统下。

3) cd sdk_online_install_v1.0

4) chmod +x sdk_install.sh

5) ./sdk_install.sh

8-1输入操作执行项的序号

6) 在提示冒号后面输入需要执行的操作,比如要安装SDK后再收集检查日志,就输入12,回车

8-2输入需要执行的项目序号

7) 下一步提示是否要自定义SDK安装目录,如果要自定义安装目录,就输入y回车,在返回的提示行输入安装目录路径,如:/data/,回车:

8-3是否指定SDK安装目录

注:如果不指定SDK安装目录,在上述输入提示后输入n或者直接回车即可,默认安装目录为:/usr/local

8) 等待所有项目执行完成后,最后屏幕会打印如下信息,并返回执行目录:

8-4操作完成并回到操作目录

9) 最后请查看install_log目录下的检查日志,对照手动安装的检测项,确认SDK是否安装完成并正常使用。

8.2 离线部署工具的使用

工具获取

工具名称:sdk_offline_install_v1.0

下载地址:sftp -P 29880 iluvatar_corex@iftp.iluvatar.com.cn

所在目录:/client_tmp/shouhou/

登录密码:请联系天数智芯售后服务工程师获取

说明离线部署工具与在线部署工具的功能及运行方式一致,只是该工具包含了常用系统的离线依赖包,具体支持的系统请看tools\arm(x86)\gcc目录下的文件夹列表。

使用方法

1) 从天数官网或sftp下载对应GPU卡的固件包ixfw-bi_v150-2.0.6_x86_64.runSDK包corex-installer-linux64-4.3.8_x86_64_10.2.run,复制到sdk_offline_install_v1.0/SDK/目录下对应型号的文件夹(参照本章节的型号简称,确认文件夹名称)

注:如果不清楚具体使用版本或需要哪些包,可以联系天数售后获得支持。

2) 将整个工具包sdk_offline_install_v1.0复制到目标计算机系统下。

3) cd sdk_offline_install_v1.0

4) chmod +x sdk_install.sh

5) ./sdk_install.sh

8-5输入操作执行项的序号

6) 在提示冒号后面输入需要执行的操作,比如要安装SDK后再收集检查日志,就输入12,回车:

8-6输入需要执行的项目序号

7) 下一步提示是否要自定义SDK安装目录,如果要自定义安装目录,就输入y回车,在返回的提示行输入安装目录路径,如:/data/,回车:

8-7是否指定SDK安装目录

注:如果不指定SDK安装目录,在上述输入提示后输入n或者直接回车即可,默认安装目录为:/usr/local

8) 等待所有项目执行完成后,最后屏幕会打印如下信息,并返回到执行目录:

8-8操作完成并回到操作目录

9) 最后请查看install_log目录下的检查日志,对照手动安装的检测项,确认SDK是否安装完成并正常使用。


附件:SDK安装过程error code解释

9.1 Failed, error code: 11

问题原因

没有安装天数的CUDA头文件

解决方法

请参照本指导5.1章节安装天数CUDA头文件。

9.2 Failed, error code: 32

问题原因

当前系统的gcc版本不匹配。

解决方法

请参照本指导3.7.1章节安装gcc-12。

9.3 Failed, error code: 33

问题原因

缺失必要的依赖 (glibc, util-linux, grep, coreutils, binutils, kmod, gcc, make, binutils 等)。

解决方法

查看安装日志,确认缺失了哪些依赖,安装之

9.4 Failed, error code: 34

问题原因

该问题出现的系统为CentOS,原因是缺少libelf-dev, libelf-devel or elfutils-libelf-devel依赖包。

解决方法

yum install elfutils-libelf-devel

9.5 Failed, error code: 43

问题原因

kernel头文件版本不匹配或者没有安装。

解决方法

请参照本指导3.7.2章节安装kernel头文件。

9.6 Failed, error code: 45

问题原因

dkms开启导致。

解决方法

关掉dkms即可。

9.7 Failed, error code: 54

问题原因

天数智芯加速卡内存地址分配有误

解决方法

1. 按照本指导3.4章节的方式进行设置一下。

2. 执行 lspci 命令查看显卡内存地址分配情况。例如,您得到以下输出,则说明内存地址分配正确:

$ lspci -vvv | less

$ /1e3e

af:00.0 Processing accelerators: Device 1e3e:0001

...

Region 0: Memory at 3af800000000 (64-bit, prefetchable) [size=32G]

Region 2: Memory at e0e00000 (32-bit, non=prefetchable) [size=256K]

9.8 Failed, error code: 70/71

问题原因

安装包不完整

解决方法

检查安装包的完整性

9.9 Failed, error code: 74

问题原因

/tmp及安装⽬录 (默认为 /usr/local/corex) 的空间不足(这两个目录至少需要有18G以上空间

解决方法

给这两个目录扩容

9.10 Failed, error code: 102

问题原因

天数智芯加速卡对地址空间有要求,请确保BIOS启用了在大于4G地址空间的解码。

解决方法

1. 进入主机BIOS设置,确保 Above 4G Decoding 选项是开启状态。

2. 执行 lspci 命令查看显卡内存地址分配情况。例如,您得到以下输出,则说明内存地址分配正确:

$ lspci -vvv | less

$ /1e3e

af:00.0 Processing accelerators: Device 1e3e:0001

...

Region 0: Memory at 3af800000000 (64-bit, prefetchable) [size=32G]

Region 2: Memory at e0e00000 (32-bit, non=prefetchable) [size=256K]

9.11 其他错误代码

请查看安装日志联系天数售后服务获得支持。


上述报错代码因SDK版本的不同可能代表的意义有所差异,请同时参考安装日志描述的报错信息来确认报错原因


笔记



 附件

附件类型

TMPTMP PNGPNG JPEGJPEG

天数智芯知识库系统 -V 5.2.7 -wcp