阿里云模型部署PAI平台使用手册

内容纲要

一、PAI

二、EAS

三、DSW

I、入口

aliyun.com -> 控制台 -> 人工智能平台PAI -> 左侧菜单栏 -> 模型开发与训练 -> 交互式建模(DSW) -> 开发机实例(新建实例) -> 做配置

II、写入配置

file

file

file

III、部署模型

1、检查

1.1 查看操作系统版本

模版:PRETTY_NAME="Ubuntu 24.04.2 LTS"

cat /etc/os-releas

1.2、查看 Python 环境版本

python --version

1.3、查看 GPU/PPU 信息

nvidia-smi

1.4 docker部署大模型

file

docker验证

docker info

正确返回:
Client: Docker Engine – Community
Version: 28.1.0
Context: default
Debug Mode: false

看到docker info输出,就是Docker Engine。它表明当前环境中已经安装并成功启动了 docker-ce、docker-ce-cli、containerd.io 和 docker-compose-plugin 这四个核心组件。
简单来说,docker info 能正常显示信息,就说明整个 Docker 引擎已经准备就绪,可以直接使用 docker 和 docker compose 命令了。

1.5 无需锁定docker版本
非标准安装方式:云厂商为了优化性能和兼容性,通常会将 Docker 引擎直接打包进系统镜像,而不是通过 apt 安装。这意味着 docker 命令是一个独立的可执行文件,而不是由 dpkg 管理的软件包。

IV 问题解决

1、检查 PPU 环境是否正常

可以运行以下命令来验证宿主机和 Docker 是否已准备好:

1.1 检查宿主机 PPU 状态

file

“驱动与 SDK 版本不匹配”和“存在 CUDA 不兼容文件”
这两个问题会直接导致容器内无法正确调用 PPU 加速卡,甚至引发程序崩溃或性能异常。
失败项影响分析

  1. Driver version mismatch PPU SDK version(驱动版本与 SDK 版本不匹配)
    当前状态:Driver Version: 1.3.2,PPU SDK Version: 2.0.0。
    影响:这是最严重的问题。PPU SDK 2.0.0 是为新驱动设计的,旧驱动 1.3.2 无法支持其新特性或接口,会导致容器内程序启动失败、算子报错或性能大幅下降。
    解决方案:需要升级 PPU 驱动至与 SDK 2.0.0 匹配的版本。根据阿里云官方文档,SDK 2.0.0 需要搭配驱动 v2.0.0 或更高版本。可以联系阿里云技术支持或在 DSW 控制台检查是否有可用的驱动更新镜像。

  2. Found CUDA incompatible files containing ‘nv_fatbin’(发现包含 ‘nv_fatbin’ 的 CUDA 不兼容文件)
    当前状态:系统中存在多个包含 nv_fatbin 的文件,如 libLLVM-20.so、torch/test/cuda_cub_test 等。
    影响:这些文件是 NVIDIA CUDA 编译器的产物,与 PPU 的编译器不兼容。当程序加载这些库时,可能会触发错误的代码路径,导致运行时错误或性能劣化。
    解决方案:这些文件通常来自预装的 PyTorch 或其他 CUDA 依赖包。可以通过以下命令清理:

find / -name "*.so" -exec grep -l "nv_fatbin" {} \; | xargs rm -f

1.2 检查 Docker 是否能识别 PPU
启动一个临时容器并尝试调用 PPU,如果容器内也能正常输出 PPU 信息,说明 Docker 已成功透传设备。

docker run --rm -it <你的PPU专用镜像名> bash
# 进入容器后执行
asys status --ppu-env

四、AI网关

发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注

滚动至顶部