跳转至

开始使用集群

StellarEdge 是使用 Slurm 调度的 GPU 集群。所有计算任务都应从登录节点提交,

加速 SSH 入口只用于交互访问

login.a.cluster.stelledge.com 按流量计费,请勿通过它传输大文件。文件上传和下载 使用常规入口 login01.cluster.stelledge.com

五分钟快速作业

登录后,先确认身份和可用分区:

id
pwd
sinfo -o "%P %a %l %D %G"

创建 hello-gpu.sh。把 project-example 替换成你所属的项目账户:

hello-gpu.sh
#!/usr/bin/env bash
#SBATCH --job-name=hello-gpu
#SBATCH --account=project-example
#SBATCH --partition=gpu-full
#SBATCH --gres=gpu:h20:1
#SBATCH --time=00:05:00
#SBATCH --output=slurm-%j.out

set -euo pipefail
hostname
nvidia-smi -L
echo "job=${SLURM_JOB_ID} scratch=${LOCAL_SCRATCH}"

提交并查看结果:

sbatch hello-gpu.sh
squeue --me
sacct -X -j JOB_ID --format=JobID,State,Elapsed,ExitCode
cat slurm-JOB_ID.out

项目账户是计算授权

public 只用于登录和存储,不能运行 CPU 或 GPU 作业。提交计算任务时必须使用 已获授权的 project-* 账户。用 sacctmgr -nP show assoc user=$USER format=Account 查看自己的关联。

当前资源轮廓

gpu-fullgpu01–gpu02 · 每节点 8 × H20
gpu-miggpu03–gpu04 · 24 GiB / 48 GiB MIG
本地临时盘默认每节点 100 GiB · 作业后保留 48 小时

这些数值来自当前仓库配置,不代表某一时刻的空闲量。以 sinfosqueuescontrol show node 的实时结果为准。

使用原则

  1. 在 login01 编辑代码、提交任务和查看状态,不在登录节点执行重计算。
  2. 持久数据放在 $HOME/project/<项目名>,不要只留在本地临时盘。
  3. 明确申请 GPU、内存、时间和每节点临时盘,避免长期占用空闲资源。
  4. 作业结束后检查 StateExitCode;拿到作业编号不等于作业成功。

访问 Docker Hub、GitHub 等外部服务遇到网络问题时,参阅 出口代理。代理需要显式启用,不会自动改变系统网络。