开始使用集群¶
StellarEdge 是使用 Slurm 调度的 GPU 集群。所有计算任务都应从登录节点提交,
1 · 登录使用 FreeIPA 账户连接常规或加速 SSH 入口,首次登录会准备集群资源。 2 · 提交选择项目账户,通过 sbatch 或 srun 请求 GPU。 3 · 存储区分个人目录、项目共享目录和节点本地临时盘。 4 · 检查查看排队原因、退出码和资源使用情况。
加速 SSH 入口只用于交互访问
login.a.cluster.stelledge.com 按流量计费,请勿通过它传输大文件。文件上传和下载
使用常规入口 login01.cluster.stelledge.com。
五分钟快速作业¶
登录后,先确认身份和可用分区:
创建 hello-gpu.sh。把 project-example 替换成你所属的项目账户:
hello-gpu.sh
#!/usr/bin/env bash
#SBATCH --job-name=hello-gpu
#SBATCH --account=project-example
#SBATCH --partition=gpu-full
#SBATCH --gres=gpu:h20:1
#SBATCH --time=00:05:00
#SBATCH --output=slurm-%j.out
set -euo pipefail
hostname
nvidia-smi -L
echo "job=${SLURM_JOB_ID} scratch=${LOCAL_SCRATCH}"
提交并查看结果:
sbatch hello-gpu.sh
squeue --me
sacct -X -j JOB_ID --format=JobID,State,Elapsed,ExitCode
cat slurm-JOB_ID.out
项目账户是计算授权
public 只用于登录和存储,不能运行 CPU 或 GPU 作业。提交计算任务时必须使用
已获授权的 project-* 账户。用 sacctmgr -nP show assoc user=$USER
format=Account 查看自己的关联。
当前资源轮廓¶
gpu-fullgpu01–gpu02 · 每节点 8 × H20
gpu-miggpu03–gpu04 · 24 GiB / 48 GiB MIG
本地临时盘默认每节点 100 GiB · 作业后保留 48 小时
这些数值来自当前仓库配置,不代表某一时刻的空闲量。以 sinfo、squeue 和
scontrol show node 的实时结果为准。
使用原则¶
- 在 login01 编辑代码、提交任务和查看状态,不在登录节点执行重计算。
- 持久数据放在
$HOME或/project/<项目名>,不要只留在本地临时盘。 - 明确申请 GPU、内存、时间和每节点临时盘,避免长期占用空闲资源。
- 作业结束后检查
State与ExitCode;拿到作业编号不等于作业成功。
访问 Docker Hub、GitHub 等外部服务遇到网络问题时,参阅 出口代理。代理需要显式启用,不会自动改变系统网络。