跳转至

命令速查

集群和资源

sinfo
sinfo -o "%P %a %l %D %t %G"
scontrol show partition
scontrol show node NODE
sacctmgr -nP show assoc user="$USER" format=Cluster,Account,User

提交

sbatch job.sh
srun --account=project-example --partition=gpu-full \
  --gres=gpu:h20:1 --time=00:05:00 command
salloc --account=project-example --partition=gpu-full \
  --gres=gpu:h20:1 --time=00:30:00

查看与取消

squeue --me
scontrol show job JOB_ID
sacct -X -j JOB_ID --format=JobID,JobName,Partition,State,Elapsed,ExitCode,AllocTRES
scancel JOB_ID

常用环境变量

变量 含义
$SLURM_JOB_ID 当前作业编号
$SLURM_JOB_NAME 作业名称
$SLURM_JOB_NODELIST 分配的节点列表
$SLURM_NNODES 分配的节点数
$SLURM_PROCID 当前任务的全局编号
$SLURM_LOCALID 当前节点内的任务编号
$CUDA_VISIBLE_DEVICES Slurm 暴露给当前任务的 GPU
$LOCAL_SCRATCH 作业节点本地目录
$SLURM_TMPDIR / $TMPDIR 作业临时子目录

当前配置摘要

项目
集群名 stellar-cluster
常规 SSH 入口 login01.cluster.stelledge.com,用于登录和文件传输
加速 SSH 入口 login.a.cluster.stelledge.com,按流量计费,仅用于 SSH 交互
Web 入口 https://slurm.cluster.stelledge.com(启用时)
VPC 出口代理 172.18.0.152:7890,仅集群内按需启用
OSS Bucket / 内网 Endpoint stellaredge / oss-cn-shanghai-internal.aliyuncs.com,见对象存储 OSS
完整 GPU 分区 gpu-full,gpu01–gpu02,每节点 8 × H20
MIG 分区 gpu-mig,gpu03–gpu04
MIG GRES h20_2g.24gbh20_3g.48gb
个人目录 /cluster-home/$USER,默认 200 GiB
项目目录 /project/<name>,默认 500 GiB/项目
作业临时盘 默认 100 GiB/节点,1 MiB–8 TiB
保留窗口 dataset/output/checkpoint 最多 48 小时

静态配置与实时状态

本页用于快速查找名称和默认策略。节点是否在线、资源是否空闲、用户关联和实际配额 都可能变化,应使用本页上方命令现场确认。

不要通过加速入口传输大文件

login.a.cluster.stelledge.com 会产生按量流量费用。scprsync、SFTP 和其他 大文件传输应连接 login01.cluster.stelledge.com