命令速查¶
集群和资源¶
sinfo
sinfo -o "%P %a %l %D %t %G"
scontrol show partition
scontrol show node NODE
sacctmgr -nP show assoc user="$USER" format=Cluster,Account,User
提交¶
sbatch job.sh
srun --account=project-example --partition=gpu-full \
--gres=gpu:h20:1 --time=00:05:00 command
salloc --account=project-example --partition=gpu-full \
--gres=gpu:h20:1 --time=00:30:00
查看与取消¶
squeue --me
scontrol show job JOB_ID
sacct -X -j JOB_ID --format=JobID,JobName,Partition,State,Elapsed,ExitCode,AllocTRES
scancel JOB_ID
常用环境变量¶
| 变量 | 含义 |
|---|---|
$SLURM_JOB_ID |
当前作业编号 |
$SLURM_JOB_NAME |
作业名称 |
$SLURM_JOB_NODELIST |
分配的节点列表 |
$SLURM_NNODES |
分配的节点数 |
$SLURM_PROCID |
当前任务的全局编号 |
$SLURM_LOCALID |
当前节点内的任务编号 |
$CUDA_VISIBLE_DEVICES |
Slurm 暴露给当前任务的 GPU |
$LOCAL_SCRATCH |
作业节点本地目录 |
$SLURM_TMPDIR / $TMPDIR |
作业临时子目录 |
当前配置摘要¶
| 项目 | 值 |
|---|---|
| 集群名 | stellar-cluster |
| 常规 SSH 入口 | login01.cluster.stelledge.com,用于登录和文件传输 |
| 加速 SSH 入口 | login.a.cluster.stelledge.com,按流量计费,仅用于 SSH 交互 |
| Web 入口 | https://slurm.cluster.stelledge.com(启用时) |
| VPC 出口代理 | 172.18.0.152:7890,仅集群内按需启用 |
| OSS Bucket / 内网 Endpoint | stellaredge / oss-cn-shanghai-internal.aliyuncs.com,见对象存储 OSS |
| 完整 GPU 分区 | gpu-full,gpu01–gpu02,每节点 8 × H20 |
| MIG 分区 | gpu-mig,gpu03–gpu04 |
| MIG GRES | h20_2g.24gb、h20_3g.48gb |
| 个人目录 | /cluster-home/$USER,默认 200 GiB |
| 项目目录 | /project/<name>,默认 500 GiB/项目 |
| 作业临时盘 | 默认 100 GiB/节点,1 MiB–8 TiB |
| 保留窗口 | dataset/output/checkpoint 最多 48 小时 |
静态配置与实时状态
本页用于快速查找名称和默认策略。节点是否在线、资源是否空闲、用户关联和实际配额 都可能变化,应使用本页上方命令现场确认。
不要通过加速入口传输大文件
login.a.cluster.stelledge.com 会产生按量流量费用。scp、rsync、SFTP 和其他
大文件传输应连接 login01.cluster.stelledge.com。