Hi !
I have a very strange behavior that I am unable to explain.
A user have a job stuck in pending state, although there are enough
resources to run :
#########################################
[dernatr@io-login-01 ~]$ ml add io-local slurm-user-tools
[dernatr@io-login-01 ~]$ squeue_account_count_running_rss
dedicated-cpu@igroup Number of CPUs used by dedicated-cpu@igroup: 230
Total of memory used by dedicated-cpu@igroup: Total: 2.11 TB (1.92 TiB)
[dernatr@io-login-01 ~]$ squeue -A dedicated-cpu@igroup --state=pending
JOBID PARTITION NAME USER ST TIME NODES
NODELIST(REASON) 8949801_[0] cpu-dedic access_d doej PD
0:00 1 (AssocGrpMemLimit) 8936077 cpu-dedic sim11.13
gammaPD 0:00 2 (AssocGrpCpuLimit) 8930985
cpu-dedic sim33.23 gammaPD 0:00 2 (AssocGrpCpuLimit)
8930981 cpu-dedic sim32.14 gammaPD 0:00 2
(AssocGrpCpuLimit) 8930980 cpu-dedic sim31.61 gammaPD
0:00 2 (AssocGrpCpuLimit) 8930979 cpu-dedic sim23.21
gammaPD 0:00 2 (AssocGrpCpuLimit) 8930976
cpu-dedic sim22.27 gammaPD 0:00 2 (AssocGrpCpuLimit)
8930972 cpu-dedic sim21.23 gammaPD 0:00 2
(AssocGrpCpuLimit) 8930971 cpu-dedic sim13.24 gammaPD
0:00 2 (AssocGrpCpuLimit) [dernatr@io-login-01 ~]$ squeue -A
dedicated-cpu@inrae --state=running -o "%A %m %u %U %C" JOBID MIN_MEMORY
USER UID CPUS 8946435 64G orbital 1064 32 8929322 480G doej 2746 1
8925315 1420G omega 1294 6 8880518 5000M gamma1326 191
[dernatr@io-login-01 ~]$ scontrol show job 8949801_0 JobId=8949801
ArrayJobId=8949801 ArrayTaskId=0 JobName=access_d49_9
UserId=doej(2746) GroupId=igroup-infra(1819) MCS_label=N/A
Priority=1103 Nice=0 Account=dedicated-cpu@igroup QOS=dedicated
JobState=PENDING Reason=AssocGrpMemLimit Dependency=(null)
Requeue=0 Restarts=0 BatchFlag=1 Reboot=0 ExitCode=0:0
RunTime=00:00:00 TimeLimit=2-00:00:00 TimeMin=N/A
SubmitTime=2026-08-03T16:59:53 EligibleTime=2026-08-03T16:59:53
AccrueTime=2026-08-03T16:59:53 StartTime=Unknown EndTime=Unknown
Deadline=N/A SuspendTime=None SecsPreSuspend=0
LastSchedEval=2026-08-04T09:17:19 Scheduler=Main
Partition=cpu-dedicated AllocNode:Sid=io-login-01:1163082
ReqNodeList=(null) ExcNodeList=(null) NodeList= NumNodes=1
NumCPUs=1 NumTasks=1 CPUs/Task=1 ReqB:S:C:T=0:0:*:*
ReqTRES=cpu=1,mem=560G,node=1,billing=1 AllocTRES=(null)
Socks/Node=* NtasksPerN:B:S:C=0:0:*:* CoreSpec=* MinCPUsNode=1
MinMemoryNode=560G MinTmpDiskNode=0 Features=(null)
DelayBoot=00:00:00 OverSubscribe=OK Contiguous=0 Licenses=(null)
Network=(null) Command=/scratch/users/doej/run_access_d49_23.sh
WorkDir=/scratch/users/doej
AdminComment=159722b1-908e-47e2-82b1-08872ee64906
StdErr=/scratch/users/doej/slurm-8949801_0.err StdIn=/dev/null
StdOut=/scratch/users/doej/slurm-8949801_0.out TresPerTask=cpu=1
[dernatr@io-login-01 ~]$ show_detail_account_association
dedicated-cpu@igroup
Account Org Descr
GrpTRES Share MaxWall Def QOS QOS
-------------------------------------------------------
-------------------- ------------------------------
------------------------------ --------- ----------- ---------
--------------------
dedicated-cpu@igroup igroup
not_defined cpu=364,mem=3360G 1
dedicated dedicate [dernatr@io-login-01 ~]$ scontrol show
conf |grep -i mem AccountingStorageTRES =
cpu,mem,energy,node,billing,fs/disk,vmem,pages,gres/gpu:nvidia_a100_80gb_pcie,gres/gpu:nvidia_a100_80gb_pcie_1g.10gb,gres/gpu:nvidia_a100_80gb_pcie_4g.40gb,gres/gpu:nvidia_h100_80gb_hbm3,gres/gpu:nvidia_h100_80gb_hbm3_1g.10gb,gres/gpu:nvidia_h200,gres/gpu:nvidia_h200_1g.18gb
DefMemPerCPU = 2048 MaxMemPerNode = UNLIMITED
PropagateResourceLimitsExcept = MEMLOCK SelectTypeParameters =
CR_CORE_MEMORY MemorySwappiness = (null) [dernatr@io-login-01 ~]$
sshare -A dedicated-cpu@igroup --users=lambda,doej,omega,gamma |sort -k7
-rn dedicated-cpu@igroup doej 1 0.005495 782016 0.003362 0.335501
dedicated-cpu@igroup omega 1 0.005495 2239436 0.009627 0.335119
dedicated-cpu@igroup lambda 1 0.005495 48189472 0.207149 0.334353
dedicated-cpu@igroup gamma 1 0.005495 85232776 0.366384 0.333971
dedicated-cpu@igroup 1 0.030303 232632330 0.129448 Account User
RawShares NormShares RawUsage EffectvUsage FairShare
-------------------- ---------- ---------- ----------- -----------
------------- ----------
#########################################
As you can see this account has a memory limit set to 3.36T of RAM and
he is requesting 560G. The entire running job are taking 2.11 TB.
I also look at backfilling and fair sharing, but I don't see anything
that could block him.
Any idea may be useful,
Thanks,
Best regards,
R
--
ISDM Lundi/Mardi/Jeudi/Vendredi
ISEM Mercredi