torchrun --nproc_per_node=8 \ --no-python \ nsys profile \ --capture-range=cudaProfilerApi \ --capture-range-end=stop \ --trace=cuda,nvtx,nccl,osrt \ --output=ddp-8gpu_%q{RANK} \ python train.py