-
Notifications
You must be signed in to change notification settings - Fork 4.6k
All issues
Issue creation is restricted in this repository
Issues
is:issue state:open
is:issue state:open
Search results
Track baseline functional CI failures observed during the TE 2.20 update
bugSomething isn't workingSomething isn't workingStatus: Open.#7700 In NVIDIA/Megatron-LM;Investigate MFSDP v2 persistent-storage memory assertion undershoot on H100
bugSomething isn't workingSomething isn't workingStatus: Open.#7699 In NVIDIA/Megatron-LM;Investigate GB200 GPT iteration-time slowdown after the TE 2.20 dependency-stack update
bugSomething isn't workingSomething isn't workingStatus: Open.#7698 In NVIDIA/Megatron-LM;[BUG] Packed THD MLA value padding may affect attention backend availability on Blackwell
bugSomething isn't workingSomething isn't workingStatus: Open.#7681 In NVIDIA/Megatron-LM;[BUG] Packed THD mRoPE may use incorrect positions with context parallelism
bugSomething isn't workingSomething isn't workingStatus: Open.#7679 In NVIDIA/Megatron-LM;Fuse batch-invariant MoE permutation with MXFP8 quantization
enhancementNew feature or requestNew feature or requestwaiting-on-maintainersWaiting on maintainers to respondWaiting on maintainers to respondStatus: Open.#7659 In NVIDIA/Megatron-LM;Fuse SwiGLU with MXFP8 quantization in MCore MoE inference
enhancementNew feature or requestNew feature or requestStatus: Open.#7657 In NVIDIA/Megatron-LM;Batch-invariant weighted SwiGLU reads invalid memory at large input offsets
bugSomething isn't workingSomething isn't workingwaiting-on-maintainersWaiting on maintainers to respondWaiting on maintainers to respondStatus: Open.#7650 In NVIDIA/Megatron-LM;cyclic dataloader without data sharding repeats and skips samples when resumed at a different data-parallel size (dataset size not divisible by micro_batch_size x DP)
waiting-on-maintainersWaiting on maintainers to respondWaiting on maintainers to respondStatus: Open.#7646 In NVIDIA/Megatron-LM;cyclic dataloader with data sharding repeats and skips samples when resumed at a different data-parallel size
waiting-on-maintainersWaiting on maintainers to respondWaiting on maintainers to respondStatus: Open.#7645 In NVIDIA/Megatron-LM;- Status: Open.#7641 In NVIDIA/Megatron-LM;
Add optional preflight checks for cluster and training configuration
enhancementNew feature or requestNew feature or requestStatus: Open.#7627 In NVIDIA/Megatron-LM;