2025-09-07 14:59:17 +08:00
# Fusion Operators (CSRC)
High-performance CUDA kernels for accelerating model training.
## Operators
### Asymmetric Dual Expert GEMM
- `asym_dual_gmm` : Simultaneous matrix multiplication for two experts
- Supports all transpose combinations (NN, TN, NT, TT)
### Token Permutation
- `permute` : Token permutation for MoE routing
2025-09-11 13:18:33 +08:00
- `unpermute` : Token recovery after expert computation
2025-09-07 14:59:17 +08:00
- `unpermute_bwd` : Backward pass for token recovery
### Multimodal RoPE
- `rope` : Rotary Position Embedding forward pass
- `rope_bwd` : RoPE backward pass
- Support for multimodal inputs with configurable sections
## Acknowledgments
2025-09-11 13:18:33 +08:00
The `permute` and `unpermute` operators are adapted from [fanshiqing/grouped_gemm ](https://github.com/fanshiqing/grouped_gemm ). Thanks for their open-source contributions.