Moûsai
Text-to-music generation model using cascaded latent diffusion.
About
Mousai is a research text-to-music model that uses cascaded latent diffusion to generate long-form stereo music at 48 kHz from text descriptions. It is built on the audio-diffusion-pytorch library, a customizable waveform-based diffusion toolkit covering unconditional and text-conditional generation, diffusion autoencoding, upsampling, and vocoding. The library is provided for PyTorch; pretrained weights follow the paper's configuration. Open-source research release.
Reviews (0)
Leave a Review
No reviews yet. Be the first to review!
Details
- Category
- Music & Audio Generation
- Price
- Free
- Platform
- Local/Desktop
- Difficulty
- Advanced (4/5)
- Minimum VRAM
- 8 GB
- Added
- Apr 3, 2026
Related Tools
Audio generation framework by Meta including MusicGen for text-to-music.
Latent diffusion model for text-to-audio, music, and speech generation.
Audio super-resolution model for upsampling audio to higher sample rates.
State-of-the-art music source separation model by Meta for splitting tracks.
Fast music generation model producing full songs with lyrics in seconds.
PyTorch library for deep learning research on audio generation including MusicGen and AudioGen.