MiniMax Music 3
Генерация полноценных песен до 5 минут из текста на 8GB VRAM
MiniMax выпустили высокопроизводительную модель для генерации музыки, способную создавать структурно связные песни длительностью до
пяти минут по текстовому описанию и лирике. Модель выдаёт стерео-аудио 32 кГц / 16-бит
8B параметров (инициализирован из Qwen3-8B) отвечает за долгосрочную музыкальную структуру
Local LLM: 0.6B параметров (покадровые акустические детали)
Flow Matching: 2.4B параметров (непрерывный синтез скрытых состояний)
Flow-VAE Decoder: 123M параметров (финальное декодирование в волновую форму)
Формат вывода: 32 kHz, 16-bit stereo WAV
Максимальная длительность: ~5 минут (9 000 акустических кадров при 25 кадрах/сек)
Лимит промпта: 5 000 токенов
Что умеет модель
Полные песни с долгосрочной связностью
Поддерживает нативно всю структуру композиции: [Intro], [Verse], [Pre-Chorus], [Chorus], [Post-Chorus], [Bridge], [Instrumental], [Solo], [Outro] с сохранением темы, ритма, вокальной идентичности и развития аранжировки
Тонкий контроль через два входа
Lyrics — сам текст песни с секционными тегами
Music description — жанр, темп, тональность, эмоциональная прогрессия, тембр вокала, инструментовка
Structured Caption для максимального контроля
Global Metadata: жанр, поджанр, BPM, тональность, сценарий прослушивания
Vocal Details: пол вокалиста, тембр, стиль, гармонии, бэк-вокал
Arrangement: основные и второстепенные инструменты, грув, бас, перкуссия, эффекты
Работает на 8GB видеокартах благодаря apply_group_offloading (медленнее, но помещается)
Ограничения
- Требуется
CUDA для инференса
- Только non-streaming генерация
- Секционные теги задают направление, но не гарантируют точное соблюдение темпа/тональности/структуры
- Лирика и описание - инструменты влияния, а не жёсткие правила
Hugging Face
Demo-страница с примерами
GitHub
ComfyUI туториал
SGLang cookbook