Tencent AuK
(кроме всего прочего удаляет акцент - что актуально для неанглоязычных исполнителей)
Команда Tencent Hunyuan совместно с Шанхайским университетом Цзяо Тун выкатили опен-сорс фундаментальную аудиоэдит модель на 1,5 млрд параметров
Она объединяет и генерацию и редактирование речи через единый интерфейс, пишете промпт естественным языком и на выходе аудио
Что умеет
- Генерация речи - zero-shot TTS по референсному голосу и Instruct TTS (голос по текстовому описанию, без референса)
- Редактирование контента - заменить, вставить или удалить слова в записи, и даже переписать текст песни с сохранением мелодии и голоса
- Акустическое редактирование - тон (в полутонах), скорость, громкость (в децибелах)
- Паралингвистика - смена эмоции и тембра, удаление акцента, превращение речи в шёпот, добавление/удаление смеха, вздохов и кашля
- Улучшение и сепарация - шумоподавление, разделение говорящих, извлечение вокала из музыки
Под капотом мультимодальная LLM (Qwen2.5-Omni-3B) для семантики + аудио-VAE (50 Гц), обученный на речи, музыке и звуках + гибридный rectified-flow трансформер (MMDiT + DiT)
Обучение на ~1,95 млн часов аудио и 3,03 млрд инструкционных пар
AuK-Flash
Дистиллированная версия: инференс за 4 шага без CFG, ускорение в
4,5 раза при сопоставимом качестве
На бенчмарках модель лидирует в zero-shot и инструкционном TTS, а также в редактировании по промптам и держится на уровне конкурентов в задачах реставрации сигнала
MIT-лицензия, веса и код в открытом доступе, есть демо, поддержка ComfyUI и SGLang-Omni из коробки
Проект
Попробовать
HuggingFace
GitHub