Нейросети пришли и к нам. (2 онлайн)

Попробовал синематик - бесплатная V6-MINI версия по ощущениям специально зажата по работе с пространством (просто залили ревером вдалеке) и по аранжировке довольно однообразная. Минутное демо, которое предлагают от V6 полной - по этим параметрам приятнее звучит и промпт учитывает сильнее
 
А я развлекаюсь с chat gpt и wan ai ... усложняю задачу- выражение лица, жест записал картинку себя - фото, чат передал эту мимику Бабе Яге. Ван АИ бесплатно мне сгенерировал, с ограничениями, конечно.... музыка моя... Надо пробовать сложные движения передавать персонажу. Ван АИ генерирует просто стремительно.

 
Надо понимать, что одной из причин (возможно главной) появления версии v6 было не столько улучшение модели сколько легализация суновских генераций. Нынешняя версия заявляется, как обученная только на лицензионном контенте теперешних партнеров Суно - Warner Music Group, BMG, Believe. Поэтому предыдущие модели и были удалены так, как они были обучены на нелицензированных песнях.

CEO Suno Шульман прямо заявил в интервью, что в новой версии "No Universal songs. No Kobalt songs. No Sony songs, etc."

Правда, говорят, чтобы Суно "развидело" свое предыдущее обучение пришлось бы её обучать с нуля, что вряд ли было сделано. Хотя, наверняка было что-то сделано чтобы максимально уменьшить в новой версии влияние песен Sony и других правообладателей.
 
  • Like
Реакции: Al Soloviev и deplexer
7kt37hbh_lg.jpg
 
Tencent AuK

(кроме всего прочего удаляет акцент - что актуально для неанглоязычных исполнителей)






Команда Tencent Hunyuan совместно с Шанхайским университетом Цзяо Тун выкатили опен-сорс фундаментальную аудиоэдит модель на 1,5 млрд параметров

Она объединяет и генерацию и редактирование речи через единый интерфейс, пишете промпт естественным языком и на выходе аудио

Что умеет

- Генерация речи - zero-shot TTS по референсному голосу и Instruct TTS (голос по текстовому описанию, без референса)
- Редактирование контента - заменить, вставить или удалить слова в записи, и даже переписать текст песни с сохранением мелодии и голоса
- Акустическое редактирование - тон (в полутонах), скорость, громкость (в децибелах)
- Паралингвистика - смена эмоции и тембра, удаление акцента, превращение речи в шёпот, добавление/удаление смеха, вздохов и кашля
- Улучшение и сепарация - шумоподавление, разделение говорящих, извлечение вокала из музыки

Под капотом мультимодальная LLM (Qwen2.5-Omni-3B) для семантики + аудио-VAE (50 Гц), обученный на речи, музыке и звуках + гибридный rectified-flow трансформер (MMDiT + DiT)

Обучение на ~1,95 млн часов аудио и 3,03 млрд инструкционных пар

AuK-Flash

Дистиллированная версия: инференс за 4 шага без CFG, ускорение в 4,5 раза при сопоставимом качестве

На бенчмарках модель лидирует в zero-shot и инструкционном TTS, а также в редактировании по промптам и держится на уровне конкурентов в задачах реставрации сигнала

MIT-лицензия, веса и код в открытом доступе, есть демо, поддержка ComfyUI и SGLang-Omni из коробки

Проект
Попробовать
HuggingFace
GitHub
 

Сейчас просматривают