Кому интересно почитать это решение, его можно
скачать с оф сайта Мосгорсуда
--
Нет, нейросети не берут кусочки из треков, они берут логику самих разнообразных партий на которых они были обучены и могут пользуясь этой логикой, заученными паттернами, создавать новые треки.
... ... ... ... ... ... ... ... Нейросети не могут думать
Ну, это ровно то, что защита Suno "заливает" в суде..)))
Но вот Universal и Sony в мае подали ходатайство о расширении иска с 560 произведений до 61 026 конкретно идентифицированных записей, и как говорится - "чем длиннее и точнее список, тем тяжелее защите отговариваться абстракциями про «модель просто учит паттерны»"...))
Не логику они берут. И не кусочки треков. А целые треки.
Вообще, откуда там взяться логике, если нейронка не думает..?))))
Также она не может «слушать» музыку как человек, а оперирует математическими представлениями звука...
Никаких новых треков она не создаёт и создавать не может.
И даже не обучается, в том ключе, в котором заявляют стартаперы суно.
Ведь они что твердят..? - "Модели обучены на общедоступных музыкальных файлах и связанных метаданных. Наша цель — создание оригинальной музыки, а не копирование чужого творчества."
А что им ещё говорить? "Мы все конфеты, что украли, продаём вам, ток в других фантиках.."?
У них шикарные юристы, и всё-то у них под грифом "коммерческая тайна"..
Они под этим соусом, и датасеты свои не раскрывают. И не раскроют. И будут говорить что выгодно, а не как есть.
Стартап ведь, это всегда про деньги.. А где ток про деньги - там жди голимый пи*дёж.
Но, лучше 1000 слов - один конкретный пример.
Есть здесь одна генерация, удачно демонстрирующая что происходит -
вот эта
Линк на пост
Тогда сразу же пробовал её покрутить, из интереса - а можно ли с этим хрипящим звуком хоть что-то сделать..
Не можно. Почти сразу бросил пробовать, но всё равно выложу
Чем интересна эта генерация.
Тем что в ней явно слышим снятый суно слепок звука "как-есть" с конкретного отечественного трека "лохматого" года.
Примечательно что в вокале остались "беззубости" от кривого де-эссинга, в общем нет сомнений, что весь звук остался ориджинал.
Это говорит о том, что на предложенный ей текст, суно подобрало из своего датасета какой-то один конкретный трек, текст в котором схож с введённым текстом по фразировке и ритму. Дальнейший сценарий суно - заменяются оригинальные текст и тембр вокала, при сохранении фразировки, ритма и динамики прежнего вокала.
Вот этот механизм у них и отлажен, этому суно и обучается - быстро подобрать из огромного объёма, наиболее подходящий под ваши запросы трек. Для этого им и нужен такой объём в датасетах - более миллиарда треков.
Ведь чем больше треков, тем больше вероятность полных (или близких к ним) совпадений с запросами юзеров.