July 25

Состав. Часть вторая

Нашли и прочитали этикетку?

В первой части я остановился на том, что правду о машинной музыке добыл не суд, а взломщик. Полтора года студии звукозаписи доказывали, что Suno обучалась на чужих записях, компания ссылалась на добросовестное использование, а спор о краже успел превратиться в переговоры о цене. Ответа на главный вопрос не было ни у кого, кроме самой Suno. В ноябре 2025 года произошла утечка: наружу вынесли исходный код, служебные журналы и базу пользователей. Начну с того, как это случилось.

Как прочитали этикетку

Взлом Suno не был достижением хакерской мысли. Компания даже не была отдельной целью, а попала под массовую кибератаку, которая к тому моменту уже третий месяц поражала разработчиков по всему миру.

В середине сентября 2025 года началась первая волна атаки. Самораспространяющийся червь проникал в npm — центральное хранилище, где разработчики публикуют и устанавливают готовые библиотеки для своих проектов. Его назвали Shai-Hulud по имени файла, который подкладывался в захваченные хранилища кода и запускался при каждой последующей сборке. Имя из «Дюны» Герберта подошло точно: там гигантский песчаный червь, божество и стихия целой планеты, заглатывает всё, что оказалось в пустыне. Здесь божество измельчало до программы, которая так же без разбора выгребала с чужой машины всё, что похоже на ключ.

Механика была для таких нападений новой: самораспространения npm прежде не видел. Заражённый код при установке запускал небольшую программу. Та отыскивала на машине разработчика ключи к хранилищам кода и облачным сервисам — учётные данные, необходимые для доступа. Найдя их, программа вписывала червя во все библиотеки того же разработчика и выпускала их заражённые версии. Дальше всё повторялось само, без участия человека. Заодно червь делал закрытые хранилища кода общедоступными, просто чтобы навредить сильнее.

За первые четыре дня он заразил более 200 пакетов, включая библиотеки с миллионами загрузок в неделю и код внутри CrowdStrike, компании, специализирующейся на безопасности. Разбирая программу, аналитики Palo Alto Networks с осторожностью отметили, что писала её, судя по всему, языковая модель: в коде нашлись комментарии и эмодзи. Код, который крадёт данные из десятков тысяч компьютеров разработчиков по всему миру, был написан искусственным интеллектом.

В конце ноября пришла вторая волна, несопоставимо шире первой. Механика была иной: червь теперь запускался не после установки пакета, а до неё, что открывало доступ к сборочным конвейерам и облачным учётным записям. За несколько дней червь заразил почти 800 пакетов npm и распространился даже на Maven, экосистему Java. Но главное было не в npm. На этой волне атака развернулась против GitHub — платформы, где хранится код всех этих разработчиков. Червь компрометировал более 25 тысяч репозиториев, украл учётные данные для облачных сервисов Amazon, Google и Microsoft, выудил ключи от систем CI и CD, где собирается и разворачивается код. В этот ноябрьский коридор Suno и попала.

Дальше начинается то, что к червю уже не относится. Одна похищенная учётная запись открыла внутри компании сразу три двери: к исходному коду, обучающим данным и базе пользователей. Червь ничего не выбирал, он работал как пылесос и забирал всё, до чего мог дотянуться с имеющимися правами. Но то, что этими правами открывались одновременно чертежи, склад сырья и картотека клиентов, — свойство не червя, а инфраструктуры самой компании. Полз он вслепую. Стен на его пути не оказалось.

Что на этикетке

Файлы, скачанные из инфраструктуры Suno, — это инструкции по сбору данных и служебные журналы за 2023 и 2024 годы. На вид — обычная рабочая документация, из тех, что пишут для себя, не думая о чужих глазах. Но именно эта обыденность и делает их ценными.

В журналах записано, откуда брали музыку. Свыше пятисот тысяч часов звучания из разных источников: YouTube Music, стоковые библиотеки Pond5, нотный архив IMSLP, Deezer, Jamendo и Freesound. Тексты песен из Genius и из нотного сервиса MuseScore. Отдельным пунктом — около миллиона часов подкастов из 420 тысяч подкаст-каналов. Всё это записано с точными цифрами, которые говорят о масштабе работы. Один только файл с записями из YouTube Music содержал более двух миллионов загруженных фрагментов.

Комментарий в одном из файлов поясняет рабочий порядок просто: тянуть отовсюду, оставить только музыку.

В этих данных важны две подробности. Первая: для скачивания материала из YouTube применялась Bright Data — коммерческая служба, основной бизнес которой состоит в массовом сборе данных. Она предоставляет инструменты для обхода защиты от автоматической выкачки контента. Это не побочный эффект и не серая зона, а специально приобретенный сервис для преодоления защиты платформ. Вторая: среди процедур сбора данных нашлись и такие, что искали акапельные версии песен — записи голоса без музыки. Для обучения модели, которая должна петь чужими голосами, это самое ценное сырьё.

Ровно это студии звукозаписи и доказывали в суде. Их формулировку о том, что Suno снимала музыку прямо с YouTube, компания оспаривала, ссылаясь на добросовестное использование. Теперь обвинение подтверждается собственными служебными записями ответчика, и к спору об авторском праве добавляется отдельный сюжет: обход технической защиты составляет самостоятельное нарушение, помимо самого копирования.

А главное — исчезла та обтекаемая формула. «Общедоступные данные из интернета» получили названия источников и объём загруженной информации.

Прачечная

При получении музыки для обучения есть и путь, который выглядит с виду законно. Учёные собирают наборы данных — списки ссылок на песни, — опираясь на исследовательское исключение из авторского права. Но этот же перечень потом используют коммерческие компании, для которых исключение не действует. Сам набор данных остаётся чистым: в нём только ссылки, не сам звук. А модель обучена: по ссылкам скачали и использовали реальные записи.

Существуют готовые базы, из которых музыкальные модели берут материал. The Atlantic в июне 2026 года в сотрудничестве с репортёром Алексом Райзнером запустил проект AI Watchdog — инструмент, который позволяет авторам проверить, есть ли их произведения в обучающих наборах, особенно в LAION-DISCO-12M. Это третий подобный инструмент Райзнера: в 2023 году он получил доступ к датасету Books3 и создал поиск по нему, в 2025-м The Atlantic выложил инструмент для проверки наличия произведений в LibGen, пиратской библиотеке, которую используют при обучении. Тот инструмент позволил авторам обнаружить свои работы и стал основанием для исков. На вид это журналистская работа. По сути же это оружие в руках авторов.

Первый набор музыкальных данных собрали в Высшей технической школе Цюриха и представили на конференции NeurIPS в 2023 году. Назвали его DISCO-10M, хотя в реальности набор содержал около 15 миллионов записей, а не 10. Собирали его так. Из Spotify взяли 2,6 миллиона уникальных песен. Для каждой искали соответствия на YouTube — находилось несколько вариантов одной и той же песни: официальный клип, live-версия, кавер. По длительности, заголовку и описанию отсеяли явно неправильные совпадения, потом сверили звук со звуком. В результате осталось 15,3 миллиона записей — больше, чем исходных песен, потому что каждая вошла в набор в нескольких вариантах.

Музыки в этом наборе нет. Составители оговаривают это прямо: аудио не включено из-за авторского права. Внутри лежат идентификаторы песен и ссылки на Spotify и YouTube. И там же сказано, что если понадобится сам звук, его можно скачать по приложенной ссылке.

Вот здесь граница становится зыбкой. Учёные собирают карту, опираясь на исследовательское исключение из авторского права. Карту выкладывают открыто. Дальше по ней идёт кто угодно, в том числе коммерческая компания, которой никакого исключения не полагается. Составители считали себя в правовом поле: сам набор чист — в нём только ссылки на песни, не сам звук. Но компании используют эти ссылки именно для скачивания реальной музыки и обучения на ней. Позже, когда началась юридическая война, составители сами убрали эти наборы, признав, что граница оказалась неясной.

Ну что же, рецепт оказался востребован. В ноябре 2024 года, когда Suno и Udio уже вовсю работали, немецкая организация LAION, прежде собравшая наборы изображений для Stable Diffusion, создала LAION-DISCO-12M как прямой ответ на закрытие других баз. Этот набор перечисляет 12,3 миллиона песен по их номерам на YouTube, около 91 года непрерывного звучания. Весит перечень 750 мегабайт, раздаётся под лицензией Apache 2.0 — она формально разрешает коммерческое использование и перепродажу. Но прямо в описание набора LAION поставила дисклеймер: она не рекомендует использовать эти данные в промышленных целях и особенно создавать на их основе конечные продукты. Это и есть выстроенная LAION юридическая защита: лицензия открыта и разрешает всё, но дисклеймер снимает с неё моральную и отчасти юридическую ответственность. Исполнителям не платит никто. LAION построила свою деятельность на юридической защите по законам Евросоюза, и одно выигранное дело у неё уже есть: в 2025 году Гамбургский суд счёл, что сбор такого набора покрывается исследовательским исключением. Правда, спор был с фотографом и касался набора изображений LAION-5B, а не музыкального DISCO-12M, и сейчас дело в апелляции.

Музыканты используют AI Watchdog, чтобы обращаться в национальные организации вроде GEMA в Германии и требовать запретить использование метаданных песен без согласия — закрыть ту «научную лазейку», на которой строит свою защиту LAION. Потому что LAION позиционирует себя как некоммерческую исследовательскую организацию, выпускающую данные в открытый доступ, но одновременно предупреждает, что использовать эти данные в коммерческих целях не следует. Юридическая защита LAION в том, что дисклеймер снимает с неё часть ответственности, но открытая лицензия не запрещает другим использовать данные.

Юридически вопрос остаётся открытым, и скоро появятся первые ответы. В Гамбурге суд уже встал на сторону LAION, исследовательское исключение защищает сбор данных. Фотограф, который проиграл в первой инстанции, подал апелляцию, процесс ещё не завершён. В Мюнхене осенью 2025 года суд вынес другое решение: по делу OpenAI он счёл, что исследовательское исключение не позволяет компании хранить и дословно воспроизводить произведения внутри коммерческой модели. Тридцать первого июля тот же мюнхенский суд вынесет решение по иску немецкого общества авторов GEMA к Suno, это будет первый судебный ответ на вопрос о музыке. В Америке решение отложено до 2027 года.

Ещё год назад у этой музыки не было этикетки. На прямой вопрос, из чего она сделана, компании отвечали формулой про общедоступные данные из интернета, и проверить эти слова не мог никто. Теперь состав известен: YouTube Music и стоковые библиотеки, нотный архив и чужие тексты, свыше пятисот тысяч часов звучания и купленный сервис для обхода чужой защиты. Известна и дорога с «чистыми бумагами» — научные наборы ссылок, которые ведут к тому же YouTube. Открылось всё это не потому, что кто-то отчитался, а потому, что кто-то влез в чужую сеть. Состав обучающих данных Suno не раскрывает и сегодня.

Этикетку прочитали. Осталось выяснить, сколько стоит написанное на ней: этим летом у чужого труда впервые появилась цена. И осталось понять, кому такой счёт можно предъявить: модели того же уровня строят там, куда американские решения не дотянутся. О цене и о тех, кому счёт не предъявишь, — в следующей части.

Для пытливых умов:

  1. TechCrunch о взломе Suno и о том, что журналы обучения указывают на YouTube (15 июля 2026): https://techcrunch.com/2026/07/15/hack-suggests-ai-music-generator-suno-scraped-youtube-for-training-data/
  2. Unit 42, разбор атаки на цепочку поставок в npm: https://unit42.paloaltonetworks.com/npm-supply-chain-attack/
  3. The Atlantic об обучающих данных музыкальных моделей (июнь 2026): https://www.theatlantic.com/technology/2026/06/ai-music-generators-suno-google-udio/687485/
  4. LAION о наборе DISCO-12M: 12,3 миллиона записей и открытая лицензия: https://laion.ai/blog/laion-disco-12m/
  5. GEMA о своих исках к разработчикам искусственного интеллекта: https://www.gema.de/en/news/ai-and-music/ai-lawsuit