Как мы начали делать джинглы нейросетью
Как iLikeRadio создаёт вокальные джинглы с помощью Suno, живого диктора и ручного саунд‑дизайна – и почему нейросеть не заменила продюсера.

Джингл длится несколько секунд, но иногда именно эти секунды определяют, воспринимается ли радиостанция как собранный бренд или как плейлист с объявлениями. Название можно произнести обычным голосом, написать на сайте и поставить рядом с кнопкой воспроизведения. Но только звуковой логотип способен войти между двумя песнями так, чтобы слушатель узнал станцию раньше, чем успел осознать, что именно услышал.
Долгое время хорошие вокальные джинглы были дорогой частью большого радио. Для них писали музыку, собирали вокальную группу, записывали несколько голосов, сводили десятки вариантов и готовили пакет под конкретный формат. Федеральная станция могла позволить себе заказать эту работу у европейской или американской студии. Для регионального, интернет- или корпоративного радио такой уровень оформления часто оставался за пределами разумного бюджета.
В 2026 году iLikeRadio начала использовать генеративный ИИ для вокальных джинглов. Первые эксперименты прошли весной, а летом сгенерированные элементы вышли в проектах Carcade и FESCO. Позже мы собрали большие пулы джинглов для наших ключевых клиентов, а сейчас сделали обновление для двух внутренних радиостанций – «Радио Премьер» и «Радио Меридиан». Во всех случаях это стали рабочие элементы эфира, которые задумывались так, чтобы выдержать сравнение с оформлением, которое делают «фирмачи».
Этот материал о том, как нейросеть сделала дорогое дешёвым, но на практике всё ещё интереснее: ИИ дал нам музыкальный и вокальный материал, но ни один пакет не вышел в эфир прямо из генератора. Его собирали, резали, чистили, дописывали живым голосом и буквально вытаскивали из массы неудачных вариантов. Нейросеть изменила экономику производства, но не отменила само производство.
Джингл – это не просто название станции, спетое хором
В основе классического пакета часто находится короткая мелодическая и ритмическая формула – sonic logo, или звуковой логотип. Она может состоять всего из нескольких нот и повторяться в разных аранжировках, тональностях и темпах. Благодаря этому энергичный переход между двумя хитами, спокойная отбивка перед новостями и праздничная версия звучат по‑разному, но остаются родственниками. Слушатель может не напеть всю заставку, однако узнаёт музыкальное движение и название станции как единое целое. Главное: запомнить и идентифицировать.
Но неизменная последовательность нот – только один из способов построить эту узнаваемость, а не обязательный признак джингла. Звуковым логотипом может становиться целая система: характерный ритм, способ произнесения названия, тембр голосов, плотность обработки, набор эффектов и даже одинаковая логика концовки. Отдельные элементы такого пакета могут заметно отличаться мелодически и всё равно безошибочно принадлежать одной станции. Это похоже не на одну фразу, которую каждый раз повторяют дословно, а на голос человека: он произносит разные слова, но остаётся узнаваемым.
Хороший пример – Studio Brussel. В витрине PURE Jingles собраны созданные для станции элементы с разной мелодикой. Их объединяет не навязчивое повторение одной музыкальной строчки, а общий характер: ритмическая резкость, работа с вокалом, электронная фактура и способ, которым название станции входит в микс. У StuBru бывали и более явно выраженные аудиологотипы, но узнаваемость её оформления никогда не сводилась только к нескольким обязательным нотам.
NRK P3 в Норвегии показывает другой участок того же спектра. У станции есть мелодическое ядро, но с 2018 года её аудиопродакшн строится свободнее. Подрядчики меняют тембр, тональность, ритм и инструменты так, чтобы каждый элемент звучал частью оригинальной записи артиста. Такой приём называют power intro. В результате слушатель узнаёт P3 не по одной неизменной фонограмме, а по принципу, который каждый раз приспосабливается к музыкальной среде. И этот подход работает по той же причине: разным элементам задан последовательный язык станции.
Для генеративного производства это особенно важное различие. Нейросеть пока не гарантирует, что из раза в раз точно воспроизведёт одну и ту же последовательность нот и тональность, даже если запрос остаётся прежним. Поэтому большие пакеты iLikeRadio мы собираем не как набор попыток повторить один файл, а как семейство элементов. Их связывают единый дикторский голос, произношение бренда, диапазон энергии, ритмическая манера, вокальная подача, саунд‑дизайн и правила монтажа. Мелодические обороты могут меняться, но станция не должна каждый раз превращаться в другого человека.
Вокальный джингл – лишь одна форма такой идентичности. Полная версия, или full mix, раскрывает музыкальную тему и вокальную аранжировку. Basic ID оставляет более короткое узнаваемое ядро. Shotgun ID сжимает его почти до выстрела: название, акцент, конец. Рампы дают ведущему музыкальное пространство для речи, а бриджи помогают перейти между композициями, которые не хочется сталкивать напрямую. Рядом работают речевые элементы: свиперы, лайнеры, промо и короткие дикторские идентификаторы. Терминология у разных студий отличается, но принцип один: пакет должен давать продюсеру не одну красивую запись, а семейство элементов для разных мест в эфире.

На больших музыкальных станциях эта система доведена до высокой точности. ReelWorld, PURE Jingles, Wisebuddah и Benztown десятилетиями создают звуковые пакеты, в которых композиция, вокал и эффекты проектируются вместе. В 2007–2008 годах DFM заказала вокальные джинглы у VHU Europe: пакет был адаптирован на основе оформления Kiis FM в Лос‑Анджелесе, а для DFM появился собственный звуковой логотип. Этот проект хорошо показывает прежнюю модель рынка: станция получала не случайную мелодию с новым названием, а профессиональный re‑sing и переработку уже существующей системы оформления.
Немного истории. VHU Europe в тот период была европейским партнёром и представителем американской ReelWorld и управляла направлением ReelWorld Europe. Параллельно внутри VHU развивались собственные производственные бренды. PURE Jingles отвечала за джинглы и оформление, а будущая PantherSounds – за FX и музыкальные workparts, включая Orange Panther. В 2011 году VHU Europe и ReelWorld завершили пятилетнее сотрудничество и продолжили работу отдельно, но у клиентов остались крутые работы (как у DFM в те годы) и обширные fx‑библиотеки, которые не потеряли своей актуальности (как у iLikeRadio). Конец исторической справки.
«DFM пришла в VHU Europe в тот момент, когда там сходились американская школа ReelWorld и европейский способ собирать вокал. За основу взяли пакет Kiss FM, но станция получила собственную вокальную идентичность. Тогда именно так и можно было быстро дотянуть российский эфир до международного уровня»,
— вспоминает Андрей Свиридюк.
В начале 2010‑х годов PureJingles создала обновлённую одежду эфира «Европы Плюс»: как раз с тех пор мы знаем актуальный звуковой логотип станции. Курировал тот проект Роман Олегов, PD «Европы» в то время, а пакет джинглов был сделан в формате re‑sing, адаптирован с австрийской радиостанции KroneHit. Через несколько лет для «Европы Плюс» джинглы начали делать уже Benztown Branding.
Российское производство тоже иногда давало сильные работы и отдельных заметных специалистов. Проблема была не в стране записи, а в доступе к школе, вокальному продакшену и времени. Когда голос просто клали поверх готовой фонограммы, он выдвигался слишком далеко вперёд, вибрато оставалось неконтролируемым, а хор не становился частью микса. Для современного CHR это особенно разрушительно: джингл должен входить в эфир на той же энергии и плотности, что и музыка рядом с ним.
«Иногда включаешь заставку, и слышно не идентификацию радиостанции, а караоке поверх минуса. Вокал может быть записан чисто, певец может попадать в ноты, но это ещё не делает запись джинглом. Голос нужно аранжировать и буквально встроить в фонограмму»,
— говорит совладелец iLikeMedia Андрей Свиридюк.
Для небольшой станции возникает неприятная арифметика. По оценке iLikeRadio, изготовление одного профессионального джингла в европейской студии вроде WiseBuddah и PureJingles ещё в 2024‑2025 годах могло обходиться примерно в 800–1000 евро, хотя окончательная цена зависит от эксклюзивности, количества версий, состава пакета и прав. Десять элементов превращались в бюджет, который региональное или корпоративное радио скорее направит на собственную студию или несколько месяцев редакционной работы. Поэтому полноценная вокальная идентичность долго оставалась привилегией крупных станций.
Сначала нужно услышать планку
Перед разговором о нейросетях полезно послушать, как устроено оформление, которое много лет задавало стандарт музыкального радио. Не отдельный красивый хор и не просто удачная мелодия, а короткий элемент, в котором одновременно работают композиция, произношение бренда, плотность вокала, динамика и точность выхода в песню. Примерно такой джингл мог стоить около тысячи евро за один элемент или комплект его версий.
Мы поставили здесь два примера подряд намеренно. Они нужны не для выбора победителя между студиями, а как точка отсчёта. Сначала слушатель понимает уровень, который раньше был доступен главным образом крупным станциям, а затем может сравнить с ним работы iLikeRadio, созданные уже с помощью генеративной модели, живого диктора и ручного саунд‑дизайна.
Wisebuddah: европейская плотность и точность
В этом фрагменте стоит слушать не только мелодию. Обратите внимание, насколько вокал встроен в музыку, как быстро произносится название станции и как элемент заканчивается: хороший джингл не требует отдельной паузы вокруг себя и не спорит с песней, которая начинается следом.
PURE Jingles: вокальная архитектура пакета
Здесь важен уже не один эффектный звук, а родство элементов. Даже короткие версии должны сохранять одну мелодическую подпись, а вокальные партии – звучать как часть общего фирменного языка станции. Именно за такую систему, а не только за несколько готовых файлов, заказчик платил европейской студии.
После этих двух записей дальнейший разговор становится честнее. Мы сравниваем нейросетевое производство не с неудачной заставкой и не с дешёвым шаблоном, а с индустриальным ориентиром, на котором выросли современные музыкальные станции.
Первые джинглы прошли лучший тест: коллеги не заметили нейросеть
Весной 2026 года команда iLikeRadio начала искать способ получить не песню с названием компании, а именно радиоджингл: короткий, плотный, разборчивый и пригодный для монтажа в нескольких длинах. Это важное различие. Нейросеть довольно легко создаёт поздравительную композицию для корпоратива или куплет с припевом. Но просьба сделать современный CHR‑элемент длиной в несколько секунд сталкивается с логикой самой модели: ей хочется развивать музыку, добавлять вступление, продолжать вокальную фразу и завершать композицию как песню.
Первым реальным применением стали джинглы для нашего клиента – лизинговой компании Carcade. Затем вокальный пакет появился в семичасовом эфире «Радио ФИТ» для FESCO. Мы не сопровождали его объявлением о применении нейросети в этой работе. Элементы должны были выполнять обычную работу: держать темп, обозначать переходы и связывать программу единым звуком. После эфира коллеги, не участвовавшие в производстве, спрашивали, где мы нашли настолько хороших вокалистов и саунд‑продюсеров за короткое время. Для команды это оказалось полезнее любого формального теста: технология осталась за кадром, а результат воспринимался как профессиональное оформление.
В «Радио Премьер» и «Радио Меридиан» мы перешли от отдельных элементов под специальный эфир к большим пулам джинглов для постоянного вещания. В пакетах появились разные темпы, длины и способы входа в музыку. Вокальные партии и музыкальная основа появлялись с помощью генеративной модели, а речевые акценты остались живыми: мы встраивали в новый материал записанные ранее голосовые фрагменты нашего фирменного голоса, Антона Виноградова.
Работа над этими пакетами ещё раз показала, что удачный результат начинается не с одного волшебного запроса, а с системы отбора. Команда постепенно научилась понимать, какие формулировки направляют модель в сторону CHR и Hot AC, какую длину просить, какие вокальные конструкции легче разобрать и в какой момент дальнейшая перегенерация бессмысленна. Примерно 60 процентов полученного материала было отбраковано. Иногда не подходила мелодия, иногда вокал плохо произносил название или искажал его на английский манер, иногда хороший фрагмент окружала минута музыки, которая была нам не нужна.
«Хороший промпт не превращает нейросеть в европейскую студию джинглов. Он просто повышает вероятность, что среди множества генераций появится сырьё, с которым можно работать. Большую часть всё равно приходится выкидывать. И это нормально: задача продюсера здесь не сохранить всё, а услышать нужные пять секунд»,
— объясняет Андрей Свиридюк.
Нейросеть выдаёт готовый звук, но не готовый джингл
Главное ограничение генеративного аудио знакомо всем, кто работал с изображениями и видео: результат появляется сразу собранным. В традиционной сессии можно открыть дорожку вокала, убрать лишний вдох, передвинуть удар барабана, заменить синтезатор или продлить хвост реверберации. В сгенерированном миксе инструменты и голос изначально склеены. Современная нейронка умеет заменять участки и разделять материал на партии, но это не возвращает исходную многодорожечную запись. Разделение уже сведённого звука может оставлять артефакты, а замена фрагмента создаёт новый вариант, который ещё нужно состыковать со старым.
Для джингла эта проблема слышна особенно хорошо. У песни есть время спрятать неточность в развитии аранжировки. Джингл должен за несколько секунд произнести бренд, дать музыкальный акцент и аккуратно уйти в следующую композицию. Генерация может резко оборваться, начать несколько вариантов одинаковым приёмом или вставить синтетический речитатив там, где нужен уверенный диктор. Попытка исправить одну секунду иногда рождает другую мелодию, другой тембр хора и новый набор дефектов.

Поэтому материал приходится допиливать руками. Продюсер вырезает сильный фрагмент, собирает начало и конец, отделяет вокал, если это возможно, меняет синтетическую речь на запись диктора и добавляет недостающую динамику. В проектах Carcade, FESCO, «Радио Премьер» и «Радио Меридиан» использовались профессиональные FX‑библиотеки: актуальный WisebuddahFX, архивная Orange Panther от VHU Europe и материалы Production Vault+ от ReelWorld, на который у команды действует подписка. Это не украшения поверх нейросети, а рабочие детали: impacts, sweeps, reverses, breakers и другие элементы помогают оформить монтажный стык, подчеркнуть название и сделать так, чтобы короткая версия не выглядела обрубком полной.
Живым остаётся и дикторский слой. Вокальная генерация может убедительно спеть короткое название, но речитатив и конкретная фраза по‑прежнему плохо управляются даже при генерации ElevenLabs. Голос начинает переигрывать, съедает согласные или звучит как человек, которого никто не приглашал представлять бренд. Если у станции уже есть фирменный голос, синтетическая подмена особенно заметна. В статье «Нейроголос или диктор: что выбрать в 2026 году» мы подробно разбирали, почему естественный синтез и точное продолжение знакомого голоса остаются разными задачами.
Цена снизилась, потому что изменилась структура работы
Ориентир iLikeRadio для пакета из 10 вокальных джинглов, сгенерированных на основе уже готовой записи диктора, составляет 45–60 тысяч рублей. Это нельзя считать универсальным тарифом на любое оформление. Например, в таком расчёте не предусмотрены новая дикторская сессия, сложная разработка звукового логотипа с нуля (если нужна работа композитора), эксклюзивная запись конкретных вокалистов или передача полноценных исходных партий, которых у генеративной фонограммы может просто не существовать. Но для корпоративной станции или специального эфира это позволяет получить полные, средние, короткие и шотган‑версии в бюджете, который раньше уходил на один элемент ручной западной записи.
Сравнивать 45 тысяч рублей и условные 8 тысяч евро нужно осторожно. Это не два одинаковых товара с разными ценниками. Крупная студия продаёт собственную композиторскую работу, вокальную режиссуру, предсказуемый процесс правок и часто более гибкий комплект исходников. Генеративное производство даёт скорость и доступность, но принимает ограничения модели. Его преимущество проявляется там, где заказчику нужен убедительный эфирный пакет, а не уникальный музыкальный объект с возможностью через пять лет открыть оригинальную сессию и заменить одну партию хора.
При этом низкая цена не означает отсутствия профессиональной работы. Саунд‑продюсер должен написать десятки запросов, отслушать генерации, распознать удачный фрагмент, проверить произношение бренда, собрать версии разной длины и прогнать их рядом с реальными песнями. После введённых Suno в сентябре 2026 года ограничений подписка Pro включает 20 загрузок в месяц, Premier – 60. Это ещё одна причина не скачивать всё подряд и не считать генерации бесплатным бесконечным сырьём.
В итоге нейросеть убирает самую дорогую и организационно сложную часть – отдельную запись музыки и вокальной группы для каждой темы. Но вкус, отбор, монтаж, диктор, лицензированные библиотеки и ответственность за эфир остаются у людей. Цена снижается не потому, что работу теперь никто не делает, а потому, что изменилась её структура.
Хороший нейроджингл не должен рассказывать о нейросети
Вокальные джинглы Carcade, FESCO, «Радио Премьер» и «Радио Меридиан» не задумывались как демонстрация искусственного интеллекта. У них была обычная эфирная задача: дать проекту узнаваемый современный звук и набор элементов, которые можно ставить в разных точках программы. Если слушатель начинает размышлять о модели, значит технология уже перетянула внимание с бренда на себя.
Поэтому мы не считаем генеративное происхождение самостоятельным достоинством джингла. Оно важно для производственного кейса, бюджета и понимания процесса, но не должно становиться содержанием каждой эфирной заставки. Слушателю нужен разборчивый бренд, музыкальное соответствие станции и переход, который не ломает песню. Всё остальное относится к кухне.
«Критерий довольно грубый: если слышно, что это нейросеть, такой джингл не должен выходить. Мы не обязаны сохранять генерацию только потому, что потратили на неё время. В эфир идёт не технология, а результат»,
— говорит Андрей Свиридюк.
Генеративная музыка впервые сделала вокальные пакеты доступными проектам, которым раньше приходилось выбирать между дорогим международным производством и обычной дикторской отбивкой. Но она не превратила изготовление джинглов в кнопку. Скорее дала хорошему саунд‑продюсеру новую вокальную студию – странную, упрямую, иногда безвкусную, зато быструю и готовую работать круглосуточно. Всё, что эта студия напела, ещё предстоит превратить в радио.