logo

Розробники Stable Diffusion представили штучний інтелект, що перетворює текст на музику

Юлія Фещенко
Редакторка MC: Money & Career
Розкажіть про статтю:

Компанія Sta­bil­i­ty AI, яка стала відомою після релізу популярного генератора зображень зі штучним інтелектом Sta­ble Dif­fu­sion, випустила новий ШІ-продукт Sta­ble Audio. Це платформа для перетворення тексту в аудіо. Редакція MC.today переповідає подробиці з посиланням на сайт компанії.

Robot Plays the Piano. 3d IllustrationRobot Plays the Piano. 3d Illus­tra­tion

Sta­ble Audio використовує дифузію, або ту саму модель штучного інтелекту, яка працює на більш популярній платформі для створення зображень Sta­ble Dif­fu­sion. Але її навчали не на картинках, а на великому масиві аудіозаписів.

Більшість схожих моделей штучного інтелекту, як правило, генерують доволі короткі ролики з фіксованою довжиною. Це не дуже зручно для творців, наприклад, музичних треків, адже їхня тривалість може бути різною.

Sta­bil­i­ty AI знайшла спосіб обійти подібні обмеження, а налаштування платформи тепер дозволяють користувачам Sta­ble Audio мати більше контролю над тим, наскільки довгою буде композиція.

«Ми продовжуємо вдосконалювати наші архітектури моделей, набори даних і протоколи навчання, щоби покращити якість відтворення, керованість, швидкість висновку та тривалість треку», – повідомили в компанії.

Для тренування моделі використали понад 800 тис. аудіофайлів з музикою, звуковими ефектами, інструментальними композиціями та текстові метадані від компанії AudioSparx, що ліцензує фондову музику. Sta­bil­i­ty AI стверджує, що має дозвіл на використання матеріалів, захищених авторським правом. Навчальний набір містить понад 19,5 тис. годин звуків.

У безплатній версії Sta­ble Audio можна створювати до 20 треків на місяць тривалістю до 45 секунд. Підписка професійного рівня коштує $11,99 на місяць. За ці гроші можна створити до 500 90-секундних треків. У тарифі Enter­prise ціну формують відповідно до потреб користувачів.

В Sta­bil­i­ty AI вважають, що нову платформу використовуватимуть насамперед для створення фонової музики для подкастів або відео.

  • Раніше компанія повідомила про плани розширювати свою присутність у галузі штучного інтелекту, зокрема для створення аудіо та відеоконтенту. Цікаво, що попри це очільник Sta­bil­i­ty AI Емад Мостак передрік зникнення програмістів-людей через ШІ та заявляв, що ця технологія підірве світову економіку сильніше за пандемію COVID-19.