Рубріки: Інфопривід

Навіть емоції й тон. ШІ від Microsoft може імітувати будь-чий голос по трьохсекундному зразку

Корпорація Microsoft розробила нову модель штучного інтелекту для перетворення тексту в мовлення під назвою VALL-E. ШІ може імітувати голос людини із 3-секундного зразка. Про це з посиланням на ArsTechnica пише MC.today.

Зазначається, що VALL-E розпізнає голос та на його основі синтезує аудіо. Створений звук імітує не лише тембр голосу людини, а і її емоційний тон і акустику кімнати.

Модель ШІ навчали на 60 тис. годин аудіозаписів мовлення понад 7 тис. людей, які розмовляють англійською. Для цього використали аудіотеку Meta LibriLight. 

Для імітації голосу потрібен трьохсекундний зразок мовлення людини, а також текст, який треба перетворити на аудіоформат. Голос, який VALL-E намагається імітувати, має бути близьким до голосу з навчальних зразків. Тоді ШІ використовує навчальні дані, щоб зробити висновок, як би звучав голос людини при озвучуванні вказаного тексту.

Microsoft не надали код VALL-E, тому не можна самостійно перевірити роботу ШІ. Це пов’язано з тим, що підроблений голос людини можна використати в незаконних цілях. Наприклад, зловмисники можуть підробити голосову ідентифікацію або видати себе за конкретного мовця.

Хоча корпорація не опублікувала код, на GitHub є результати роботи моделі ШІ. З ними ви можете ознайомитися за посиланням. Спойлер: деякі голоси звучать дуже реалістично, а деякі навпаки – ні, відразу помітно, що це комп’ютерний голос. Також VALL-E вдалось добре імітувати інтонацію мовця, а також акустику приміщення.

Раніше ми розповідали про нейромережу, яка генерує музику з тексту. На відміну від розробки Microsoft, «музичною» нейромережею може скористатися кожен охочий

Нещодавні статті

Найкращий тиждень з 2021 року – вартість Ethereum зросла на третину

Другий за величиною цифровий токен Ethereum цієї п’ятниці різко зріс у ціні, збільшивши свій тижневий…

09/05/2025

«Раніше це писали копірайтери, зараз – ШІ». Бородатюк про використання ШІ в Netpeak Group

CEO Netpeak Group Артем Бородатюк поділився, як у групі впроваджують інструменти штучного інтелекту та роботу…

09/05/2025

Як застосунок tTravel перетворює досвід мандрівників на контент, що приносить пасивний дохід

Засновуючи tTravel, Олександр Буратинський та Артем Шамбальов, маючи за плечима роки дружби, подорожей та спільної…

09/05/2025

ChatGPT тепер зможе аналізувати код у GitHub. Що відомо про інтеграцію

Компанія OpenAI почала тестувати оновлення Deep Research у ChatGPT. Функція буде працювати з репозиторіями GitHub…

09/05/2025

В EPAM Systems змінюється керівництво. Що відомо про нового CEO

EPAM Systems змінює керівництво. Засновник ІТ-компанії та генеральний директор Аркадій Добкін йде з посади. Він…

09/05/2025

Поперешнюк розповів, який стартап запустив би, якби не займався «Новою поштою»

Співзасновник «Нової пошти» Володимир Поперешнюк у Школі бізнесу НП розповів, який стартап запустив би, якби…

09/05/2025