logo

Магія нейромереж: найкращі інструменти на основі ШІ для генерації зображень

Микола Ладуба
Редактор корисних текстів
Розкажіть про статтю:

2023 року тільки лінивий не публікує вражаючі картини, зроблені штучним інтелектом. Для створення візуального контенту розробники створюють все більш досконалі інструменти. Знання їх особливостей дозволить читачам вибрати найбільш відповідну нейромережу для вирішення своїх конкретних завдань.

Редакція MC.today вивчила переваги, стилі та способи використання найпопулярніших платформ для створення зображень на основі текстових запитів користувачів.


Midjourney

Офіційний сайт
Галерея
Вартість: платно, від $10/місяць до $120/місяць

Мабуть, найпопулярніша сьогодні нейромережа для створення зображень за текстовими описами. Вона стала широко відомою завдяки їх високій якості та великій кількості дипфейків, що завірусилися в інтернеті. 

Приклади згенерованих Mid­jour­ney зображень / Джерело: legacy.midjourney.com

Раніше ми вже писали про Папу Франциска в пуховику Balen­ci­a­ga і згенероване за допомогою Mid­jour­ney зображення можливого арешту колишнього президента США Дональда Трампа. 

Через зловживання подібними реалістичними медіафайлами для поширення хибної інформації власники Mid­jour­ney були змушені відключити безкоштовні пробні версії. Тепер вартість доступу до платформи починається з $10/місяць.

За ці гроші користувач отримує 200 GPU хвилин. Розберемося, що таке. Для створення зображень Mid­jour­ney використовує графічні процесори, або GPU. Час їх використання ви й оплачуєте, коли купуєте передплату. 

На скільки зображень вистачить 200 GPU-хвилин у мінімальному пакеті точно сказати складно, оскільки це залежить від багатьох факторів. Назвемо основні закономірності: найменше часу витрачають варіації, більше – сама генерація (приблизно 40 секунд) та ще більше апскейл (Upscale) – збільшення роздільної здатності зображень.

Як працювати з Midjourney

Насамперед вам потрібно буде створити обліковий запис в Dis­cord, так як робота з нейромережею відбувається там. Для тих, хто не в курсі, це система миттєвого обміну повідомлень із підтримкою відеоконференцій, призначена для використання різними спільнотами за інтересами.

Заставка сайту midjourney.com

Після цього можна зайти на сайт Mid­jour­ney, де вас зустріне вражаюча заставка у стилі «Матриці».

На головній сторінці сайту можна вивчити документацію, подивитися приклади робіт або натиснути на кнопку «Join the Beta», щоб перейти на сервер Mid­jour­ney в Dis­cord. 

Стрічка сервера Mid­jour­ney в Dis­cord

Далі в лівій частині меню вибираєте будь-який канал для новачків – його можна відрізнити за словом new­bies у назві. Тепер у вікно внизу, як і в будь-якому іншому чат-боті, можна вводити команди.

Команди бота Mid­jour­ney

Починаються команди завжди з косою межі. Після її введення ви побачите список можливих команд. Команда /info показує інформацію. Наприклад, скільки у вас залишилося GPU-хвилин. Команда /settings відображає параметри, які можна налаштувати. 

Найважливіша для вас команда називається /imagine і дозволяє створити за допомогою Mid­jour­ney зображення. Для цього потрібно буде ввести в поле англійською мовою запит для нейромережі, або «промпт», і відправити його в чат. 

Бажано використовувати в запиті таку послідовність: опис об’єкта, подвійна двокрапка (::), основна стилістика, додаткові параметри. Приклад запиту: Epic por­trait of baby yoda in the jun­gle :: hyper­re­al­is­tic, intri­cate details, shiny, cin­e­mat­ic, unre­al engine, art­sta­tion, –aspect 2:3.

Крім цього, є безліч сайтів, де можна підглянути вдалий запит на прикладі готових картинок, або сервісів, де допоможуть скласти промпт на основі переліку стилів і параметрів зображення.

Кнопки для роботи із зображеннями у Mid­jour­ney

Через деякий час ви отримаєте чотири варіанти зображення для запиту. Під ними ви побачите кнопки U1, U2, U3, U4 та V1, V2, V3, V4. «U» означає Upscale – збільшити масштаб і якість, «V» означає Ver­sion – створити ще 4 різних версії вибраного зображення.

Меню для роботи з окремим зображенням

Наприклад, я ввів простий запит «kit­ty robot, 3d car­toon, col­or­ful back­ground» і отримав чотири варіанти з «котоботом», з яких мені більше сподобався верхній лівий. Натискаю на кнопку «U1» і отримую покращений варіант першого фото з новим меню.

  • Vary створює нові 4 зображення, схожі на обране.
  • Vary (Region) дозволяє змінити лише вказаний фрагмент фото.

Команда Vary (Region) змінює вибраний фрагмент зображення

  • Upscale (2x) та Upscale (4x) – варіації апскейлу. Виходячи з назви, другий вдвічі сильніший.
  • Zoom out – віддаляє центральний об’єкт та створює чотири нові зображення з різними варіаціями фону.

Команда «Стрілка вправо» додає праворуч від об’єкта вільне місце

  • Стрілки розширюють зображення вліво, вправо, вгору або вниз і роблять чотири варіанти з різним тлом. На скриншоті можна побачити, що вільного місця додалося праворуч від кошеня.
  • Емодзі дозволяють оцінити свою чи чужу роботу.
  • Web відкриває посилання зображення на сайті-галереї.

Налаштування параметрів зображення у Midjourney

Співвідношення сторін / Aspect Ratios

Параметр –aspect або –ar змінює співвідношення сторін створеного зображення. Зазвичай воно позначається двома числами, розділеними двокрапкою, наприклад, 7:4 або 4:3.

Приклади співвідношення сторін у запитах до Mid­jour­ney

Стандартним для Mid­jour­ney є співвідношення сторін 1:1. У параметрі –aspect можна використовувати лише цілі числа. Тому завжди використовуйте 16:10 замість 1,6:1. 

Рівень хаосу / Chaos

Параметр –chaos або –c впливає на різноманітність зображень і може набувати значення від нуля до 100. Високі значення –chaos дають більш незвичайні та несподівані результати та композиції. Низькі –chaos дають більш надійні та повторювані результати.

Рівень хаосу у запиті Mid­jour­ney

Для прикладу порівняйте зображення на запит «гібрид кавуна та сови». Ліва четвірка відповідає параметру –chaos 0, для правої використовували значення –chaos 80.

Зміна якості / Quality comparison

Параметр –qual­i­ty, чи –q змінює кількість часу, яке нейромережа витрачає на створення зображення. Налаштування вищої якості обробляються довше та забезпечують у результаті більше дрібних деталей. 

Вплив параметра –q на результат генерації у Mid­jour­ney

Якість зображення в Mid­jour­ney може приймати значення –qual­i­ty .25, –qual­i­ty .5 і –qual­i­ty 1. За замовчуванням вона дорівнює одиниці, але може бути зменшено для економії часу та обчислювальних ресурсів. На скріншоті лівий малюнок відповідає мінімальному значенню якості, а правий – максимальному. 

Стилізація / Stylize

Mid­jour­ney вміє створювати зображення з художніми кольорами, композицією та формами. Параметр –styl­ize або –s впливає на те, наскільки сильно застосовуються ці характеристики. За умовчанням він дорівнює 100 і може змінюватися від нуля до 1000.

Вплив стилізації на результат генерації у Mid­jour­ney

Низькі значення стилізації створюють зображення, які більш точно відповідають підказці, але виглядають менш художніми. Високі значення стилізації створюють дуже художні зображення, але менш пов’язані з підказкою.

Для прикладу порівняйте зображення на запит «дитячий малюнок кота». Ліва четвірка відповідає параметру –styl­ize 0, для правої було прийнято значення –styl­ize 750. Перша виглядає як малюнок п’ятирічної дитини. Друга радше схожа на твір професійного художника.

Як зберегти створені в Midjourney картинки

Усі створені вами зображення автоматично зберігаються у галереї вашого кабінету на сайті Mid­jour­ney. При цьому дуже зручно, що разом із ними зберігаються й використані промпти. 

Ще один варіант зберегти створені в Mid­jour­ney зображення – натиснути на картинку в чаті. Після цього можна зберегти її у контекстному меню правою кнопкою миші. Але краще натиснути на посилання «Відкрити в браузері», це дозволяє зберегти фото у більшій роздільній здатності.

Лайфхак для зручнішої роботи

Один з головних недоліків Mid­jour­ney, який відштовхує багатьох від роботи з цією платформою, – це стрічка повідомлень Dis­cord, що постійно зсувається. Шукати свої картинки у їхньому потоці – досить стомлююче заняття. Але із цієї ситуації є вихід. 

Бота Mid­jour­ney можна додати на власний сервер Dis­cord. Для цього потрібно знайти його у списку користувачів праворуч та натиснути на велику кнопку «додати на сервер». Якщо списку на вашій сторінці немає, натисніть кнопку «Показати список учасників» у верхній частині меню. На скріншоті вона позначена стрілкою.

Розміщення бота Mid­jour­ney на своєму сервері одним махом вирішує відразу кілька проблем: ваші картинки не губляться в морі інших повідомлень і вам не заважають повідомлення інших новачків, а отже, можна цілком зосередитися на творчості.

Переваги Midjourney

  1. Висока якість зображень.
  2. Підтримка величезної кількості стилів.
  3. Можливість генерувати кілька зображень одночасно.
  4. Зручна функція покращення та збільшення зображень.
  5. У вашому обліковому записі зберігаються всі зображення та промпти.

Недоліки Midjourney

  1. Нема пробної версії.
  2. Рідше, ніж в інших нейромережах, але трапляються проблеми з людською анатомією, особливо з пальцями та очима.
  3. Доволі довга генерація зображень.
  4. Робота в Dis­cord не всім може здатися зручною.

Stable Diffusion

Офіційний сайт
Галерея
Посилання для скачування
Вартість: безкоштовно

Sta­ble Dif­fu­sion (SD) – це повністю безкоштовна програма з відкритим вихідним кодом, яка може стати чудовою альтернативою Mid­jour­ney. Більше того, за бажання її можна навіть встановити на свій персональний комп’ютер. Отже, ви не залежатимете від інтернет-з’єднання, цензури або інших обмежень власників нейромережі.

Приклади зображень згенерованих Sta­ble Dif­fu­sion / Джерело: prompthero.com

Якщо порівнювати зображення Sta­ble Dif­fu­sion з аналогічними від Mid­jour­ney, можна сказати, що з безкоштовної нейромережі вони виходять трохи менш виразними, але більш точно відповідають запиту.

Ентузіасти навчили SD створювати набори предметів для комп’ютерних ігор та робити на запит цілі відеоролики з послідовно змінних зображень. Крім того, ця нейромережа може похвалитися функціями, яких немає у конкурентів. 

Так, функція Inpaint­ing дозволяє замінити будь-який об’єкт на зображенні на інший, згенерований нейромережею. Наприклад, у цьому ролику видно, що за допомогою Sta­ble Dif­fu­sion легко замінити собаку на фото котом чи лисою.

Ще цікавіше можливості, які відкриває функція Out­paint­ing. З її допомогою можна генерувати фон навколо готових картинок і домальовувати об’єкти, що існують на них. Наприклад, як вам ідея домалювати сукню героїні картини «Дівчина із перлиною сережкою» нідерландського художника Яна Вермеєра?

У Sta­ble Dif­fu­sion також можна вказувати негативний промпт (Neg­a­tive Prompt) – це список об’єктів, які не повинні з’являтися на малюнку. Наприклад, ви створили зображення на запит «Осінній Париж», але вам не подобається, як вийшли люди. Повторюєте генерацію з негативним промптом «люди»- і ваш Париж стає абсолютно безлюдним.

Найбільш детальну інформацію з різних аспектів використання Sta­ble Dif­fu­sion можна знайти у гілці red­dit r/StableDiffusion. А ми опишемо кілька простих способів роботи з цією нейромережею через веб-браузер.

Генерація зображень на dezgo.com

Сайт dezgo.com дозволяє генерувати зображення за допомогою Sta­ble Dif­fu­sion без реєстрації, достатньо вибрати в списку моделей ШІ пункт «Sta­ble Dif­fu­sion 2.1».

Генерація зображень на replicate.com

На сайті replicate.com потрібна реєстрація. Але є можливість задати докладні налаштування: роздільну здатність зображення по ширині та висоті, кількість генерованих зображень, кількість кроків генерації і так далі.

Генерація зображень у Dream­Stu­dio

Платформа Dream­Stu­dio використовує нейромережу Sta­ble Dif­fu­sion, забезпечує швидку роботу та високу якість зображень, але вимагає створення облікового запису та обмежує кількість генерацій 25 токенами (приблизно 100 зображень). За $10 можна придбати ще 1000 токенів.

Переваги Stable Diffusion

  1. На відміну від конкурентів, Sta­ble Dif­fu­sion – це безкоштовний проект із відкритим вихідним кодом, тому його можливостями можуть користуватися абсолютно всі. А за бажання його можна навіть розгорнути на своєму ПК. Щоправда, зробити це не дуже просто. Потрібно, як мінімум, «дружити» з командним рядком.
  2. Sta­ble Dif­fu­sion знає стилі від художників часів ренесансу та до сучасних творців відеоігор. Наприклад, користувачі нейромережі часто звертаються до фентезійного стилю польського художника Грега Рутковські.
  3. SD має оригінальні інструменти Inpaint­ing та Out­paint­ing, які можуть полегшити редагування зображень.
  4. Функціональність SD регулярно розширюється за рахунок нових інструментів, плагінів та розширень, які створюють ентузіасти.

Недоліки Stable Diffusion

  1. Для запуску та стабільної роботи Sta­ble Dif­fu­sion на вашому ПК підійде далеко не всяке залізо. Потрібна потужна відеокарта та кілька десятків гігабайт вільного місця на диску.
  2. Не найприязніший інтерфейс.

Adobe Firefly

Офіційний сайт
Галерея
Вартість підписки: 25 генеративних кредитів щомісяця для безкоштовних облікових записів Adobe Express, Adobe Fire­fly, Cre­ative Cloud.

Приклади зображень згенерованих Adobe Fire­fly / Джерело: firefly.adobe.com

Adobe Fire­fly – це ШІ-програма для створення зображень за описом від компанії Adobe – лідера в області цифрових продуктів для графічного дизайну. Щоб почати використовувати Fire­fly, потрібно зайти на свій обліковий запис Adobe або зареєструватися та дочекатися запрошення.

Результат генерації на запит «Kit­ty robot, 3d car­toon, col­or­ful back­ground»

Інтерфейс програми відрізняється простотою та доброзичливістю. Тут можна в один клік поміняти пропорції зображення, налаштувати його інтенсивність, освітлення та композицію, підібрати з готових списків стиль та візуальні ефекти.

Цікаво, що на тлі останніх скандалів з дипфейками від нейромереж, продукт Adobe геть-чисто позбавили можливості створювати зображення з відомими людьми та персонажами. 

Результат запиту «Leonar­do Di Caprio por­trait paint­ed by Vin­cent van Gogh»

Так, на мій запит «por­trait of Baby Yoda in the jun­gle» нейромережа просто видала портрети красивих дівчат у джунглях. А на запит «Leonar­do Di Caprio por­trait paint­ed by Vin­cent van Gogh» видала портрети жінок і чоловіків у стилі Ван Гога. Тим часом Mid­jour­ney та Sta­ble Dif­fu­sion не відчували із завданням жодних труднощів.

Автоматичне видалення фону в Adobe Fire­fly

Безперечною перевагою Fire­fly є його тісна інтеграція з іншими сервісами Adobe. Це дуже зручно, коли в пару кліків до готового зображення можна додати яскравий підпис з колекції шаблонів, налаштувати контраст і яскравість або повністю видалити фон. 

Нанесення на зображення написів за допомогою шаблонів Adobe

Одним словом, Fire­fly пропонує все, щоб створення та редагування зображень стало для вас захоплюючим та приємним заняттям. Зізнаюся, мені самому було досить складно відірватися від експериментів із kit­ty robot.

Результат запиту «Kit­ty robot, 3d car­toon, col­or­ful back­ground» із зазначенням текстури матеріалу met­al

Ще один моментяя, при збереженні згенерованого зображення через меню «Зберегти» Fire­fly додає на нього водяний знак. Але якщо вибрати один із пунктів у меню «Змінити», наприклад, «Додати об’єкти», зображення автоматично відкривається в редакторі. А з нього вже зберігається без водяного знаку. 

Переваги Adobe Firefly

  1. Простий та доброзичливий інтерфейс, можливість легко вибирати з величезної колекції ефектів та стилів.
  2. Интеграция с другими продуктами Adobe.
  3. Висока якість зображень.
  4. Швидка генерація
  5. Функція використання згенерованого зображення як референс, щоб створити схожі зображення. 

Недоліки Adobe Firefly

  1. Проблеми із анатомією людей.
  2. Нема історії генерації.
  3. Fire­fly ігнорує імена відомих людей та деякі слова, які вважає забороненими.
  4. Додає до роботи невеликий водяний знак Adobe. 
  5. До 1 листопада 2023 року для передплатників Cre­ative Cloud, Adobe Fire­fly, Adobe Express та Adobe Stock не застосовувалися ліміти на кредити. Але тепер для створення зображень, генеративної заливки та додавання ефектів доведеться витрачати по одному кредиту. Більше про тарифні плани та кількість кредитів для кожного з них можна дізнатись у довідковому розділі сайту Adobe.

BlueWillow

Офіційний сайт
Галерея
Вартість: 10 зображень на день (20 кредитів) безкоштовно, 2000 зображень на місяць за $9,99 

Приклади зображень, згенерованих BlueWil­low / Джерело: bluewillow.ai

На великій сторінці сайту BlueWil­low вас зустрічає велика кнопка «Gen­er­ate Art­work». Натискання на неї відкриває портал Lime­Ware, де можна генерувати зображення за допомогою нейронної мережі моделі BlueWil­low v4.

Генерація зображень на порталі Lime­Ware

До речі, на цьому ж сайті за бажання можна вибрати для використання інші нейронки. Наприклад, Sta­ble Dif­fu­sion v2.1; Sta­ble Dif­fu­sion v1.5; Sta­ble Dif­fu­sion XL v1.0; Google Ima­gen; Dalle‑2. 

Є також можливість генерації зображень у Dis­cord, але робота в загальному каналі, який постійно оновлюється, – задоволення не з найкращих.

BlueWil­low підтримує 11 мов та різні стилі, дозволяє вибирати кількість зображень для одночасної генерації, роздільну здатність картинки, рівень її якості та ступінь відповідності запиту. 

Переваги BlueWillow

  1. BlueWil­low підтримуе кількох мов: англійська, французька, німецька, португальська, іспанська, італійська, російська, китайська, індійська, корейська, філіппінська.
  2. Наявність на сайті докладного словника з перерахуванням стилів, що підтримуються, і прикладами промптів.

Недоліки BlueWillow

  1. Рівень креативності зображень, на мій погляд, дещо поступається Fire­fly та Mid­jour­ney.
  2. Є проблеми із анатомією людей.

Леонардо А.І

Офіційний сайт
Вартість: до 150 генерацій на день безкоштовно та понад 8,5 тис. генерацій за $10

Головна сторінка Leonardo.Ai

Заходимо на офіційний сайт і одразу бачимо напис «Кредитна картка не потрібна». Ця перспективна заява! Тиснемо на кнопку «Створити обліковий запис», погоджуємося використовувати для реєстрації Google-аккаунт і потрапляємо на платформу Leonar­do.

Домашня сторінка платформи Leonar­do

Її інтерфейс насичений великою кількістю елементів, куди вводити промпт поки що незрозуміло, тому варто розібратися з інтерфейсом докладніше. Почнемо з верхнього лівого кута. Тут у вічі кидаються 150 монет і кнопка Upgraide.

Тарифні плани Leonardo.Ai

При її натисканні відкривається сторінка з тарифними планами. Як ми вже писали, 150 генерацій на день можна отримати безкоштовно, далі йдуть тарифи за $10, $24 та $48 на місяць.

Окрім тарифних планів у лівій панелі головної сторінки можна знайти такі розділи: 

  • Home – домашня сторінка, де ми зараз і перебуваємо.
  • Com­mu­ni­ty Feed – стрічка із популярними роботами користувачів.
  • Per­son­al Feed – стрічка із вашими роботами.
  • Train­ing & Datasets – сторінка для навчання власної моделі. Так, ви не помилилися – у Leonar­do можна створити та навчити власну модель нейромережі.
  • Fine­tuned Mod­els – моделі, створені спільнотою користувачів.
  • AI Image Gen­er­a­tion – сторінка для створення зображень, де ми будемо вводити свій запит.

Сторінка для введення запиту на платформі Leonardo.Ai

Отже переходимо на сторінку генерації. Відразу кидається величезна яскрава кнопка «Gen­er­ate», праворуч від якої вказана вартість вибраних за замовчуванням налаштувань – 20 кредитів. Зменшення кількості зображень із 4 до 1 зменшує вартість генерації до 16 кредитів. Вимкнення режиму Alche­my V2 – до 8 кредитів.

Ліва панель на сторінці генерації містить установки, які можна використовувати при створенні зображення. Тут можна вибрати кількість зображень (за замовчуванням 4), режим Alche­my для більш точної генерації, пропорції зображення (за замовчуванням це 3:2) і точність відповідності запиту.

Результат генерації на запит «Kit­ty robot, 3d car­toon, col­or­ful back­ground»

Вводимо запит і тиснемо «Gen­er­ate». Після цього нейромережа видає четвірку зображень. Зручно, що за бажання відредагувати промпт його не потрібно шукати десь у надрах налаштувань. Просто над згенерованими зображеннями зліва ми бачимо свій промпт, праворуч – список налаштувань.

Меню редагування зображення у Leonardo.Ai

Натисканням однієї кнопки ми можемо скопіювати промпт або використовувати його ще раз. При виборі конкретного зображення з’являються функції «Завантажити/Download», «Видалити фон / Remove back­ground», «Поліпшити якість зображення / Alche­my Refin­er», «Редагувати на полотні / Edit in can­vas». 

Спробуємо збільшити зображення у вбудованому редакторі. Генеруємо дівчину-панка та тиснемо кнопку «Edit in can­vas».

Генеративне заливання у вбудованому редакторі Leonardo.Ai

Переміщуємо рамку редагування до області, яку хочемо розширити. Пишемо запит «graf­fi­ty» і натискаємо кнопку «Gen­er­ate». Як бачите, праворуч від дівчини з’являється ще один шматок стіни з графіті.

Переміщуємо рамку редагування вліво і пишемо в запиті «TV set» – зліва від дівчини з’являється щось, що віддалено нагадує телевізор. Найбільш вдалий варіант цоього додаткового зображення можна вибрати з 4 запропонованих в спеціальному меню.

Переваги Leonardo AI

  1. Висока якість зображень.
  2. Зберігається історія генерації з усіма налаштуваннями та промптами.
  3. Можна копіювати промпти натисканням однієї кнопки.
  4. Кредитів досить багато, та вони оновлюються щодня.

Недоліки Leonardo AI

  1. Є проблеми із анатомією.
  2. Іноді генерації тривають по 45 секунд та більше.

Порівняння нейромереж за одним запитом

Для порівняння ми використали знайомий вже вам запит «Kit­ty robot, 3d car­toon, col­or­ful back­ground». Результати ви можете оцінити нижче.

Midjourney

Stable Diffusion

Adobe Firefly

BlueWillow

Leonardo.Ai

Висновок

Отже, кожна нейронна мережа має унікальний стиль і може запропонувати користувачам різні переваги. Точно визначити кращу з них навряд чи можливо, оскільки оцінка зображень – питання суб’єктивне. Тому вибирайте ті зображення, які припали вам до душі, сміливо експериментуйте із запитами та починайте створювати власні шедеври.