ШІ малює олівцями: хто переміг у творчому тесті

Команда платформи TryAI провела незвичний експеримент: чотири моделі штучного інтелекту малювали цифровими олівцями на порожньому полотні. Найкращий результат показала GPT-5.6 Sol, а Claude Fable 5 виявився найдорожчим.
У світі штучного інтелекту змагання зазвичай стосуються швидкості обробки тексту чи точності відповідей. Але команда TryAI вирішила поглянути на моделі під іншим кутом: вони попросили GPT-5.6 Sol, Claude Fable 5, Grok 4.5 та Gemini 3.6 Flash не генерувати готові зображення, а самостійно малювати їх на віртуальному полотні за допомогою цифрових кольорових олівців.
Для цього дослідники створили спеціальне середовище Canvas Arena. Моделі отримували чисте полотно та інструменти: можливість змінювати колір, товщину штриха, силу натискання, розмазувати олівець, стирати частини малюнка та переглядати власну роботу для коригування. Загалом вони виконали 28 завдань — відтворили «Мону Лізу» та «Зоряну ніч», а також створили п'ять ілюстрацій за текстовими описами.
Точність відтворення класичних картин оцінювали за метрикою структурної подібності (SSIM). Для творчих завдань, як-от літній рибалка, захід сонця над океаном чи кішка на підвіконні, автоматичної оцінки не було — еталонного зображення не існувало. Найкращу загальну оцінку авторів експерименту отримала GPT-5.6 Sol: саме її версії «Зоряної ночі» та троянди стали фаворитами команди. Gemini 3.6 Flash показав найвищі значення SSIM для обох картин, однак дослідники наголосили, що автоматична метрика не завжди збігається з людським сприйняттям. Claude Fable 5 посів друге місце за результатом, але поступився через вартість і тривалість роботи, а Grok 4.5 виявився найслабшим за якістю.
Вартість і швидкість роботи суттєво відрізнялися. GPT-5.6 Sol витратив близько 3,4 мільйона токенів на сім малюнків, працюючи в середньому 6,2 хвилини над кожним, а орієнтовна вартість склала 7,74 долара. Claude Fable 5 використав понад 14,6 мільйона токенів і коштував приблизно 160,6 долара — майже у 20 разів дорожче. Grok 4.5 витратив найбільше токенів — 34 мільйони, але завдяки кешуванню його вартість залишилася на рівні 9,21 долара. Gemini 3.6 Flash обробив 27,7 мільйона токенів із приблизною вартістю 12,87 долара.
Цікаво, що більше перевірок не означало кращий результат. Дослідники відстежували, як моделі переглядають власні роботи під час малювання, і виявили: усі вони досягали найкращої схожості зі зразком ще до завершення процесу, а потім часто погіршували результат, продовжуючи вносити зміни. Наприклад, Gemini 3.6 Flash переглядав своє полотно в середньому понад 22 рази на малюнок, але фінальна версія виявлялася гіршою за найкращий проміжний результат.
Автори експерименту наголошують, що це не офіційний бенчмарк і не оцінка художніх здібностей моделей. Метою було показати, як різні системи планують дії, користуються інструментами, оцінюють власний результат і наскільки ефективно працюють у відкритих творчих завданнях. Цей тест — ще одне свідчення того, що штучний інтелект виходить за межі генерації тексту: нещодавно співзасновник OpenAI Андрей Карпати продемонстрував, як модель Claude Opus 5 за дві години та 5500 рядків коду створила інтерактивну 3D-візуалізацію початку роману «Володар перснів». Схоже, найближчим часом ми побачимо ще більше прикладів того, як ШІ перетворюється на інструмент для створення персоналізованих світів.
Читайте також
Ще в розділі «Здоров'я»
- Магнітні бурі в серпні 2026: календар NOAA і поради, як пережити неспокійні дні
- Харків майже не купував антидронові сітки та бронеплівку: що показало дослідження
- Українська команда Cassator Corp. збільшила виручку до $1,2 млн: що стоїть за зростанням Sl8
- Херсонський продавець розповів, як російський дрон переслідував його на ринку
- Історія російських монархів: як війни ставали фатальними для правителів







