«Мона Лиза», нарисованная карандашами ИИ: какая модель лучше всего проявила себя в рисовании
«Мона Лиза», нарисованная карандашами ИИ: какая модель лучше всего проявила себя в рисовании
Команда платформы TryAI сравнила модели искусственного интеллекта GPT-5.6 Sol, Claude Fable 5, Grok 4.5 и Gemini 3.6 Flash в необычном тесте. Системы не генерировали готовые изображения, а самостоятельно рисовали их на пустом холсте с помощью цифровых цветных карандашей. По итогам эксперимента лучший результат показала модель OpenAI, тогда как Claude оказался самым дорогим, а Grok — самым слабым по качеству.
Исследователи создали специальную среду Canvas Arena, в которой модели получали чистый холст и набор инструментов: могли менять цвет и толщину карандаша, силу нажатия, размазывать штрихи, стирать отдельные участки и просматривать собственный рисунок для внесения изменений. Всего они выполнили 28 работ: воссоздали «Мону Лизу» Леонардо да Винчи и «Звёздную ночь» Винсента ван Гога, а также создали пять иллюстраций по текстовым описаниям.
Как проходил эксперимент
В тестировании участвовали GPT-5.6 Sol, Claude Fable 5, Grok 4.5 и Gemini 3.6 Flash. Все модели работали с одинаковым набором инструментов и находились в одинаковых условиях. Точность воспроизведения картин оценивалась по метрике структурного сходства (Structural Similarity Index Measure, SSIM).
Для открытых творческих задач модели рисовали пожилого рыбака, закат над океаном, красную розу в вазе, кошку на подоконнике и интерьер деревянной хижины с камином. Эти работы не оценивались автоматически, поскольку не имели эталонного изображения.
GPT-5.6 стал лидером
По итогам теста GPT-5.6 Sol получил наилучшую общую оценку авторов эксперимента. Команда TryAI отметила, что именно эта модель создала самые детализированные работы, а её версии «Звёздной ночи» и розы стали их фаворитами.
Gemini 3.6 Flash показал самые высокие значения SSIM для обеих картин, однако авторы отметили, что автоматическая метрика не всегда соответствует человеческому восприятию качества. Claude Fable 5 занял второе место по результату, но уступил из-за значительно более высокой стоимости и длительности работы, тогда как Grok 4.5 продемонстрировал самые слабые результаты.
Стоимость и скорость существенно различались
На создание семи рисунков GPT-5.6 Sol использовал около 3,4 миллиона токенов, работал в среднем 6,2 минуты над каждой работой, а ориентировочная стоимость составила 7,74 доллара. Claude Fable 5 потратил более 14,6 миллиона токенов и примерно 160,6 доллара, что почти в 20 раз дороже, чем у GPT-5.6. Grok 4.5 использовал больше всего токенов — —, 34 миллиона, — но благодаря кэшированию его стоимость осталась на уровне 9,21 доллара. Gemini 3.6 Flash обработал 27,7 миллиона токенов с приблизительной стоимостью 12,87 доллара.
Больше проверок не означает лучший результат
Исследователи также отслеживали, как модели просматривали свои работы во время рисования. Оказалось, что все они достигали наилучшего сходства с образцом ещё до завершения процесса, а затем часто ухудшали результат, продолжая вносить изменения.
Например, Gemini 3.6 Flash просматривал свое полотно в среднем более 22 раз на рисунок, однако финальная версия оказывалась хуже лучшего промежуточного результата. Аналогичную тенденцию продемонстрировали GPT-5.6 Sol, Claude Fable 5 и Grok 4.5.
Для чего проводился такой тест
Авторы подчеркивают, что эксперимент не был официальным бенчмарком и не претендует на оценку художественных способностей моделей. Его целью было показать, как различные системы планируют действия, используют инструменты, оценивают собственный результат и насколько эффективно работают в открытых творческих задачах.
Недавно соучредитель OpenAI Андрей Карпати провёл эксперимент, в ходе которого модель Claude Opus 5 от Anthropic за два часа и 5500 строк кода создала интерактивную 3D-визуализацию начала романа «Властелин колец». Исследователь отметил, что крупные языковые модели выходят за пределы генерации простого текста и переходят к созданию персонализированных эфемерных игровых миров.