Заметили странные меню в кафе? Слишком идеальные бургеры, симметричные пончики, неестественно ровные шарики мороженого — это не паранойя. Это генеративный ИИ, обученный на узкой «приятной» эстетике, которая подсознательно вызывает ощущение фальши.
Иногда результат откровенно абсурден — например, буррито с сыром, больше похожим на авангардное искусство, чем на еду. Но чаще подвох замечаешь не сразу, лишь приглядевшись.
«Это как инопланетянин, пытающийся сделать пиццу без понимания её сути», — говорит технический директор Reality Defender Алекс Лайл. Его компания как раз занимается детектированием AI-контента — бизнесом, который существует во многом благодаря подобным проблемам.
По словам Лайла, специфика таких изображений объясняется устройством самих моделей: идеально круглое мороженое, креветки, будто съедающие собственный хвост — новые «лавкрафтианские кулинарные ужасы».
Большие языковые модели и диффузионные модели обучаются на огромных массивах данных, находя закономерности, чтобы предсказать, чего хочет пользователь, когда просит: «сделай меню для бургерной».
«Многое здесь похоже на меню Chili's 2015 года — и на то есть причина: именно такой корпус данных лёг в основу обучения», — отмечает Лайл.
Новые данные критически важны для компаний, разрабатывающих ИИ — Amazon даже сканировала редкие книги для обучения моделей, а затем уничтожала их. Неизбежно, что часть сгенерированного ИИ контента попадает обратно в обучающие выборки. Но если модель слишком много учится на собственных же результатах, возникает риск «коллапса модели».
«Коллапс модели — это как коровье бешенство: когда выход модели снова и снова скармливают ей самой, в какой-то момент „инбридинг" становится критическим, и всё рушится», — объясняет Лайл. — «То, что мы видим сейчас, — это скорее конвергенция, не полный коллапс».
Конвергенция мягче: она снижает качество результатов ИИ, но не делает их полностью бесполезными.
Если попросить модель создать меню фастфуда, она, вероятнее всего, будет опираться на стиль Wendy's, Burger King или McDonald's — а эти сети уже используют похожую визуальную эстетику. В итоге ИИ лишь усиливает и без того однородный стиль, а если такие изображения снова попадают в обучающие данные — эффект накапливается.
Рекламные фото еды всегда выглядят лучше оригинала — вспомните идеально уложенный Биг Мак в рекламе. В ИИ-генерации этот эффект только усиливается.
«Оптимизация датасетов направлена на „приятность" и отсутствие чего-либо оскорбительного, и это оборачивается гомогенизацией», — говорит Ли Рейни, директор Center for Imagining the Digital Future в Elon University. — «ИИ, что в изображениях, что в тексте, склонен сглаживать любые острые углы».
Эффект усиливается локально: если создать меню в ChatGPT и вносить правки раз за разом, еда на картинках становится всё менее похожей на настоящую. Пользователь Labtec в X показал, как выглядит меню после 100 правок — результат неузнаваем (эксперимент был подтверждён независимо).
«Конечный результат вызывает у меня дискомфорт», — написал Labtec.
Вероятно, именно с этим сталкиваются рестораны, когда снова и снова редактируют AI-меню — меняют цены, названия блюд. С каждой правкой еда на изображениях становится чуть более круглой и гладкой.
«У людей есть почти необъяснимое чутьё, когда они видят нечто сгенерированное ИИ, в отличие от настоящего», — говорит Рейни. — «Это трудно сформулировать, но люди это чувствуют — возможно, именно поэтому реакция на рестораны с AI-меню оказалась такой острой».
За этим неприятием стоит наука. Исследователи из университета Дуйсбург-Эссен в Германии обнаружили эффект «зловещей долины»: изображения еды, максимально приближённые к реальности, вызывали больше отвращения и тревоги, чем откровенно фейковые картинки. Культурный контекст вокруг ИИ только усиливает это чувство.
Если реакция людей настолько негативна, рестораны, казалось бы, должны отказаться от AI-меню. Но проблема, из-за которой мы получаем идеально подрумяненные булочки для бургеров, выходит далеко за пределы обеденного стола.
«Видеть и слышать всегда означало верить — вплоть до того, что судебные системы были настроены на видеозаписи и записанные признания как золотой стандарт доказательств», — заключает Лайл. — «Это больше не так. Мир фундаментально изменился — к добру ли, к худу ли».
