Диффузионные модели, лежащие в основе современных ИИ-генераторов изображений, начинают работу с изображения чистого шума и постепенно удаляют его для создания запрошенного визуального контента. Однако эти модели плохо справляются с генерацией тонких, непрерывных структур, таких как лапша и нити, что приводит к появлению странных червеобразных форм в изображениях еды.
Фундментальная проблема заключается в том, что ИИ не понимает, что такое сэндвич, лапша или буррито, и не имеет представления о физическом мире. Модели работают с паттернами в данных, но не обладают концептуальным пониманием структуры и свойств реальных объектов.
Ситуация может усугубляться явлением «коллапса модели», которое происходит при обучении ИИ-моделей на материалах, созданных другими ИИ. Это приводит к визуальной деградации и накоплению артефактов в генерируемых изображениях.
Человеческая реакция отвращения к таким изображениям имеет эволюционные корни. Люди настроены замечать, когда еда выглядит неправильно, поскольку это служит защитным механизмом от паразитов и токсинов. Неестественные текстуры и формы, создаваемые ИИ, активируют эти древние инстинкты самосохранения.
