Известный инженер и исследователь в области искусственного интеллекта Андрей Карпаты представил новый, нестандартный бенчмарк для оценки возможностей больших языковых моделей. Вместо традиционных тестов на знание фактов или решение логических задач, он предложил ИИ-моделям творческую задачу: создать полноценный 3D-мультфильм по мотивам культового романа Дж. Р. Р. Толкина «Властелин колец».
В качестве подопытной модели выступила новейшая версия Claude Opus 5. Карпаты предоставил ей первый абзац из книги и установил бюджет в 1 миллион токенов, что эквивалентно примерно 10 долларам США. Задача была поставлена амбициозная: нарисовать три сцены из книги, используя код.
Результат превзошел ожидания. Модель потратила два часа на «размышления» и сгенерировала более 5500 строк программного кода. В этом коде она не только расставила 3D-объекты в виртуальном пространстве, но и прописала анимации, создала освещение и, что самое важное, собрала все элементы в единый видеоряд. По сути, ИИ выступил в роли режиссера, сценариста и технического директора одновременно.
Сам Андрей Карпаты предложил оценить результат самостоятельно, опубликовав готовый мультфильм по ссылке. Это не просто демонстрация возможностей ИИ, а полноценный бенчмарк, который может стать новым стандартом для измерения творческого и технического потенциала нейросетей.
Подобный подход знаменует собой важный сдвиг в области тестирования ИИ. Традиционные бенчмарки, такие как MMLU или HumanEval, оценивают способность модели отвечать на вопросы или писать код. Однако они не учитывают такие аспекты, как креативность, планирование, способность к долгосрочному контексту и интеграции различных навыков. Задача создать мультфильм требует от модели не только генерации кода, но и понимания сюжета, визуализации сцен, координации действий и соблюдения временных рамок.
Этот эксперимент показывает, что современные ИИ-модели способны на гораздо большее, чем просто обработка текста. Они могут создавать сложные визуальные истории, которые раньше требовали бы усилий целой команды художников, аниматоров и программистов. Конечно, полученный мультфильм, вероятно, не сравнится по качеству с работами студии Pixar, но сам факт того, что ИИ может пройти путь от текста до анимации за два часа, впечатляет.
Появление таких бенчмарков, как этот, подталкивает разработчиков ИИ к созданию более универсальных и творческих моделей. Возможно, в будущем мы увидим ИИ, которые смогут создавать не только короткие ролики, но и полноценные фильмы, игры или виртуальные миры. Эксперимент Карпаты — это шаг в сторону понимания того, как далеко мы продвинулись в области генеративного ИИ и какие горизонты открываются перед нами.




