Нейросеть Яндекса объединила генерацию и редактирование изображений в одной модели

Единая нейросеть Яндекса для генерации и редактирования изображений

Яндекс совершил значительный шаг в развитии технологий искусственного интеллекта, объединив возможности генерации и редактирования изображений в одной модели. Ранее для этих задач использовались две отдельные системы: одна создавала картинки по текстовому описанию (text-to-image), другая — редактировала готовые изображения по команде (image-to-image). Теперь же внедрена единая архитектура, которая одинаково эффективно справляется с обеими задачами. Это редкое достижение даже для мировых лидеров в области ИИ.

Ключевое преимущество новой модели заключается в том, что навыки, полученные при генерации, автоматически применяются при редактировании. Например, нейросеть способна корректно добавить на фотографию такие элементы, как хохлома или самовар, без необходимости дополнительного обучения на специализированных данных. Это значительно ускоряет процесс работы и делает его более гибким.

Особое внимание разработчики уделили модулю предобработки запросов, который получил название «промптилка». Этот модуль переписывает пользовательские запросы в форму, наиболее удобную для понимания моделью. Благодаря этому точность следования инструкциям при редактировании выросла на 12%. Кроме того, исчезла необходимость дублировать разработки для разных систем, что позволило внедрять улучшения быстрее и с меньшими затратами.

По результатам слепых сравнений с участием асессоров, новая модель уверенно занимает второе место после Gemini 3.1 Flash в задачах генерации изображений. Это подтверждает высокий уровень технологии и её конкурентоспособность на мировом рынке.

Объединение генерации и редактирования в одной архитектуре открывает новые возможности для пользователей: теперь можно не только создавать уникальные изображения по текстовому описанию, но и мгновенно вносить в них изменения, сохраняя высокое качество и точность. Это упрощает работу дизайнеров, маркетологов и всех, кто регулярно использует визуальный контент.