Раньше в «Яндексе» генерация картинок по описанию и их последующее редактирование шли параллельными линиями. Теперь компания перевела оба сценария на единую модель и сообщила о первых результатах.
Изображение - ChatGPT
Alice AI ART 2.0 стала общей нейросетевой системой, которая обрабатывает текст и изображение в одной трансформерной архитектуре. До этого генерация и правка развивались разными стеками: свои модели, свои наборы данных, свое обучение, что заставляло отдельно внедрять каждое улучшение. Объединение позволяет перенастроить один механизм и одновременно менять поведение во всех сценариях.
В компании отмечают, что новая схема особенно помогает при работе с редкими визуальными объектами. Если модель научилась по запросу создавать, скажем, самовар или хохломскую роспись, она может затем корректно добавлять их и на уже существующие изображения без отдельного дообучения.
Внутри модели появился специальный модуль, который превращает короткую пользовательскую команду в развернутое описание задачи. За счет этого, по внутренним оценкам, точность следования инструкциям при редактировании выросла примерно на 12% без перестройки генеративной части. Отдельный блок обучения посвятили тексту внутри картинок: собрали наборы данных с английскими надписями и надписями на кириллице, после чего число скачиваний результатов с текстом увеличилось на 37%, а запросов на создание конкретных персонажей — на 23%.
Во внутренних сравнениях по методике Bradley—Terry Alice AI ART 2.0 заняла второе место среди мировых систем, которые создают арты по текстовому промту, уступив только Gemini 3.1 Flash от Google. В задачах редактирования картинок модель вошла в группу лидеров, а по точности выполнения пользовательских инструкций стала лучшей среди открытых решений. Сейчас технология работает как в «Шедевруме», так и в «Алиса AI»: она создает новые изображения и редактирует загруженные пользователем.

