Южнокорейские исследователи из KAIST )Korea Advanced Institute of Science and Technology - Корейский передовой институт науки и технологий) представили Chain-of-Zoom (CoZ) — систему искусственного интеллекта, способную увеличивать изображения с низким разрешением до 256 раз, не теряя при этом реалистичных деталей. Вместо размытия и пикселизации, как у традиционных алгоритмов, CoZ «перерисовывает» картинку, словно глазами воображаемой камеры с идеальной оптикой.
В отличие от стандартных моделей суперразрешения, которые пытаются одним махом «додумать» недостающие пиксели, CoZ действует поэтапно. Изображение масштабируется небольшими шагами, и на каждом из них подключается обученная модель, уточняющая картинку. Такой подход напоминает лестницу, где каждая ступенька — это промежуточный результат, основанный на предыдущем.
Уникальность CoZ не только в последовательном зуме, но и в использовании языковой модели, которая подсказывает, что именно должно появиться на следующем шаге. Например, если ИИ видит флаг, языковая модель может подсказать: «складки ткани», «нитки», «структура ткачества». Эти подсказки направляют процесс «дорисовки», делая результат логичным и достоверным. Обучение модели проходило с помощью обратной связи от человека, что помогло исключить бессмысленные или повторяющиеся подсказки.
По результатам тестов CoZ обошёл существующие алгоритмы по качеству изображения на всех уровнях увеличения — особенно при крайних значениях, вроде 256-кратного зума. Метод не требует переподготовки базовых моделей, что делает его привлекательным для разработчиков, уже использующих diffusion-модели и другие решения для генерации изображений.
Потенциальные применения обширны: медицина, криминалистика, реставрация архивных фотографий, микроскопия, астрономия и многое другое. В одном из тестов CoZ «вытащил» на изображении листа отдельные прожилки, в другом — восстановил структуру ткани. Для научных и исследовательских задач такой инструмент может оказаться бесценным.
Однако важно учесть, что Chain-of-Zoom не восстанавливает реальность, а лишь предсказывает, как она могла бы выглядеть. Это делает технологию перспективной, но потенциально опасной: её можно использовать для создания правдоподобных, но ложных изображений. Исследователи не скрывают этого и подчеркивают необходимость ответственного применения.