AI-фотосессия · 20 сентября 2026 · 8 мин чтения

Как нейросеть рисует фото: диффузия простыми словами

Как работает генерация изображений: зачем модель учат портить снимки шумом, что идёт на каждом шаге обратного хода и почему мелкие детали ломаются первыми.

Кратко. Диффузионную модель сначала учат портить фотографии: к снимку подмешивают шум порциями, пока не останется крупа. Потом учат отменять порчу по шагу. Генерация идёт задом наперёд: из случайного шума за несколько десятков шагов проступает кадр, подходящий под текстовое описание. Считается всё это в сжатом представлении, а не по пикселям.

Откуда берётся картинка, если её никто не рисовал

Первое, что стоит выбросить из головы: внутри модели не лежит архив фотографий, из которого выбирается подходящая. Файл весит единицы гигабайтов, а училась сеть на сотнях миллионов картинок. Сложить их туда физически некуда.

Осталось внутри другое. Статистика: как ложится тень под скулой, чем живая кожа отличается от пластика, как заминается ткань на плече, какой формы бывают глаза и сколько их у человека. Из этой статистики кадр собирается заново при каждом запросе.

Приём, которым это делается, называется диффузией. Устроен он на удивление прямолинейно: модель умеет ровно одно действие, убирать шум с картинки. Всё остальное это повторение одного действия несколько десятков раз подряд.

Прямой процесс: сеть учат портить фотографии

Обучение начинается с порчи. Берут настоящий снимок и подмешивают к нему немного случайного шума. Потом ещё немного. И ещё, порциями по расписанию, пока от кадра не останется ровная серая крупа без единого узнаваемого пятна.

Расписание зашумления придумано не на глаз: на ранних порциях картинка почти цела, на поздних изменения идут крупными кусками. Смысл порчи вот в чём. Из одного снимка получается длинная лестница промежуточных состояний, и на каждой ступени заранее известно, сколько шума туда положили.

Дальше сеть тренируют на одном вопросе: вот испорченный кадр, какая его часть шум. Правильный ответ известен, ведь шум добавляли сами. Ни учителя, ни ручной разметки не требуется, годится любая фотография с подписью. После миллионов таких примеров модель смотрит на мутное пятно и уверенно говорит, что здесь лишнее.

Подпись к снимку тут не для красоты. Её подмешивают в обучение вместе с шумом, и сеть привыкает чистить кадр с оглядкой на слова. Так между «мужчина в чёрном пальто на вечерней улице» и определённым набором пятен, теней и очертаний завязывается связь, которой потом пользуется генерация.

Обратный процесс: как из шума проступает лицо

Генерация это та же лестница, пройденная вниз. Начинают не со снимка, а со случайных чисел: полный кадр случайных значений и есть стартовая точка. Модель оценивает, сколько тут шума, и снимает часть. Картинка становится чуть чище. Её отдают модели снова. И так несколько десятков раз.

На первом шаге никакого портрета в кадре нет. Сеть видит кашу и угадывает, каким снимком эта каша могла бы оказаться. Угадывание мягкое: за шаг снимается небольшая доля, поэтому кадр не выпрыгивает целиком, а проступает.

Шаги при этом неравноценны. В начале пути с кадра снимают большие куски неопределённости, ближе к концу правки идут ювелирные. Из-за этого нельзя просто урезать число шагов вдвое и получить ту же картинку быстрее: пропущенные мелкие правки никто не доделает, и кадр останется слегка мыльным, с плавающими краями на волосах и воротнике.

СтадияЧто уже видноЧто ещё не решено
Первые шагипятна светлого и тёмного, композиция, где голова и плечипочти всё остальное
Серединачерты лица, силуэт одежды, направление света, фон крупными кускамифактура кожи, мелкие предметы, надписи
Последние шагипоры, отдельные волоски, шов на пиджаке, блик в глазупоза и свет уже зафиксированы, менять их поздно

Практическое следствие из таблицы простое. Композицию и разворот головы решает начало процесса, а мелочи вроде пальцев и узора на рубашке достаются самому концу, когда остальное трогать уже нельзя. Поэтому кадр с идеальным светом и кривой кистью встречается чаще, чем наоборот.

Что задаёт итоговый кадр

  1. Стартовый шум. Одно число (seed) разворачивается в полный кадр случайных значений и определяет, куда двинется весь процесс.
  2. Текстовое описание сцены: субъект, одежда, свет, обстановка, оптика, кадрирование.
  3. Сила следования тексту. Отвечает за то, насколько жёстко модель держится описания.
  4. Число шагов обратного хода и способ, которым эти шаги считаются.
  5. Сама модель плюс надстройки поверх неё. База отвечает за мир вообще, личный адаптер за конкретное лицо, и про него у нас есть отдельный разбор.
  6. Разрешение и пропорции кадра. У нас это 2K по длинной стороне и вертикаль 3:4.

Латентное пространство на пальцах

Если бы сеть считала шум прямо по пикселям, на каждом шаге пришлось бы ворочать миллионы чисел, а шагов десятки. Ожидание вышло бы неприличным. Поэтому вся работа идёт в сжатом виде.

Картинку прогоняют через кодировщик. Он ужимает кадр в компактную карту, где точка хранит не цвет, а что-то вроде смысла участка: тут край, тут кожа в тени, тут ткань. Карта меньше исходника по стороне в несколько раз и плотнее по содержанию. Путь от шума до готового кадра проходит целиком внутри неё, а в самом конце декодер разворачивает карту обратно в пиксели.

Это и есть латентное пространство: скрытое промежуточное представление, в котором модель думает. Выигрыш по скорости огромный, плата тоже есть. Форма головы размазана по сотням точек карты, её ничем не сломать. А зрачок, зуб, буква на вывеске держатся на двух-трёх числах, и ошибка на одном шаге убивает деталь целиком. Разбор того, что при этом вылезает в кадре, собран у нас в справочнике артефактов.

Причём тут текст, если модель убирает шум

Сам по себе обратный ход дал бы случайное изображение: модель вытащила бы из шума что угодно правдоподобное. Текст нужен, чтобы чистка шла в нужную сторону.

Описание сцены прогоняют через текстовый кодировщик, слова превращаются в набор чисел. Этот набор подмешивается на каждом шаге, и сеть предсказывает шум уже при условии: в кадре мужчина в сером костюме у окна, мягкий боковой свет, поясной план. Дальше берутся две оценки, с учётом текста и без него, а разница между ними усиливается. Насколько сильно, задаёт параметр guidance.

У нас он стоит на 3,5 при рабочем диапазоне от 1 до 10. Выше получаются жёсткий контраст и пластмассовая кожа, ниже модель начинает вольничать и отходит от описания.

Почему диффузия вытеснила предыдущий подход

До неё фотореалистичные картинки делали состязательными сетями (GAN). Там один блок рисует кадр одним броском, второй пытается отличить подделку от настоящего снимка, и учатся они друг против друга. Скорость приятная, кадр за единственный проход.

Беда в другом. Такие сети капризны при обучении и склонны схлопываться на узком наборе почти одинаковых результатов. Длинное текстовое описание они отрабатывают грубо.

Диффузия медленнее, зато устойчивее. Процесс разбит на маленькие шаги, каждый из которых легко проверить при обучении, и длинную фразу про свет, одежду и план модель держит заметно аккуратнее. Отсюда и расклад: почти всё, чем сегодня делают портреты (Stable Diffusion, Flux и родня), построено на диффузии.

Где диффузия честно не справляется

Черты тянет к среднему. Сеть знает, как выглядит человек вообще, поэтому при слабой подсказке сдвигает лицо к усреднённому: симметрия ровнее, нос аккуратнее, возраст меньше. Лечится это не промптом, а тем, что лицо задают отдельно, своими снимками или обученной моделью.

Счёт предметов даётся тяжело. Сколько пальцев на кисти, пуговиц на пиджаке, ножек у стула: счётчика внутри нет, есть только похожесть на виденное раньше. Шестой палец растёт именно отсюда.

Текст в кадре почти всегда каша, и причина уже описана выше: буквам не хватает места в сжатой карте.

Чего сеть не видела, того она не нарисует, а придумает похожее. Редкий инструмент, конкретная эмблема на форме, узор твоей татуировки: на выходе будет правдоподобная выдумка, которая при беглом взгляде сойдёт за правду. Врёт диффузия убедительно, и это её рабочее свойство, а не поломка.

Отдельная ловушка ждёт при увеличении кадра. Апскейл тоже умеют делать диффузией: маленькую картинку перерисовывают заново в большом разрешении. Выходит резко и красиво, только лицо при этом собирается с нуля, и человек перестаёт походить на себя. Мы через это прошли: стоял диффузионный апскейлер, кадры становились чётче и чужее. Сейчас работает настоящий увеличитель разрешения, который поднимает детализацию и не сочиняет черты. Подтяжка лица у него включена на половинной силе, на полной кожа выглядит пластмассовой.

Как это устроено у нас

Ползунков шагов, seed и силы следования тексту в кабинете нет, и это осознанное решение. Промахнуться настройками легче, чем попасть, а человек приходит за готовыми кадрами, а не за пультом.

Маршрута два. Быстрый: три селфи, сцена из каталога (там больше 900 описаний со светом, обстановкой и планом), первые кадры приходят через пару минут после оплаты, весь пакет за 10-20 минут, цена от 490 ₽. Профи: 15-20 фотографий, обучение личной модели, около 40 минут на всё, дальше 60 кадров в пяти стилях за 3 490 ₽.

Кадры приходят вертикальными, 3:4, других ориентаций и автоматических кропов нет. Двенадцать штук из пакета увеличиваются бесплатно. Что происходит между оплатой и готовым файлом, подробно расписано в статье про наш маршрут, а сцены выбираются в каталоге.

Частые вопросы

Как работает генерация изображений нейросетью?

Модель стартует со случайного шума и за несколько десятков шагов снимает его по частям, сверяясь с текстовым описанием сцены. Готовых фотографий внутри нет, каждый кадр считается заново. Поэтому два запуска с одним и тем же описанием дают разные картинки.

Что такое диффузия простыми словами?

Сначала сеть учат портить: к настоящим снимкам подмешивают шум порциями, пока не останется серая крупа. Потом её учат отменять эту порчу по одному шагу. Обученная модель проходит путь назад из любого шума, и на выходе получается кадр, которого раньше не было.

Почему нейросеть путается в пальцах и надписях?

Кадр считается в сжатом виде, где мелкая деталь занимает совсем немного чисел. Общая форма руки восстанавливается уверенно, а пять отдельных пальцев и буквы на вывеске держатся на волоске. Отсюда шестипалые кисти и бессмысленный текст на фоне.

Сколько шагов нужно, чтобы получилась картинка?

Обычно хватает нескольких десятков. Первые шаги задают композицию и позу, последние доводят фактуру кожи и ткани. Оборвёшь рано, кадр останется мыльным, а лишние шаги почти ничего не меняют и только съедают время.

Обновлено: 20 сентября 2026

Готов попробовать?

Выбери сцены из каталога — более 900 вариантов. Первые кадры через пару минут после оплаты, от 490 ₽.

Выбрать сцены →

Читать дальше