AI-фотосессия · 20 сентября 2026 · 8 мин чтения
Как нейросеть рисует фото: диффузия простыми словами
Как работает генерация изображений: зачем модель учат портить снимки шумом, что идёт на каждом шаге обратного хода и почему мелкие детали ломаются первыми.
Кратко. Диффузионную модель сначала учат портить фотографии: к снимку подмешивают шум порциями, пока не останется крупа. Потом учат отменять порчу по шагу. Генерация идёт задом наперёд: из случайного шума за несколько десятков шагов проступает кадр, подходящий под текстовое описание. Считается всё это в сжатом представлении, а не по пикселям.
Откуда берётся картинка, если её никто не рисовал
Первое, что стоит выбросить из головы: внутри модели не лежит архив фотографий, из которого выбирается подходящая. Файл весит единицы гигабайтов, а училась сеть на сотнях миллионов картинок. Сложить их туда физически некуда.
Осталось внутри другое. Статистика: как ложится тень под скулой, чем живая кожа отличается от пластика, как заминается ткань на плече, какой формы бывают глаза и сколько их у человека. Из этой статистики кадр собирается заново при каждом запросе.
Приём, которым это делается, называется диффузией. Устроен он на удивление прямолинейно: модель умеет ровно одно действие, убирать шум с картинки. Всё остальное это повторение одного действия несколько десятков раз подряд.
Прямой процесс: сеть учат портить фотографии
Обучение начинается с порчи. Берут настоящий снимок и подмешивают к нему немного случайного шума. Потом ещё немного. И ещё, порциями по расписанию, пока от кадра не останется ровная серая крупа без единого узнаваемого пятна.
Расписание зашумления придумано не на глаз: на ранних порциях картинка почти цела, на поздних изменения идут крупными кусками. Смысл порчи вот в чём. Из одного снимка получается длинная лестница промежуточных состояний, и на каждой ступени заранее известно, сколько шума туда положили.
Дальше сеть тренируют на одном вопросе: вот испорченный кадр, какая его часть шум. Правильный ответ известен, ведь шум добавляли сами. Ни учителя, ни ручной разметки не требуется, годится любая фотография с подписью. После миллионов таких примеров модель смотрит на мутное пятно и уверенно говорит, что здесь лишнее.
Подпись к снимку тут не для красоты. Её подмешивают в обучение вместе с шумом, и сеть привыкает чистить кадр с оглядкой на слова. Так между «мужчина в чёрном пальто на вечерней улице» и определённым набором пятен, теней и очертаний завязывается связь, которой потом пользуется генерация.
Обратный процесс: как из шума проступает лицо
Генерация это та же лестница, пройденная вниз. Начинают не со снимка, а со случайных чисел: полный кадр случайных значений и есть стартовая точка. Модель оценивает, сколько тут шума, и снимает часть. Картинка становится чуть чище. Её отдают модели снова. И так несколько десятков раз.
На первом шаге никакого портрета в кадре нет. Сеть видит кашу и угадывает, каким снимком эта каша могла бы оказаться. Угадывание мягкое: за шаг снимается небольшая доля, поэтому кадр не выпрыгивает целиком, а проступает.
Шаги при этом неравноценны. В начале пути с кадра снимают большие куски неопределённости, ближе к концу правки идут ювелирные. Из-за этого нельзя просто урезать число шагов вдвое и получить ту же картинку быстрее: пропущенные мелкие правки никто не доделает, и кадр останется слегка мыльным, с плавающими краями на волосах и воротнике.
| Стадия | Что уже видно | Что ещё не решено |
|---|---|---|
| Первые шаги | пятна светлого и тёмного, композиция, где голова и плечи | почти всё остальное |
| Середина | черты лица, силуэт одежды, направление света, фон крупными кусками | фактура кожи, мелкие предметы, надписи |
| Последние шаги | поры, отдельные волоски, шов на пиджаке, блик в глазу | поза и свет уже зафиксированы, менять их поздно |
Практическое следствие из таблицы простое. Композицию и разворот головы решает начало процесса, а мелочи вроде пальцев и узора на рубашке достаются самому концу, когда остальное трогать уже нельзя. Поэтому кадр с идеальным светом и кривой кистью встречается чаще, чем наоборот.
Что задаёт итоговый кадр
- Стартовый шум. Одно число (seed) разворачивается в полный кадр случайных значений и определяет, куда двинется весь процесс.
- Текстовое описание сцены: субъект, одежда, свет, обстановка, оптика, кадрирование.
- Сила следования тексту. Отвечает за то, насколько жёстко модель держится описания.
- Число шагов обратного хода и способ, которым эти шаги считаются.
- Сама модель плюс надстройки поверх неё. База отвечает за мир вообще, личный адаптер за конкретное лицо, и про него у нас есть отдельный разбор.
- Разрешение и пропорции кадра. У нас это 2K по длинной стороне и вертикаль 3:4.
Латентное пространство на пальцах
Если бы сеть считала шум прямо по пикселям, на каждом шаге пришлось бы ворочать миллионы чисел, а шагов десятки. Ожидание вышло бы неприличным. Поэтому вся работа идёт в сжатом виде.
Картинку прогоняют через кодировщик. Он ужимает кадр в компактную карту, где точка хранит не цвет, а что-то вроде смысла участка: тут край, тут кожа в тени, тут ткань. Карта меньше исходника по стороне в несколько раз и плотнее по содержанию. Путь от шума до готового кадра проходит целиком внутри неё, а в самом конце декодер разворачивает карту обратно в пиксели.
Это и есть латентное пространство: скрытое промежуточное представление, в котором модель думает. Выигрыш по скорости огромный, плата тоже есть. Форма головы размазана по сотням точек карты, её ничем не сломать. А зрачок, зуб, буква на вывеске держатся на двух-трёх числах, и ошибка на одном шаге убивает деталь целиком. Разбор того, что при этом вылезает в кадре, собран у нас в справочнике артефактов.
Причём тут текст, если модель убирает шум
Сам по себе обратный ход дал бы случайное изображение: модель вытащила бы из шума что угодно правдоподобное. Текст нужен, чтобы чистка шла в нужную сторону.
Описание сцены прогоняют через текстовый кодировщик, слова превращаются в набор чисел. Этот набор подмешивается на каждом шаге, и сеть предсказывает шум уже при условии: в кадре мужчина в сером костюме у окна, мягкий боковой свет, поясной план. Дальше берутся две оценки, с учётом текста и без него, а разница между ними усиливается. Насколько сильно, задаёт параметр guidance.
У нас он стоит на 3,5 при рабочем диапазоне от 1 до 10. Выше получаются жёсткий контраст и пластмассовая кожа, ниже модель начинает вольничать и отходит от описания.
Почему диффузия вытеснила предыдущий подход
До неё фотореалистичные картинки делали состязательными сетями (GAN). Там один блок рисует кадр одним броском, второй пытается отличить подделку от настоящего снимка, и учатся они друг против друга. Скорость приятная, кадр за единственный проход.
Беда в другом. Такие сети капризны при обучении и склонны схлопываться на узком наборе почти одинаковых результатов. Длинное текстовое описание они отрабатывают грубо.
Диффузия медленнее, зато устойчивее. Процесс разбит на маленькие шаги, каждый из которых легко проверить при обучении, и длинную фразу про свет, одежду и план модель держит заметно аккуратнее. Отсюда и расклад: почти всё, чем сегодня делают портреты (Stable Diffusion, Flux и родня), построено на диффузии.
Где диффузия честно не справляется
Черты тянет к среднему. Сеть знает, как выглядит человек вообще, поэтому при слабой подсказке сдвигает лицо к усреднённому: симметрия ровнее, нос аккуратнее, возраст меньше. Лечится это не промптом, а тем, что лицо задают отдельно, своими снимками или обученной моделью.
Счёт предметов даётся тяжело. Сколько пальцев на кисти, пуговиц на пиджаке, ножек у стула: счётчика внутри нет, есть только похожесть на виденное раньше. Шестой палец растёт именно отсюда.
Текст в кадре почти всегда каша, и причина уже описана выше: буквам не хватает места в сжатой карте.
Чего сеть не видела, того она не нарисует, а придумает похожее. Редкий инструмент, конкретная эмблема на форме, узор твоей татуировки: на выходе будет правдоподобная выдумка, которая при беглом взгляде сойдёт за правду. Врёт диффузия убедительно, и это её рабочее свойство, а не поломка.
Отдельная ловушка ждёт при увеличении кадра. Апскейл тоже умеют делать диффузией: маленькую картинку перерисовывают заново в большом разрешении. Выходит резко и красиво, только лицо при этом собирается с нуля, и человек перестаёт походить на себя. Мы через это прошли: стоял диффузионный апскейлер, кадры становились чётче и чужее. Сейчас работает настоящий увеличитель разрешения, который поднимает детализацию и не сочиняет черты. Подтяжка лица у него включена на половинной силе, на полной кожа выглядит пластмассовой.
Как это устроено у нас
Ползунков шагов, seed и силы следования тексту в кабинете нет, и это осознанное решение. Промахнуться настройками легче, чем попасть, а человек приходит за готовыми кадрами, а не за пультом.
Маршрута два. Быстрый: три селфи, сцена из каталога (там больше 900 описаний со светом, обстановкой и планом), первые кадры приходят через пару минут после оплаты, весь пакет за 10-20 минут, цена от 490 ₽. Профи: 15-20 фотографий, обучение личной модели, около 40 минут на всё, дальше 60 кадров в пяти стилях за 3 490 ₽.
Кадры приходят вертикальными, 3:4, других ориентаций и автоматических кропов нет. Двенадцать штук из пакета увеличиваются бесплатно. Что происходит между оплатой и готовым файлом, подробно расписано в статье про наш маршрут, а сцены выбираются в каталоге.
Частые вопросы
Как работает генерация изображений нейросетью?
Модель стартует со случайного шума и за несколько десятков шагов снимает его по частям, сверяясь с текстовым описанием сцены. Готовых фотографий внутри нет, каждый кадр считается заново. Поэтому два запуска с одним и тем же описанием дают разные картинки.
Что такое диффузия простыми словами?
Сначала сеть учат портить: к настоящим снимкам подмешивают шум порциями, пока не останется серая крупа. Потом её учат отменять эту порчу по одному шагу. Обученная модель проходит путь назад из любого шума, и на выходе получается кадр, которого раньше не было.
Почему нейросеть путается в пальцах и надписях?
Кадр считается в сжатом виде, где мелкая деталь занимает совсем немного чисел. Общая форма руки восстанавливается уверенно, а пять отдельных пальцев и буквы на вывеске держатся на волоске. Отсюда шестипалые кисти и бессмысленный текст на фоне.
Сколько шагов нужно, чтобы получилась картинка?
Обычно хватает нескольких десятков. Первые шаги задают композицию и позу, последние доводят фактуру кожи и ткани. Оборвёшь рано, кадр останется мыльным, а лишние шаги почти ничего не меняют и только съедают время.
Обновлено: 20 сентября 2026
Готов попробовать?
Выбери сцены из каталога — более 900 вариантов. Первые кадры через пару минут после оплаты, от 490 ₽.
Выбрать сцены →Читать дальше
AI-фотосессия · 10 мин
AI-фотосессия для мужчин: что получается, а что нет
Мужская специфика AI-съёмки без рекламы: борода и лысина, врущая фигура, два режима работы и селфи, которые ломают модель.
AI-фотосессия · 8 мин
Что такое LoRA простыми словами: как нейросеть учит лицо
Базовая модель умеет рисовать человека вообще. LoRA это маленькая надстройка, которая учит её рисовать конкретно тебя.
AI-фотосессия · 8 мин
Как нейросеть учится на твоих фото: разбор по шагам
Весь путь от загруженной папки до готового портрета, по шагам и без магии.
AI-фотосессия · 7 мин
Как работает AI-фотосессия изнутри: от селфи до кадра
Два маршрута съёмки, курируемый каталог сцен и список того, за что мы не берёмся.
AI-фотосессия · 7 мин
Артефакты AI-фото: справочник по проверке кадра
Одиннадцать зон, где ломается сгенерированный кадр, и порядок проверки, который занимает минуту.