AI-фотосессия · 23 сентября 2026 · 8 мин чтения
Чем отличаются модели генерации: почему портрет разный
Чем отличаются модели генерации портретов: рисование кадра с нуля по тексту против редактирования по образцам, где выше сходство, где свободнее сцена и какой маршрут выбрать под задачу.
Кратко. Портрет зависит от класса модели, а не от названия сервиса. Один класс рисует кадр с нуля по тексту: сцена выходит любая, но лицо приходится доучивать отдельным адаптером на 15-20 твоих фото. Второй редактирует кадр по образцам: черты держит с трёх селфи, зато хуже слушается описание сцены. Сходство и свобода кадра тянут в разные стороны.
Почему одни и те же селфи дают разных людей
Загрузи один набор снимков в два сервиса. Выйдут два разных мужчины, и оба будут выглядеть прилично. Дело тут не в том, что где-то нейросеть «умнее»: под капотом работают модели разной породы, и каждая решает свою половину задачи.
Пород грубо две. Первая рисует картинку с нуля по тексту: сюда относятся диффузионные семейства вроде Stable Diffusion и Flux, туда же Midjourney. Вторая правит изображение по картинкам-образцам, её типичный представитель это Nano Banana из линейки Gemini Image. Разница примерно как между художником, которому кадр описали словами, и ретушёром, которому дали фотографию и попросили пересобрать вокруг лица обстановку.
Класс первый: кадр с нуля по тексту
Такая модель стартует с поля случайного шума и за несколько десятков шагов вычищает из него изображение, сверяясь с текстом запроса. Про твоё лицо в этом тексте ничего нет. База знает человека вообще: как ложится тень от скулы, как блестит кожа у виска, как мнётся ткань на плече. Тебя она не видела ни разу.
Поэтому лицо вшивают отдельно, маленьким адаптером. Это и есть LoRA, механику мы разобрали в статье про надстройку с твоим лицом. Мы обучаем такой адаптер на 15-20 фото: 2 500 шагов, скорость обучения 0,0001, набор учится сразу в нескольких разрешениях, лишний фон срезается автокропом, маска по субъекту заставляет модель смотреть на человека, а не на кухню за его спиной. На датасет вешается слово-ключ, которым потом вызывается именно это лицо. Вся тренировка укладывается в 25-35 минут.
Дальше идёт настройка. Сила адаптера по умолчанию 1,0, рабочий коридор 0,7-1,1. Задерёшь выше: модель залипнет на обучающих кадрах и выдаст ту же куртку с тем же поворотом головы. Опустишь ниже: черты поплывут в сторону усреднённого мужчины. Guidance стоит на 3,5 при диапазоне от 1 до 10, и он тоже двусторонний: много даёт контраст и пластмассовую кожу, мало размывает выполнение запроса.
Зато сцена здесь свободна полностью. Любой свет, любая локация, любая одежда: обстановка существует только как текст, а текст можно написать какой угодно.
Класс второй: редактирование по образцам
Эта модель получает не пустой шум, а твои реальные снимки плюс описание нужного кадра. Она перерисовывает обстановку, свет и одежду, стараясь удержать лицо с образцов. Учить заранее ничего не надо, и это её главный козырь: первые кадры приходят через пару минут.
Сильная сторона у неё тоже есть, и её обычно недооценивают. Редактирующая модель работает поверх фотографии, поэтому фактура кожи, форма ушей и мелкие приметы приезжают из настоящего снимка, а не рождаются заново. Диффузионная модель с адаптером всё это додумывает: даже после хорошей тренировки она пишет твоё лицо по памяти, а память усреднена по пятнадцати-двадцати кадрам.
В быстром маршруте мы отдаём ей 4 лучших настоящих снимка человека из загрузки. Лучшие выбираются не на глаз: каждому кадру считается оценка качества лица, фронтальные и резкие получают больший балл и идут первыми. Разрешение 2K, кадр вертикальный.
Один случай стоит того, чтобы его рассказать. Раньше первым образцом уходил сгенерированный превью-кадр, а не живая фотография. Получался каскад: настоящее лицо, потом его неточная копия, потом кадр, нарисованный уже по копии. Погрешность накапливалась на каждом шаге, и на выходе человек узнавал себя с трудом. Теперь в образцы попадают только реальные снимки, и эта правка дала больше, чем любая возня с параметрами.
Слабое место класса другое: он тащит из образцов лишнее. Ракурс головы, характер освещения, иногда выражение лица. Просишь драматичный контровой свет, а получаешь ровную засветку своей кухни, потому что именно она была на селфи.
Что каждый класс делает лучше
| С нуля по тексту | Редактирование по образцам | |
|---|---|---|
| Откуда берётся лицо | из обученного адаптера | из четырёх реальных снимков при каждом кадре |
| Что грузит человек | 15-20 фото | 3 селфи |
| Подготовка | обучение 25-35 минут | не нужна |
| Сходство внутри пакета | ровное, черты зашиты в веса | плавает от кадра к кадру |
| Свобода сцены | полная, обстановка задаётся текстом | ниже: тянет свет и ракурс с образца |
| Что ломается первым | залипание на обучающем наборе | потеря характера сцены |
| Цена у нас | 3 490 ₽ за 60 кадров | пакеты от 490 ₽ |
Почему сходство и свобода сцены тянут в разные стороны
У обоих классов ручка «похожести» связана с ручкой «сцены» одной верёвкой. В адаптере это видно прямо по цифрам: на 1,3 лицо узнаётся идеально, но вместе с ним приезжает гардероб из обучающего набора и знакомый угол головы. На 0,6 модель послушно строит заказанную студию с косым светом, вот только в кадре стоит симпатичный незнакомец. Коридор 0,7-1,1 это компромисс, найденный руками.
В редактирующей модели верёвка та же, просто вместо числа на ней висит содержимое образцов. Дашь четыре снимка из одной комнаты при одной лампе: получишь отличное сходство и ту же комнату, наспех переодетую в студию. Дашь разнообразные кадры: сцена задышит, а черты просядут.
Практический вывод из этого простой. Качество исходников решает больше, чем выбор архитектуры. Мы писали об этом подробно, когда разбирали, насколько ты будешь похож на себя.
Где спотыкаются оба класса
Общего у двух пород больше, чем кажется. Обе тянут лицо к среднему: симметризуют, чуть омолаживают, сглаживают кожу. И обе ломаются на одних и тех же местах.
- Улыбка с зубами. Живая улыбка асимметрична, модель же рисует ровный ряд, а над ним ставит пустоватый взгляд.
- Пальцы у края кадра, особенно когда рука пересекает другой предмет.
- Мелкий текст: надпись на бейдже, циферблат, вывеска за спиной.
- Очки: дужка уезжает за ухо не в том месте, оправа теряет симметрию.
- Родинки, шрамы, линия роста волос, то есть ровно те приметы, по которым тебя узнают знакомые.
Список выше касается обоих маршрутов, и настройками он не закрывается. Поэтому кадры отбирают глазами: из пакета в двадцать пять штук два-три обычно уходят в брак по пальцам, оправе или надписи на фоне. Это обычная арифметика жанра, её закладывают заранее, когда выбирают размер пакета.
Отдельная история с увеличением кадра, там развилка того же типа. Настоящий апскейлер (super resolution) поднимает разрешение и резкость, оставляя лицо прежним. Диффузионный дорисовывает детали заново, и для портрета это беда: у нас когда-то стоял именно такой, он пересобирал лицо до неузнаваемости. Сейчас работает обычный: увеличение вдвое, подтяжка лица на половинной силе (на полной кожа становится пластмассовой), 12 бесплатных увеличений на пакет.
Как понять, какой класс работает в сервисе
Название модели тебе редко назовут, но интерфейс выдаёт породу за пару секунд.
Сервис просит три-четыре снимка и показывает первый результат почти сразу: перед тобой редактирование по образцам. Требует пятнадцать снимков и больше, а потом держит в очереди полчаса: готовится личный адаптер. Второй признак это сцены. Когда локация выбирается из готового списка с превью, запрос написан заранее и зашит в карточку сцены. Когда сцену предлагают описать словами, ты обращаешься к базовой модели напрямую и отвечаешь за формулировку сам.
Есть и третий вариант, самый частый у бесплатных приложений: одна редактирующая модель, десяток пресетов и полное безразличие к тому, что ты загрузил. Картинка выходит приличная, сходство слабое. Причина обычно скучная: на вход уходит первый попавшийся снимок, а не лучший из набора.
Как это устроено у нас
Мы держим оба маршрута, и это осознанный выбор, а не запас на всякий случай.
Быстрый работает на редактирующей модели: три селфи, сцены из каталога, первые кадры через пару минут, весь пакет за 10-20 минут, пакеты от 490 ₽. Профи-фотосессия идёт вторым путём: 15-20 фото, личная модель, 60 кадров в пяти стилях за 3 490 ₽, около 40 минут целиком. За один запрос модель отдаёт до четырёх кадров, поэтому стиль из двенадцати собирается тремя запросами с разными seed, иначе внутри стиля выходят близнецы.
Чего у нас нет, чтобы не было сюрпризов: ползунков силы модели и seed в кабинете, инпейнтинга по клику (локальной перерисовки куска кадра), встроенного редактора, горизонтальных кадров. Всё приходит вертикальным, 3:4. Маршрут от оплаты до готового файла целиком разобран в статье про устройство пайплайна.
Какой маршрут выбрать под задачу
- Нужны 10-25 кадров на аватарку, анкету или мессенджер: бери быстрый. Разница в сходстве на таком объёме читается слабо, а ждать сорок минут смысла мало.
- Нужен деловой портрет, который повесят на сайт компании рядом с фамилией: бери обучение, здесь лицо будут рассматривать внимательно.
- Собираешь запас кадров на несколько месяцев, в разных сценах и одежде: личная модель окупается, она держит одно лицо во всех стилях сразу.
- Исходники слабые (одна комната, одна лампа, кепка, тёмные очки): сначала переснимись. Ни один класс моделей не достанет из плохих снимков того, чего в них нет.
Частые вопросы
Чем отличаются модели генерации фото?
Есть два класса. Первый рисует кадр с нуля по тексту, и лицо в него вшивают отдельным адаптером, обученным на 15-20 твоих фото. Второй редактирует кадр по образцам: берёт твои реальные снимки и перерисовывает вокруг лица обстановку. Первый свободнее в сценах, второй быстрее и не требует обучения.
Какая модель лучше держит сходство с лицом?
Обученная личная модель: лицо зашито в её веса, поэтому от кадра к кадру черты держатся ровно. Редактирующая модель опирается на образцы при каждом кадре, и сходство там гуляет сильнее. Разница особенно заметна, когда кадров в пакете много.
Почему в одном сервисе лицо похоже, а в другом нет?
Чаще дело в классе модели и в том, что уходит ей на вход. Если сервис показывает модели сгенерированную картинку вместо твоего живого снимка, ошибка накапливается и человек перестаёт узнавать себя. Влияет и качество исходников: из тёмных селфи в кепке сходства не достанет ни одна архитектура.
Нужно ли обучать модель ради десяти кадров?
Обычно нет. На небольшом пакете под аватарку или анкету быстрый маршрут по каталогу даёт нормальный результат за 10-20 минут и стоит от 490 ₽. Обучение окупается, когда кадров много, сцены разные и сходство читают внимательно.
Обновлено: 23 сентября 2026
Готов попробовать?
Выбери сцены из каталога — более 900 вариантов. Первые кадры через пару минут после оплаты, от 490 ₽.
Выбрать сцены →Читать дальше
AI-фотосессия · 10 мин
AI-фотосессия для мужчин: что получается, а что нет
Мужская специфика AI-съёмки без рекламы: борода и лысина, врущая фигура, два режима работы и селфи, которые ломают модель.
AI-фотосессия · 8 мин
Сколько генерируется AI-фото и почему это не мгновенно
Разбор по слагаемым: из чего складывается время генерации кадра и что из этого реально можно ускорить.
AI-фотосессия · 8 мин
Seed в нейросети: почему один промпт даёт разные кадры
Seed это точка отсчёта для шума, из которого модель вытягивает кадр. Одно число даёт один кадр, другое число другой.
AI-фотосессия · 8 мин
Что такое LoRA простыми словами: как нейросеть учит лицо
Базовая модель умеет рисовать человека вообще. LoRA это маленькая надстройка, которая учит её рисовать конкретно тебя.
AI-фотосессия · 7 мин
Как работает AI-фотосессия изнутри: от селфи до кадра
Два маршрута съёмки, курируемый каталог сцен и список того, за что мы не берёмся.