AI-фотосессия · 23 сентября 2026 · 8 мин чтения

Сколько генерируется AI-фото и почему это не мгновенно

Почему нейросеть считает портрет минуты, а не секунды: шаги обратного процесса, разрешение 2K, очередь на видеокартах, пачки кадров и апскейл поверх готового файла.

Кратко. AI-фото не появляется мгновенно, потому что кадр не рисуется, а считается: модель повторяет полный пересчёт картинки много раз подряд, и повторы идут строго по очереди. Сверху ложатся разрешение 2K, ожидание свободной видеокарты и апскейл. Отсюда минуты вместо секунд.

Из чего складывается время

Короткий ответ: из четырёх слагаемых, и ни одно не убирается бесплатно.

  1. Шаги обратного процесса. Каждый шаг это полный пересчёт кадра целиком, и следующий шаг нельзя начать раньше предыдущего.
  2. Разрешение. Мы считаем вертикальный кадр 3:4 в 2K, а стоимость расчёта растёт быстрее, чем число пикселей.
  3. Очередь. Видеокарта не ждёт лично тебя: сначала задача получает место, потом в память грузятся веса модели.
  4. Постобработка. Апскейл это ещё один проход поверх уже готового файла.

Дальше по каждому слагаемому, от самого тяжёлого к самому лёгкому.

Почему шаг это не «чуть-чуть дорисовать»

Диффузионная модель начинает не с белого листа, а с шума. Её работа: раз за разом убирать из этого шума лишнее, приближаясь к картинке, которая соответствует описанию сцены. Каждый такой проход трогает всё изображение, а не тот угол, где ещё «не дорисовано».

Отсюда главное ограничение по скорости. Шаги строго последовательные. Десятый работает с тем, что оставил девятый, поэтому разложить их по разным картам и сложить результаты не выйдет. Внутри одного шага параллелизм есть, между шагами его нет.

Есть и второй расход, который обычно не подозревают. Чтобы модель слушалась описания сцены, на каждом шаге она сравнивает два варианта развития: с учётом промпта и без него, а потом тянет результат в сторону первого. Сила этой тяги у нас задана как 3,5 при рабочем диапазоне от единицы до десяти. Выше даёт контраст и «пластмассовую» кожу, ниже размывает исполнение сцены. Цена честная: работы на шаг примерно вдвое больше.

Разрешение 2K дороже, чем кажется

Пиксели не складываются линейно. Кадр с удвоенной стороной это вчетверо больше точек, а внимание модели к связям внутри картинки поднимается ещё круче: каждая область соотносится с остальными.

Соблазн очевидный: посчитать мельче, потом увеличить. На пейзаже такое иногда проходит, на портрете нет. Лицо занимает малую долю кадра, и при низком исходном разрешении глазу достаётся каша: ресницы слипаются, зрачок теряет рисунок, кожа превращается в ровный пластик. Разбор таких дефектов лежит в справочнике артефактов, заметная часть оттуда родом из нехватки разрешения.

Поэтому мы считаем сразу в 2K и в вертикали 3:4. Других ориентаций у нас нет, квадрат под аватарку человек вырезает сам.

Кадры идут пачками, а не по одному

За один запрос модель отдаёт до четырёх кадров. Это не каприз интерфейса, а способ не платить дважды за подготовку: веса уже в памяти, описание сцены разобрано, и посчитать четыре варианта разом дешевле, чем четыре раза по одному.

Дальше простая арифметика. Стиль из двенадцати снимков собирается тремя запросами, у каждого свой seed. Один seed на все двенадцать дал бы двенадцать близнецов с одинаковым поворотом головы, так что разные значения тут обязательны. Запросы уходят друг за другом, и галерея наполняется порциями: три кадра готовы, четыре считаются, остальные ждут.

Отсюда же ясно, почему пакет из 56 кадров ждёт дольше пакета из 10. Время почти линейно по числу кадров: каждый кадр это отдельный полный расчёт, скидки на объём тут нет.

Из чего состоит одна задача

Расчёт кадра это самая долгая стадия, но не единственная. Задача проходит цепочку, и каждое звено съедает свою долю.

  1. Приём заказа. Сигнал об оплате приходит от Robokassa отдельным сообщением, до него генерация не стартует.
  2. Подготовка исходников. Твои снимки читаются из хранилища и получают оценку качества лица: фронтальные и резкие поднимаются наверх, лучшие идут образцами.
  3. Расчёт. Та самая цепочка шагов, о которой весь этот текст.
  4. Запись. Готовый кадр уходит в объектное хранилище и получает личную ссылку.
  5. Показ. Файл появляется в галерее сразу, ждать сборки всего пакета не нужно.

Все стадии кроме третьей укладываются в секунды. Заметными они становятся в одном случае: когда исходников много и их надо разобрать перед первым кадром.

Очередь и холодный старт

Вычисления мы арендуем, а не держим коробку под столом. Между нажатием кнопки и первым шагом расчёта есть промежуток: задача получает свободную карту, в её память загружается модель на несколько гигабайт, поднимается личный адаптер, если маршрут профи.

Когда карта прогрета предыдущим заказом, этот промежуток почти не заметен. Когда задача приходит первой после паузы, ко времени кадра добавляется холодный старт. Та самая ситуация, когда один и тот же пакет у двух людей собирается с разницей в пару минут при одинаковых настройках.

Очередь работает и в обратную сторону. Пока твой пакет идёт, свободные карты разбирают соседние задачи, и параллельно считается сразу много заказов. Пропускная способность от этого растёт, а вот один конкретный кадр быстрее не становится.

Почему два одинаковых заказа считаются разное время

Разброс нормален, и объясняется он тремя вещами.

Первое: прогрета ли карта. Холодный старт добавляет к первому кадру загрузку модели в память, дальше этот расход исчезает.

Второе: сложность сцены. Ночная улица с вывесками, отражениями и людьми на заднем плане требует от модели больше связей внутри картинки, чем ровный серый фон студийного портрета. Разница не в разы, но она есть, и на пакете из полусотни кадров складывается в минуты.

Третье: длина пакета. Десять кадров это три запроса, пятьдесят шесть это четырнадцать, и каждый ждёт своей карты.

Есть и четвёртый источник, который не виден снаружи: качество исходников. Мутные селфи в кепке и тёмных очках дают больше промахов по лицу, промахи отправляются в брак, а вместо них человек запускает сцену заново. Формально расчёт был быстрым, по ощущению съёмка растянулась. Ровный свет, камера на уровне глаз, открытое лицо: три условия, которые экономят тебе целый круг ожидания.

Два маршрута тратят время по-разному

Быстрый маршрут по каталогу обходится без обучения. Лицо держится образцами: при каждом кадре в модель идут четыре лучших реальных снимка из твоей загрузки, отобранных по внутренней оценке качества лица. Читать образцы нужно заново на каждом кадре, и это добавляет работы, зато ждать нечего, первый кадр стартует сразу.

Маршрут с личной моделью устроен наоборот. Сначала обучение: 2 500 шагов при скорости 0,0001, набор учится сразу в нескольких разрешениях, лишний фон срезается автокропом, а маски заставляют модель смотреть на человека, а не на комнату за ним. Каждый из этих шагов это тоже проход по картинке, только не по будущему кадру, а по снимку из набора. Пока обучение не закончилось, генерировать нечего в принципе. Что при этом происходит с весами, разобрано в тексте про то, что такое LoRA простыми словами.

Зато после обучения лицо зашито в саму модель, образцы читать не надо, и кадры выходят ровнее.

Апскейл добавляет свой проход

Готовый кадр можно увеличить вдвое по стороне. У нас стоит настоящий апскейлер, а не диффузионный: он поднимает резкость и детализацию, но лицо не перерисовывает. Подтяжка лица включена на половинной силе, на полной кожа теряет поры и становится восковой.

Проход этот быстрее генерации, но не бесплатный по времени: файл читается, обсчитывается, пишется обратно. Двенадцать увеличений в пакете идут без доплаты, дальше 10 кредитов за кадр.

Исторический случай в тему. Когда-то на этом месте работал диффузионный апскейлер, и он не добавлял пикселей, а пересобирал кадр заново вместе с лицом. Человек переставал быть похожим на себя после операции, которая по названию должна была просто добавить разрешения. Заменили. Разница между «увеличить» и «перерисовать» стоит одной строки в конфиге и всего сходства.

Что ускорить можно, а что нельзя

РычагЧто даётЧем платишь
Меньше шаговКадр считается быстрееРазваливаются пальцы, зубы, мелкие надписи
Ниже разрешениеОщутимый выигрышПластиковая кожа и мыло в глазах
Слабее guidanceНебольшой выигрышСцена выполняется приблизительно
Больше картБольше заказов в часОдин кадр быстрее не становится
Короче пакетВсё готово раньшеМеньше вариантов для отбора

Первые три строки это ровно тот компромисс, на котором экономят сервисы с «мгновенной» генерацией. Секунда вместо минуты оплачивается качеством, и на портрете это заметно с первого взгляда.

Что действительно сокращает ожидание с твоей стороны: нормальные исходники. Резкие фронтальные селфи при ровном свете дают меньше промахов, а значит меньше поводов перезапускать сцену и ждать по второму разу.

Как это устроено у нас

Файлы падают в галерею по мере готовности, а не единым архивом в конце: первые кадры можно смотреть, пока остальные считаются. Весь путь от оплаты до готового снимка разобран отдельно в тексте про то, как устроен наш пайплайн.

Ручек скорости в кабинете нет намеренно. Ни ползунка шагов, ни выбора seed, ни силы модели: этими настройками легче всего испортить портрет, поэтому они держатся на проверенных значениях. Сцены в каталоге собраны так, чтобы кадр получался с первого раза, пакеты начинаются от 490 ₽.

Частые вопросы

Сколько генерируется одно AI-фото?

Счёт идёт на секунды и десятки секунд для одного кадра, а не на мгновения. У нас первые готовые файлы приходят в галерею через пару минут после оплаты, остальные появляются по мере готовности. Пакет целиком ждать не нужно, кадры открываются по одному.

Почему нейросеть не может нарисовать портрет за секунду?

Потому что кадр не рисуется, а считается пошагово: модель много раз подряд пересчитывает всю картинку целиком, и каждый повтор зависит от предыдущего. Распараллелить эту цепочку внутри одного кадра нельзя. Сверху ложатся разрешение, очередь на видеокартах и постобработка.

Почему кадры приходят не все сразу?

За один запрос модель отдаёт до четырёх кадров. Стиль из двенадцати снимков собирается тремя запросами с разными seed, чтобы кадры не повторяли друг друга. Запросы уходят один за другим, поэтому галерея наполняется порциями.

Апскейл тоже занимает время?

Да, это отдельный проход поверх готового кадра: увеличение вдвое по стороне плюс аккуратная подтяжка лица. Двенадцать увеличений в пакете бесплатные. Занимает это заметно меньше, чем сама генерация, но не ноль.

Обновлено: 23 сентября 2026

Готов попробовать?

Выбери сцены из каталога — более 900 вариантов. Первые кадры через пару минут после оплаты, от 490 ₽.

Выбрать сцены →

Читать дальше