AI-фотосессия · 24 сентября 2026 · 8 мин чтения
Сколько шагов обучения нужно модели лица: 2 500
Сколько шагов обучения нужно LoRA для лица: почему берут 2 500 при скорости 0,0001, как число шагов считается от размера набора и по каким признакам видно недообученную модель.
Кратко. Личной модели лица хватает 2 500 шагов при скорости обучения 0,0001 и наборе из 15-20 фото. Шаг это один цикл правки весов. Считать полезнее другую величину: сколько раз модель успела посмотреть каждый снимок, и при этих настройках выходит около ста сорока просмотров на кадр. Ниже тысячи шагов лицо перестаёт держаться.
Что такое один шаг обучения
Шаг это один короткий цикл. Модель берёт снимок из твоего набора, портит его шумом, пытается восстановить исходник, сверяет свою версию с оригиналом и сдвигает веса надстройки в сторону меньшей ошибки. Сдвиг мизерный, поэтому циклов нужны тысячи. Как устроен сам цикл, разобрано в тексте про то, что такое LoRA.
Счётчик шагов живёт отдельно от числа фотографий. Набор прокручивается по кругу: кончились двадцать кадров, пошли те же двадцать заново, и так пока не наберётся заданное количество. Поэтому голое число шагов ничего не говорит, пока рядом не указан размер набора.
Откуда берётся 2 500
Мы ставим 2 500 шагов. Цифра выглядит произвольной ровно до того момента, пока её не поделить на число снимков.
Набор из 15-20 фото означает, что каждый кадр попадает под правку 125-165 раз. Это и есть работающая величина, к которой подгоняют всё остальное. Сотни полторы просмотров на снимок хватает, чтобы сеть выделила устойчивое в лице (геометрию черт, пропорции, форму скул) и не успела запомнить всё остальное: диван за спиной, ту самую толстовку, привычный наклон головы.
Почему именно столько, а не пятьдесят и не пятьсот, понятно из того, как сеть работает с повторами. За первые несколько десятков просмотров она собирает грубый портрет: овал, тон кожи, цвет глаз, общую массу волос. Дальше идёт долгий участок, на котором подтягивается мелочь, по которой тебя реально узнают знакомые: асимметрия бровей, форма крыльев носа, характерная складка у рта. Этот участок и требует основного времени. А после него новых данных в наборе уже не остаётся, и сеть начинает запоминать конкретные пиксели конкретных файлов.
Отсюда простое правило пересчёта. Меняется набор, меняются и шаги, чтобы просмотров на кадр осталось столько же.
| Снимков в наборе | Шагов | Просмотров каждого кадра |
|---|---|---|
| 10 | 1 500 | 150 |
| 15 | 2 500 | 165 |
| 20 | 2 500 | 125 |
| 30 | 3 500-4 000 | 115-135 |
Нижняя строка таблицы редкая: тридцать по-настоящему разных портретов у обычного человека находятся нечасто. Сколько кадров реально нужно и почему после тридцати прироста нет, разобрано в отдельном тексте про размер набора для обучения.
Почему скорость обучения 0,0001 и при чём тут шаги
Скорость обучения задаёт величину одной правки. Шаги задают, сколько таких правок будет. Перемножь одно на другое и получишь примерное расстояние, которое веса пройдут за всё обучение.
Из этого следует неприятная вещь: две настройки нельзя подбирать по отдельности. Поставишь скорость 0,0002 и оставишь прежние 2 500 шагов, модель улетит дальше нужной точки. Опустишь до 0,00005, на тех же шагах она до лица не дойдёт.
Значение 0,0001 берут как безопасную середину. Правки на этой скорости достаточно крупные, чтобы уложиться в разумное время (обучение занимает 25-35 минут), и достаточно мелкие, чтобы сеть не проскочила момент, когда лицо уже выучено. Большая скорость соблазнительна: шагов надо втрое меньше, обучение короче. Но каждая грубая правка сдвигает веса сразу на много, и результат от запуска к запуску начинает гулять. У портретов это видно быстрее всего, потому что человеческий глаз ловит смещение черт на пару процентов.
Где начинается недообучение
Недообученная модель не выглядит сломанной. В этом её главная неприятность: кадры получаются приличные, просто на них другой человек.
Признаки идут примерно в таком порядке, по мере снижения числа шагов:
- Сходство есть, но плавает. На одном кадре ты, на следующем твой двоюродный брат.
- Общий типаж совпадает (возраст, телосложение, цвет волос), а мелкая геометрия уходит: нос чуть другой формы, разрез глаз шире, подбородок мягче.
- Черты сваливаются в среднего мужчину из базовой модели. Такое лицо узнаёшь ты сам, а мать уже нет.
- Слово-ключ перестаёт работать. Модель на него почти не реагирует, и кадр получается таким, каким его нарисовала бы база без всякого обучения.
Есть и косвенная проверка, которая работает уже на готовых кадрах. Сила адаптера при генерации у нас стоит на 1,0 при рабочем диапазоне 0,7-1,1. Если сходство появляется только на верхней границе, а на 0,9 лицо расползается, модель недоучена. У нормально обученной запас идёт в другую сторону: на 0,8 человек всё ещё узнаваем.
По нашим настройкам граница проходит где-то около тысячи шагов на наборе из восемнадцати кадров. Это меньше шестидесяти просмотров на снимок, и сеть за это время успевает выучить силуэт, но не лицо.
Верхняя граница и почему её не двигают
С другой стороны диапазона стоит переобучение. Сеть перестаёт понимать твоё лицо и начинает помнить исходники целиком: та же куртка, тот же угол поворота головы, тот же фон в каждом кадре. Но шаги тут ускоритель, а не первопричина: перечень того, что ломает обучение, состоит из свойств набора, а лишние циклы лишь доводят их до кадра быстрее. Как переобучение выглядит на готовых снимках, разобрано отдельно: признаки переобученной модели.
Важна тут сама форма кривой. Расхождение с оригиналом падает быстро в первую тысячу шагов, потом медленнее, потом выходит на полку. Прирост сходства между двумя и тремя тысячами шагов заметен, между тремя и пятью почти нет, а вот заучивание фона растёт всё это время равномерно. Поэтому оптимум сидит не в конце кривой, а на её изгибе.
Отдельный довод в пользу фиксированного числа: время. Каждая тысяча шагов это минут десять-пятнадцать работы. Гнать до пяти тысяч ради процента сходства означает держать человека в ожидании вдвое дольше и получить взамен более капризную модель.
Как проверить, что шагов хватило
Графики потерь при обучении лица врут чаще, чем помогают. Кривая может красиво падать, а сходство при этом уже уехало, потому что сеть улучшает воспроизведение фона, а не черт. Смотреть надо на готовые кадры.
Проверка устроена так. Одна личная модель прогоняется несколькими запросами: у нас за один запрос приходит до четырёх кадров, поэтому на стиль из двенадцати идут три запроса с разными стартовыми числами. Дальше сравниваешь кадры между собой, а не с оригиналом.
- Черты держатся от кадра к кадру. Нос, посадка глаз и линия челюсти одинаковые на всех двенадцати. Гуляют между кадрами, значит шагов было мало.
- Сцена меняется свободно. Попросили улицу, получили улицу, а не серую стену из спальни. Стена лезет, значит шагов было много.
- Поворот головы слушается запроса. Недоученная модель охотно отдаёт фронтальный портрет и разваливает профиль, потому что боковую проекцию она толком не выучила.
- Одежда приходит запрошенная. Возврат толстовки из исходников это верхняя граница, а не нижняя.
Первые два пункта расходятся в разные стороны, и в этом вся суть подбора: нужна точка, где оба выполняются одновременно. Она и оказывается где-то возле 2 500 шагов на полутора десятках снимков. Насколько результат совпадёт с ожиданиями, отдельно разобрано в тексте про то, будешь ли ты похож на себя.
Как это устроено на a-dam.photo
Мы ставим 2 500 шагов и скорость 0,0001 на все профи-заказы, ползунка в кабинете нет. Это сознательное решение: подбирать шаги под каждый набор означает гонять обучение по нескольку раз и брать за это деньги.
Вместо настройки мы выравниваем вход. Перед стартом набор проходит автокроп по человеку, лишний фон срезается. Строятся маски по субъекту, чтобы модель училась на тебе, а не на комнате. Обучение идёт сразу в нескольких разрешениях, а не в одном, и на датасет вешается слово-ключ, которым потом вызывается именно твоё лицо. Тренер стоит специализированный под портрет.
Профи-фотосессия с обучением стоит 3 490 ₽ и даёт 60 фото в 5 стилях, вся процедура занимает около сорока минут. Если исходники подобраны неудачно и результат не устроил, есть повторное обучение на других снимках за 2 290 ₽. Быстрый режим без всякого обучения живёт в каталоге сцен: три селфи, пакеты от 490 ₽, лицо там держится четырьмя реальными снимками-образцами.
Чего число шагов не исправит
Шаги решают одну задачу: насколько глубоко сеть влезла в набор. Всё, что находится за пределами этой задачи, настройкой обучения не лечится.
- Плохой набор. Пять кадров с одного ракурса не превратятся в двадцать разных, сколько циклов по ним ни гоняй. Больше шагов на бедном наборе просто ускоряет заучивание.
- Разные периоды жизни в одной папке. Снимки с разницей в пять лет и десять килограммов модель усредняет, и на выходе получается лицо, которого у тебя не было никогда.
- Резкость и размер файла. Это работа апскейлера, а не обучения. Мы держим настоящий увеличитель разрешения, а не диффузионный: когда-то стоял второй, и он пересобирал лицо заново, после чего человек переставал быть похожим на себя.
- Композиция и свет в готовом кадре. За них отвечает промпт сцены и параметр guidance, стоящий у нас на 3,5.
Последнее ограничение честнее всего произнести вслух. Идеального числа шагов, одинаково хорошего для любого лица, не существует. Есть диапазон, в котором модель работает предсказуемо, и 2 500 при наборе из 15-20 портретов сидит в его середине с запасом в обе стороны.
Частые вопросы
Сколько шагов обучения нужно для модели лица?
Рабочая точка для набора из 15-20 портретов это 2 500 шагов при скорости обучения 0,0001. При таких настройках каждый снимок модель просматривает примерно 125-165 раз, и этого хватает, чтобы лицо держалось в любой сцене.
Что будет, если поставить шагов вдвое меньше?
Получится недообученная модель. Общий типаж совпадёт, а мелкая геометрия лица уплывёт: форма носа и разрез глаз будут меняться от кадра к кадру. Надёжный признак это когда сходство появляется только на максимальной силе адаптера.
Как число шагов связано со скоростью обучения?
Скорость задаёт величину одной правки, шаги задают их количество. Поднимешь скорость вдвое, шагов нужно вдвое меньше, но каждая правка становится грубее и модель легче проскакивает нужную точку. Поэтому 0,0001 берут как безопасную середину.
Нужно ли увеличивать шаги, если загрузил тридцать фото?
Да, иначе на каждый кадр придётся слишком мало просмотров и сходство просядет. Но тридцать снимков дают прирост только при реальном разнообразии ракурсов, а не при тридцати селфи из одной точки.
Обновлено: 24 сентября 2026
Готов попробовать?
Выбери сцены из каталога — более 900 вариантов. Первые кадры через пару минут после оплаты, от 490 ₽.
Выбрать сцены →Читать дальше
AI-фотосессия · 10 мин
AI-фотосессия для мужчин: что получается, а что нет
Мужская специфика AI-съёмки без рекламы: борода и лысина, врущая фигура, два режима работы и селфи, которые ломают модель.
AI-фотосессия · 7 мин
Сколько времени занимает AI-фотосессия: реальные сроки
Разбор по минутам: что успевает машина, что занимает твоё время и почему иногда выходит дольше обещанного.
AI-фотосессия · 8 мин
Сколько фото нужно для обучения нейросети: 15-20
Разбор по цифрам: что выходит из пяти кадров, что из десяти и почему двадцать однотипных хуже двенадцати разных.
AI-фотосессия · 8 мин
Что такое LoRA простыми словами: как нейросеть учит лицо
Базовая модель умеет рисовать человека вообще. LoRA это маленькая надстройка, которая учит её рисовать конкретно тебя.
AI-фотосессия · 8 мин
Как нейросеть учится на твоих фото: разбор по шагам
Весь путь от загруженной папки до готового портрета, по шагам и без магии.
AI-фотосессия · 7 мин
LoRA vs Stable Diffusion: чем отличаются и что лучше
LoRA — это «дообучение» поверх Stable Diffusion. Объясняем зачем разделение и почему для портрета без LoRA не получится.