В рамках этой статьи мы пропишем все необходимые настройки в веб-интерфейсе для выбранной модели Stable Diffusion (ReV Animated) и объясним, зачем каждая из настроек нужна и что обознает, чтобы вместо «магии шайтан-машины» вы получили внятное представление о том, как все работает.
До этого мы успели:
- Разобрать какие в принципе модели для генерации изображений локально на ПК можно запускать на картошках с 8 ГБ видеопамяти.
- Понять, чем отличается генерация фотореалистичных картинок и аниме-артов и почему второе не всегда проще.
- Скачать и установить самый простой веб-интерфейс Webui Forge и не накосячить с выбором диска.
- Зарегистрировать аккаунт на сайте Civitai Ai и выставить фильтры цензуры для поиска NSFW моделей и LoRA.
- Скачать выбранную модель Stable Diffusion (ReV Animated), VAE и прочее к ней и поместить в нужные папки внутри веб-интерфейса. И даже запустить его.
Базовые настройки: выбор модели
В строке Checkpoint выбираем скаченную до этого модель ReV Animated. Если скачали друге модели, у вас откроется список. Если аккуратно положили в папочку с припиской SD1.5 в списки будет видно какая модель к какой архитектуре относится и вы их не перепутаете. А то названия у них бывают похожи, все и не упомнишь.

Если модели в списке нет, нажмите на кнопку обновить и Forge еще раз просканирует папку с моделями. Это полезно, если вы закинули ее в папку, когда интерфейс уже был включен.
Версию сначала выберем ту, в которой VAE вшит по молчанию (не зряж е я ее качал). В этом случае в меню VAE ничего выбирать не надо.
У меня также стоит флажок в выборе типа модели на SD, чтобы отображались только совместимые с ней Лоры. Если у вас первый запуск, можно оставить и «all» (отображать все). Позже мы еще к этом меню вернемся.
Получится должно примерно так.

Clip Skip
Clip Skip — это настройка того, насколько глубоко и буквально нейросеть будет «вчитываться» в ваш промпт. Чтобы понять эту настройку, нужно на секунду заглянуть под капот нейросети. Там сидит специальный переводчик, который называется CLIP.
Когда вы пишете промпт 1girl, red hair, sitting, CLIP переводит эти человеческие слова на язык цифр, понятный рисовальному движку. Но делает он это не за одну секунду, а пропуская текст через 12 слоев восприятия (как через 12 фильтров).
Как работают эти слои:
Представьте игру в «Испорченный телефон», где каждый следующий игрок — всё более творческий художник:
- На 1-м слое нейросеть понимает слова буквально: «Девочка. Красные волосы. Сидит».
- На 6-м слое она добавляет концепты: «Подросток, рыжие оттенки, поза отдыха».
- На 12-м (последнем) слое текст превращается в сложную, абстрактную математическую кашу из стилей, освещения и глубоких ассоциаций.
Что делает ползунок Clip Skip
Он говорит переводчику: «Остановись на таком-то слое с конца и не иди дальше».
- Clip Skip 1: Не пропускать ничего. Пройти все 12 слоев до самого конца.
- Clip Skip 2: Пропустить 1 последний слой. Остановиться на 11-м.
- Clip Skip 3: Пропустить 2 последних слоя. Остановиться на 10-м. И так далее.
Какой Clip Skip выставить для SD 1.5
Здесь есть два золотых правила, которые зависят от стиля вашей модели:
- Для фотореализма и стандартных моделей: Всегда ставьте 1. Базовая модель SD 1.5 обучалась использовать все 12 слоев. Ей нужен финальный, самый сложный перевод.
- Для Аниме и 2.5D (Hassaku, ReV Animated): Почти всегда ставьте 2. Почему так? Исторически так сложилось, что создатели самой первой мощной аниме-базы (NovelAI), на которой потом построили все остальные аниме-модели, случайно или специально обрезали обучение на предпоследнем слое. Поэтому аниме-модели просто «не понимают» 12-й слой.
Для аниме и 2.5D (не реализма) идеальная остановка — шаг номер 2 (Clip Skip 2).
Что будет, если поставить неправильное значение:
- Если нужно 2, а вы поставили 1 (для аниме). Картинка не сломается полностью, но стиль может стать грязным. Цвета могут поблекнуть, линии станут менее четкими, а нейросеть начнет хуже вас слушаться, потому что вы кормите её данными с 12-го слоя, который она не умеет переваривать.
- Если поставить слишком много (3, 4, 5 и дальше). Нейросеть перестанет вас понимать. Ваш детальный промпт
beautiful girl with red hairна высоких значениях Clip Skip превратится для неё просто в концепт «какой-то человек». А если поставить Clip Skip 10 или 12 — она вообще перестанет видеть текст и начнет рисовать рандомный цветной шум или абстрактные пятна.
Запомните простую формулу: Реализм = 1, Аниме/Арт = 2. Больше вам этот ползунок трогать не придется.
Так как у нас аниме модель ставим 2.

CFG Scale в Stable Diffusion — это ползунок «послушания» нейросети. Он определяет, насколько строго программа должна следовать вашему текстовому промпту, а сколько свободы может оставить себе для творчества.
Аббревиатура расшифровывается как Classifier-Free Guidance. Чтобы понять, как это работает, давайте представим, что нейросеть — это художник, а вы — строгий заказчик. Когда вы пишете промпт beautiful girl in red dress, sunset, нейросеть генерирует две картинки одновременно (вы этого не видите):
- Одну — опираясь на ваш текст.
- Вторую — вообще без текста, просто случайный красивый шум. Как ей самой хочется. А затем она вычитает одно из другого.
Ползунок CFG Scale решает, с какой точностью надо следовать текстовому промту.
Какое значение ставить для SD 1.5 (у нас в данный момент)? Золотой стандарт — 7. Безопасный диапазон для экспериментов: от 5 до 9.
На значении 7 соблюдается идеальный баланс: нейросеть нарисует именно девушку, именно в красном платье и на закате, но сделает это красиво, соблюдая законы композиции, света и тени, которые она выучила.
Что будет, если поставить другие значения
Слишком мало (CFG от 1 до 4): «Художник вас не слушает»:
- Вы даете художнику список требований, а он говорит: «Я так вижу!» и рисует что-то свое. Нейросеть проигнорирует половину ваших слов (может забыть красное платье или закат). Картинка будет выглядеть очень мягкой, цвета могут быть блеклыми, но сама композиция получится максимально естественной (потому что нейросеть никто не заставлял впихивать невпихуемое).
Слишком много (CFG от 10 до 30): «Художник сошел с ума от стресса»:
- Вы кричите на художника: «НАРИСУЙ КАЖДОЕ СЛОВО, БЫСТРО!». Нейросеть начинает в панике вырисовывать каждый пиксель, чтобы он соответствовал тексту. Результат — «пережарка» (Deep-fried). Цвета становятся кислотными, контраст выкручивается до черноты, линии становятся резкими, появляются жуткие артефакты, а анатомия ломается на куски. Картинка выглядит так, будто её пропустили через 10 дешевых фильтров в Instagram.
Исключение: Когда мы обсуждали какие модели качать на Civitai, а какие нет, то в фильтрах выбора модели встречалось обозначение Lightning \ Турбо \ Hyper. Так вот, они работают по другой математике. Если вы используете их, стандартная «семерка» сожжет картинку. Для них CFG Scale нужно опускать до экстремальных значений — от 1.5 до 2.0.

Для обычной генерации (в ReV Animated, как у нас ): Ставьте 7.

Как пользоваться: Если картинка кажется чуть блеклой или нейросеть забыла какую-то деталь из промта — поднимите до 8 или 9. Если картинка начала «хрустеть» от резкости — опускайте до 5 или 6.
Sampling method и Schedule type
Это два главных инструмента, с помощью которых нейросеть «вырезает» нужную картинку из первоначального хаоса. Сэмплер (Метод) — это инструмент резчика (маленький молоточек или огромный отбойный молоток), а Расписание (Schedule) — это его график и способ работы.
В новом WebUI Forge их разделили на два окошка для удобства, хотя в старых гайдах вы часто встретите их слепленными в одно название (например,
DPM++ 2M Karras).
Давайте разберем на простой аналогии, как они работают.
Как вообще создается картинка
Нейросеть не рисует картинку мазками кисти. Она берет холст, полностью залитый цветным «телевизионным шумом» (пиксельной кашей), и за указанное количество шагов (Steps) постепенно стирает этот шум, пока не проявится нужное чистое изображение. Этот процесс называется денонсинг (denoising) — или говоря по русски «удаление шума«.
Sampling method (Метод сэмплирования / Сэмплер). Это математический алгоритм, который решает, как именно угадывать и стирать шум на каждом шаге. Представьте, что из глыбы мрамора нужно высечь статую:
- Euler a (Эйлер). Скульптор-импровизатор. Он работает быстро, размашисто. На каждом шаге он может немного передумать и изменить позу статуи. Дает мягкие, немного «креативные» результаты.
- DPM++ 2M. Скульптор-инженер. Он работает по четкому чертежу. Он не меняет композицию на ходу, работает быстро и очень точно прорабатывает мелкие детали.
- DPM++ SDE. Ювелир. Работает медленнее других (в два раза), но создает потрясающую текстуру кожи, мелкие волоски и сложные тени.
Schedule type (Тип расписания / Планировщик). Это график скорости, по которому удаляется шум от первого до последнего шага. Представьте, как скульптор распределяет свои силы за 20 часов (шагов) работы:
- Режим Automatic / Normal: Скульптор откалывает одинаковые куски мрамора каждый час. Спокойный, линейный процесс.
- Режим Karras: Гениальное изобретение инженера Теро Карраса. Скульптор в первые часы агрессивно откалывает огромные куски мрамора (формирует общую композицию), а последние 5-6 часов тратит на самую аккуратную полировку.
Для первых генераций выставим Sampling method (метод): DPM++ 2M и Schedule type (Расписание): Karras.

Это золотой стандарт сообщества. Он работает быстро, не выдает сюрпризов и сразу делает картинку четкой. Он сможет выдать отличный результат и на реалистичной модели, и на чистом аниме (Hassaku), и на 2.5D (ReV Animated).
Часто чем больше значение, тем лучше, но Stable Diffusion это правило не работает. Нейросеть начинает работу с чистого холста, который залит цветным «телевизионным шумом» (пиксельной кашей). Шаги (Steps) — это количество циклов очистки, за которые программа должна превратить этот шум в готовую картину. На каждом шаге нейросеть сверяется с вашим промтом, стирает часть шума и прорисовывает детали.
Сколько шагов надо для SD 1.5
Золотой стандарт: 20 – 30 шагов. Для метода
DPM++ 2M Karras, который мы выбрали идеальным для новичков, 20 шагов — это абсолютный идеал.
На 20-м шаге картинка уже на 99% готова. Она четкая, анатомически правильная (насколько это может SD 1.5) и с правильным светом. Шаги с 21 по 25 — это этап микро-полировки. Нейросеть может чуть-чуть изменить блик в глазу, добавить складочку на ткани или сделать тень на миллиметр резче.
Что будет, если поставить другие значения
- Если поставить слишком мало (от 1 до 10 шагов). Нейросеть просто не успеет очистить холст от стартового шума. В результате картинка будет выглядеть как размытое, мыльное пятно акварели. Лица будут перекошены, цвета — грязными, а в тенях останутся куски цветного «снега».
- Если поставить слишком много (от 40 до 150 шагов). «Синдром отличника» и частая ошибка новичка. После 30-го шага визуальная разница для глаза почти исчезает. Нейросеть начинает вырисовывать микроскопические поры на коже или лишние морщинки, которые вам даже не нужны.
Качество не улучшится и вы потратите 1 минуту на то, что можно было сделать за 15 секунд.
Правило «20 шагов» работает только для обычных моделей (типа ReV Animated). Если в будущем скачаете турбо-модели или модели с припиской Lightning / Hyper (о которых мы говорили ранее), то там нужно ставить ровно столько шагов, сколько просит автор (обычно это 4 или 8 шагов). На 20 шагах турбо-модель просто сожжет картинку.
Пока ставьте ползунок Steps на 20 и забудьте о нем. Это лучший баланс между качеством и скоростью работы. Больше — не значит лучше, больше — значит дольше.

Разрешение
Последняя настройка для Stable Diffusion, которую нам нужно сделать — задать рабочее разрешение. Автор модели ReV Animated прямо указал, что лучше всего работает при трёх разрешениях 512×512, 512×768 и 768×512. Почему именно такие и что будет, если выставить другое?
Если ошибиться с шагами (Steps) или сэмплером, вы просто получите не самую красивую картинку. Но если накосячить с разрешением в SD 1.5, то на выходе получите настоящих монстров из фильмов ужасов.
Базовая модель Stable Diffusion 1.5 обучалась на миллионах картинок, которые были жестко обрезаны под размер 512×512 пикселей. Это её «родное зрение». Она понимает, как уместить голову, туловище и ноги человека именно в эти рамки. Если вы сильно выйдете за эти границы, нейросеть просто сойдет с ума, так как она никогда не видела мир в других пропорциях.
Вам не нужно гадать с цифрами. Для SD 1.5 существует всего три безопасных стандарта:
- Квадрат (512 x 512). Можно использовать для аватарок, генерации предметов, иконок или просто быстрых тестов промта. Самый надежный формат, где реже всего ломается анатомия.
- Портрет (512 x 768). Самый популярный формат. Идеален для генерации людей, персонажей (в полный рост или по пояс) и аниме.
- Пейзаж / Альбом (768 x 512). Для красивых фонов, пейзажей, архитектуры или групповых сцен, где нужно показать окружение.
Стороны всегда должны быть кратны 8, поэтому мы используем именно 512 и 768, а не 500 и 750.
Что будет, если поставить другое
Это частая ошибка.
- Если поставить слишком мало (например, 256×256): Нейросети не хватит пикселей («холста»), чтобы прорисовать детали. Вы получите просто мыльное, абстрактное пятно из красок.
- Если поставить слишком много (например, 1024×1024 или больше): Начнутся мутации. Так как нейросеть умеет мыслить только блоками по 512×512, на огромном холсте 1024×1024 она попытается нарисовать четырех людей вместо одного, или слепить их вместе. У персонажей появятся по две головы, вытянутые тела-гусеницы, по 4 руки или 3 ноги. Лица будут дублироваться в случайных местах фона. Это классический «кошмар новичка».
Как же тогда получать большие и четкие картинки? Чтобы получить большую картинку в высоком качестве, мы никогда не ставим большое разрешение сразу. Мы сначала генерируем маленькую, правильную базу (512×768), а затем увеличиваем её в два раза с помощью специальной галочки Hires. fix (Апскейл). Об этом подробнее поговорим в отдельной статье.
Финальные настройки
В итоге, у нас должно получится следующее:
- Модель ReV Animated+VAE.
- Clip Skip: 2.
- Sampling method: DPM++ 2M и Schedule type: Karras.
- Sampling steps: 20.
- Разрешение: 512×768.
- CFG Scale: 7.

Чтобы потестить, вс ели мы сделали верно, пишем простой короткий позитивный промпт:
((best quality)), ((masterpiece)), (detailed), 1girl, cyberpunk city, rain
Негативный промт пока оставим пустым.
Жмём большую кнопку «Generate» и с пятой попытки получаем вот такую тяночку. Без всяких «уточнителей» и «улучшителей», которые мы навешаем в следующей статье. Лада в бомжатской «базовой» комплектации. Неплохо.

Вот оригинал со всеми настройками, которые можно подтянуть через PNG Info. Если вы пока не в курсе как это и что это, расскажу совсем скоро. Не переживайте.

Это результат работы самой маленькой и неприхотливой модели SD 1.5, которая запускается на самых древних картошках.
- Почему первые 4 попытки были хуже и это нормально?
- Почему получаются страшилища с перекошенными мордами?
- Что писать в негативные промпты?
- Как увеличить финальный размер изображения?
- Как добавить деталей?
Столько вопросов и так мало ответов. Займемся всем этим в следующих статьях:







