Промты для генерации изображений: полное руководство по Midjourney и Stable Diffusion
Генерация изображений через нейросети — это не магия, а ремесло, которое можно освоить. В отличие от текстовых запросов, где важна смысловая нагрузка, визуальные промты требуют точного описания кадра: композиции, света, стиля и технических параметров. Midjourney и Stable Diffusion решают эту задачу по-разному, и понимание их сильных сторон — первый шаг к стабильно качественным результатам.
Чем промт для изображения отличается от текстового запроса
Когда мы просим ChatGPT написать статью, модель понимает контекст и логику. В генерации изображений всё иначе. Нейросеть не «думает» — она переводит ваши слова в визуальные паттерны. Чем конкретнее вы опишете сцену, тем точнее будет результат. Абстрактные формулировки вроде «красивая девушка» дадут размытый и непредсказуемый ответ.

Midjourney — это закрытая модель с мощной эстетической настройкой. Она выдаёт впечатляющие художественные работы «из коробки» и лучше всего подходит для иллюстраций, фэнтези и кинематографичных кадров. Stable Diffusion — открытая экосистема, которая даёт полный контроль: вы можете менять модели, дообучать их под свои задачи и тонко настраивать каждый параметр. SDXL — флагманская версия — использует в три раза более крупный UNet-бекбон, что обеспечивает высокое разрешение и детализацию.
Базовые компоненты промта: из чего складывается кадр
Любой качественный промт строится из пяти ключевых элементов. Пропуск хотя бы одного заметно снижает предсказуемость результата.
- Субъект — главный объект: человек, животное, предмет. Укажите пол, возраст, внешность, одежду.
- Действие — что происходит. Бежит, сидит, смотрит вдаль, держит предмет.
- Окружение — фон, локация, время суток. Город, лес, студия, рассвет, ночь.
- Стиль — художественное направление. Фотореализм, импрессионизм, киберпанк, акварель, аниме.
- Освещение и композиция — мягкий свет, контражур, крупный план, кинематографичный кадр, глубина резкости.
В Midjourney принято использовать плотное нагромождение описательных слов с запятыми, а не полноценные предложения. В Stable Diffusion — более развёрнутые описания, но тоже с чёткой структурой.
Структура промта для Midjourney: параметры и синтаксис
В Midjourney всё решают параметры в конце промта. Они начинаются с двух дефисов и управляют буквально каждым аспектом генерации.

Базовый шаблон выглядит так: [описание сцены] --ar 16:9 --v 7 --s 250 --no нежелательные_элементы. Параметры всегда идут в конце, после текстового описания.
Ключевые параметры V7:
- —ar (aspect ratio) — соотношение сторон. Только целые числа: 16:9, 9:16, 1:1, 4:5. По умолчанию 1:1.
- —v (version) — версия модели. На 2026 год V7 — текущая по умолчанию, V8.1 — самая быстрая и качественная.
- —s (stylize) — уровень стилизации. От 0 до 1000, по умолчанию 100. Чем выше, тем более художественный и менее буквальный результат.
- —c (chaos) — разнообразие между четырьмя вариантами. От 0 до 100. Выше — больше экспериментов.
- —no — что исключить из кадра. Например,
--no текст, watermark, искажённые руки. - —seed — фиксирует начальное состояние для воспроизводимости. Диапазон 0–4294967295.
- —iw (image weight) — влияние референс-изображения. От 0 до 3, по умолчанию 1.
- —draft — режим черновика (только V7). В 10 раз быстрее и вдвое дешевле.
Важное ограничение: V7 не поддерживает синтаксис :: для мульти-промтов, только --no для исключений.
Структура промта для Stable Diffusion (SDXL)
SDXL работает иначе. Здесь ключевое разделение — на positive prompt (что должно быть) и negative prompt (чего быть не должно). Это даёт гораздо более точный контроль.
Общая структура positive prompt: [качество/стиль] + [субъект + детали] + [сцена/фон] + [освещение] + [композиция]. Например: masterpiece, best quality, realistic, 1girl, black hair, red dress, standing in a garden, golden hour, soft bokeh, 8k, highly detailed.
Negative prompt — это отдельный блок, где перечисляют всё, что может испортить кадр: worst quality, low quality, jpeg artifacts, bad anatomy, bad hands, text, watermark, blurry, deformed. В SDXL negative prompt имеет высокий приоритет и эффективно отсекает нежелательные элементы.
Основные параметры SDXL:
- CFG Scale (guidance scale) — насколько модель следует промту. Рекомендуемый диапазон 5–7. Слишком высокое значение (выше 12) приводит к искажениям.
- Steps — количество шагов денойзинга. Оптимально 30–40 для SDXL.
- Seed — фиксирует начальный шум для воспроизводимости.
- Разрешение — для SDXL рекомендуется 1024×1024 или 1216×832.
Для продвинутого контроля используйте ControlNet — он позволяет задавать позы, композицию и даже глубину сцены через отдельные изображения-референсы.
Пошаговая инструкция: как создать промт с нуля
Вот рабочий алгоритм, который я использую сам. Он подходит и для Midjourney, и для SDXL — разница только в синтаксисе и параметрах.
- Шаг 1. Определите главный объект
Кто или что в центре? Опишите ключевые характеристики: пол, возраст, цвет волос, одежду, уникальные черты. Вместо «человек» пишите «стильная брюнетка в кожаной куртке». - Шаг 2. Опишите фон и окружение
Где происходит действие? Город, лес, студия, абстрактное пространство. Добавьте время суток и погоду: «рассвет в туманном лесу», «ночной неон-город». - Шаг 3. Выберите стиль и настроение
Фотореализм, импрессионизм, киберпанк, акварель, аниме. Добавьте эмоциональный окрас: «атмосфера роскоши», «меланхолия», «эпический пафос». - Шаг 4. Добавьте детали: освещение, текстуры, ракурс
Мягкий свет, контражур, крупный план, кинематографичный кадр, глубина резкости. Эти детали превращают посредственную картинку в профессиональную. - Шаг 5. Укажите технические параметры
В Midjourney —--ar 16:9 --v 7 --s 250. В SDXL — укажите resolution, CFG Scale и Steps. Добавьте negative prompt.
В Midjourney оптимальная длина промта — 30–60 токенов. Каждая запятая — это отдельный «эстетический слот», а полноценных предложений должно быть не больше одного-двух.
Примеры промтов для реальных задач
Разберём четыре сценария, которые покрывают 90% рабочих запросов.
Портрет
Стильная брюнетка в кожаной куртке на фоне дорогих бутиков в Милане, крупный план, эстетика уличной моды, золотой час, мягкий боке, кинематографичный кадр --ar 2:3 --v 7 --s 300 --no искажённые черты, размытие
Продуктовая съёмка
Матовый чёрный кейс для наушников на акриловой поверхности, медленный наезд, студийный свет, чистый фон, резкий фокус, 8k, минимализм --ar 1:1 --v 7 --s 50
Для SDXL добавьте negative: blurry, deformed, low quality, watermark, text, cheap plastic, dull lighting. Пейзаж
Олень, идущий по туманному лесу на рассвете, кинематографическая камера отслеживает сзади, золотой свет, глубина резкости, эпическая атмосфера --ar 16:9 --v 7 --s 200
Фэнтези
Волшебный ронин в доспехах, стоящий на фоне заката, аниме-стиль, 8k, динамичная поза, яркие цвета, детализированный фон --ar 16:9 --v 7 --s 400

Продвинутые техники: как сохранять персонажа в разных сценах
Одна из главных проблем в генерации — сохранить одного и того же персонажа в разных кадрах. В Midjourney и Stable Diffusion для этого есть разные инструменты.
В Midjourney V7 для этой задачи используется Omni Reference (—oref). Он заменяет старый Character Reference (—cref), который несовместим с V7. Добавьте ссылку на изображение персонажа в конце промта: --oref [URL] --ow 100. Параметр —ow (omni weight) регулирует силу сходства — от 1 до 1000, по умолчанию 100. Midjourney рекомендует не превышать 400, чтобы сохранить гибкость. Важно: Omni Reference работает только в V7 и стоит вдвое дороже обычной генерации.
В Stable Diffusion сохранение персонажа решается через IP-Adapter FaceID или LoRA. IP-Adapter извлекает черты лица из одного референсного фото и встраивает их в процесс генерации без необходимости дообучения. Рекомендуемые настройки: CFG 5–7, 28–35 шагов, вес IP-Adapter 0.70–0.85. LoRA требует предварительного обучения на 10–20 изображениях, но даёт более стабильный результат для персонажей, которые появляются в десятках сцен.
Типичные ошибки и как их исправить
Даже опытные пользователи допускают одни и те же ошибки. Вот три самые частые и способы их обойти.
- Ошибка 1. Слишком абстрактные описания
«Красивый пейзаж» — это приговор. Результат будет размытым и случайным. Всегда конкретизируйте: локацию, время суток, погоду, стиль. - Ошибка 2. Отсутствие negative prompt в SDXL
Без negative prompt вы получаете артефакты, искажённые руки, лишние объекты и текстуры. Всегда добавляйте блок с исключениями — это базовое правило работы с SDXL. - Ошибка 3. Неправильное соотношение сторон
Портрет в квадрате (1:1) — это неудачная композиция. Для портретов используйте 2:3 или 9:16, для пейзажей — 16:9 или 21:9. В Midjourney параметр--arпринимает только целые числа.
Заключение
Генерация изображений — это всегда баланс между описательной частью и техническими настройками. Слишком много деталей — и модель теряет фокус. Слишком мало — и результат становится случайным. Найдите свою золотую середину через эксперименты.
Добавить комментарий