Промты для генерации изображений: полное руководство по Midjourney и Stable Diffusion

Генерация изображений через нейросети — это не магия, а ремесло, которое можно освоить. В отличие от текстовых запросов, где важна смысловая нагрузка, визуальные промты требуют точного описания кадра: композиции, света, стиля и технических параметров. Midjourney и Stable Diffusion решают эту задачу по-разному, и понимание их сильных сторон — первый шаг к стабильно качественным результатам.

Чем промт для изображения отличается от текстового запроса

Когда мы просим ChatGPT написать статью, модель понимает контекст и логику. В генерации изображений всё иначе. Нейросеть не «думает» — она переводит ваши слова в визуальные паттерны. Чем конкретнее вы опишете сцену, тем точнее будет результат. Абстрактные формулировки вроде «красивая девушка» дадут размытый и непредсказуемый ответ.

Чем промт для изображения отличается от текстового запроса

Midjourney — это закрытая модель с мощной эстетической настройкой. Она выдаёт впечатляющие художественные работы «из коробки» и лучше всего подходит для иллюстраций, фэнтези и кинематографичных кадров. Stable Diffusion — открытая экосистема, которая даёт полный контроль: вы можете менять модели, дообучать их под свои задачи и тонко настраивать каждый параметр. SDXL — флагманская версия — использует в три раза более крупный UNet-бекбон, что обеспечивает высокое разрешение и детализацию.

Базовые компоненты промта: из чего складывается кадр

Любой качественный промт строится из пяти ключевых элементов. Пропуск хотя бы одного заметно снижает предсказуемость результата.

  • Субъект — главный объект: человек, животное, предмет. Укажите пол, возраст, внешность, одежду.
  • Действие — что происходит. Бежит, сидит, смотрит вдаль, держит предмет.
  • Окружение — фон, локация, время суток. Город, лес, студия, рассвет, ночь.
  • Стиль — художественное направление. Фотореализм, импрессионизм, киберпанк, акварель, аниме.
  • Освещение и композиция — мягкий свет, контражур, крупный план, кинематографичный кадр, глубина резкости.

В Midjourney принято использовать плотное нагромождение описательных слов с запятыми, а не полноценные предложения. В Stable Diffusion — более развёрнутые описания, но тоже с чёткой структурой.

Структура промта для Midjourney: параметры и синтаксис

В Midjourney всё решают параметры в конце промта. Они начинаются с двух дефисов и управляют буквально каждым аспектом генерации.

Структура промта для Midjourney: параметры и синтаксис

Базовый шаблон выглядит так: [описание сцены] --ar 16:9 --v 7 --s 250 --no нежелательные_элементы. Параметры всегда идут в конце, после текстового описания.

Ключевые параметры V7:

  • —ar (aspect ratio) — соотношение сторон. Только целые числа: 16:9, 9:16, 1:1, 4:5. По умолчанию 1:1.
  • —v (version) — версия модели. На 2026 год V7 — текущая по умолчанию, V8.1 — самая быстрая и качественная.
  • —s (stylize) — уровень стилизации. От 0 до 1000, по умолчанию 100. Чем выше, тем более художественный и менее буквальный результат.
  • —c (chaos) — разнообразие между четырьмя вариантами. От 0 до 100. Выше — больше экспериментов.
  • —no — что исключить из кадра. Например, --no текст, watermark, искажённые руки.
  • —seed — фиксирует начальное состояние для воспроизводимости. Диапазон 0–4294967295.
  • —iw (image weight) — влияние референс-изображения. От 0 до 3, по умолчанию 1.
  • —draft — режим черновика (только V7). В 10 раз быстрее и вдвое дешевле.

Важное ограничение: V7 не поддерживает синтаксис :: для мульти-промтов, только --no для исключений.

Структура промта для Stable Diffusion (SDXL)

SDXL работает иначе. Здесь ключевое разделение — на positive prompt (что должно быть) и negative prompt (чего быть не должно). Это даёт гораздо более точный контроль.

Общая структура positive prompt: [качество/стиль] + [субъект + детали] + [сцена/фон] + [освещение] + [композиция]. Например: masterpiece, best quality, realistic, 1girl, black hair, red dress, standing in a garden, golden hour, soft bokeh, 8k, highly detailed.

Negative prompt — это отдельный блок, где перечисляют всё, что может испортить кадр: worst quality, low quality, jpeg artifacts, bad anatomy, bad hands, text, watermark, blurry, deformed. В SDXL negative prompt имеет высокий приоритет и эффективно отсекает нежелательные элементы.

Основные параметры SDXL:

  • CFG Scale (guidance scale) — насколько модель следует промту. Рекомендуемый диапазон 5–7. Слишком высокое значение (выше 12) приводит к искажениям.
  • Steps — количество шагов денойзинга. Оптимально 30–40 для SDXL.
  • Seed — фиксирует начальный шум для воспроизводимости.
  • Разрешение — для SDXL рекомендуется 1024×1024 или 1216×832.

Для продвинутого контроля используйте ControlNet — он позволяет задавать позы, композицию и даже глубину сцены через отдельные изображения-референсы.

Пошаговая инструкция: как создать промт с нуля

Вот рабочий алгоритм, который я использую сам. Он подходит и для Midjourney, и для SDXL — разница только в синтаксисе и параметрах.

  • Шаг 1. Определите главный объект
    Кто или что в центре? Опишите ключевые характеристики: пол, возраст, цвет волос, одежду, уникальные черты. Вместо «человек» пишите «стильная брюнетка в кожаной куртке».
  • Шаг 2. Опишите фон и окружение
    Где происходит действие? Город, лес, студия, абстрактное пространство. Добавьте время суток и погоду: «рассвет в туманном лесу», «ночной неон-город».
  • Шаг 3. Выберите стиль и настроение
    Фотореализм, импрессионизм, киберпанк, акварель, аниме. Добавьте эмоциональный окрас: «атмосфера роскоши», «меланхолия», «эпический пафос».
  • Шаг 4. Добавьте детали: освещение, текстуры, ракурс
    Мягкий свет, контражур, крупный план, кинематографичный кадр, глубина резкости. Эти детали превращают посредственную картинку в профессиональную.
  • Шаг 5. Укажите технические параметры
    В Midjourney — --ar 16:9 --v 7 --s 250. В SDXL — укажите resolution, CFG Scale и Steps. Добавьте negative prompt.

В Midjourney оптимальная длина промта — 30–60 токенов. Каждая запятая — это отдельный «эстетический слот», а полноценных предложений должно быть не больше одного-двух.

Примеры промтов для реальных задач

Разберём четыре сценария, которые покрывают 90% рабочих запросов.

Портрет

Стильная брюнетка в кожаной куртке на фоне дорогих бутиков в Милане, крупный план, эстетика уличной моды, золотой час, мягкий боке, кинематографичный кадр --ar 2:3 --v 7 --s 300 --no искажённые черты, размытие

Продуктовая съёмка

Матовый чёрный кейс для наушников на акриловой поверхности, медленный наезд, студийный свет, чистый фон, резкий фокус, 8k, минимализм --ar 1:1 --v 7 --s 50
Для SDXL добавьте negative: blurry, deformed, low quality, watermark, text, cheap plastic, dull lighting.

Пейзаж

Олень, идущий по туманному лесу на рассвете, кинематографическая камера отслеживает сзади, золотой свет, глубина резкости, эпическая атмосфера --ar 16:9 --v 7 --s 200

Фэнтези

Волшебный ронин в доспехах, стоящий на фоне заката, аниме-стиль, 8k, динамичная поза, яркие цвета, детализированный фон --ar 16:9 --v 7 --s 400

Примеры промтов для реальных задач

Продвинутые техники: как сохранять персонажа в разных сценах

Одна из главных проблем в генерации — сохранить одного и того же персонажа в разных кадрах. В Midjourney и Stable Diffusion для этого есть разные инструменты.

В Midjourney V7 для этой задачи используется Omni Reference (—oref). Он заменяет старый Character Reference (—cref), который несовместим с V7. Добавьте ссылку на изображение персонажа в конце промта: --oref [URL] --ow 100. Параметр —ow (omni weight) регулирует силу сходства — от 1 до 1000, по умолчанию 100. Midjourney рекомендует не превышать 400, чтобы сохранить гибкость. Важно: Omni Reference работает только в V7 и стоит вдвое дороже обычной генерации.

В Stable Diffusion сохранение персонажа решается через IP-Adapter FaceID или LoRA. IP-Adapter извлекает черты лица из одного референсного фото и встраивает их в процесс генерации без необходимости дообучения. Рекомендуемые настройки: CFG 5–7, 28–35 шагов, вес IP-Adapter 0.70–0.85. LoRA требует предварительного обучения на 10–20 изображениях, но даёт более стабильный результат для персонажей, которые появляются в десятках сцен.

Типичные ошибки и как их исправить

Даже опытные пользователи допускают одни и те же ошибки. Вот три самые частые и способы их обойти.

  • Ошибка 1. Слишком абстрактные описания
    «Красивый пейзаж» — это приговор. Результат будет размытым и случайным. Всегда конкретизируйте: локацию, время суток, погоду, стиль.
  • Ошибка 2. Отсутствие negative prompt в SDXL
    Без negative prompt вы получаете артефакты, искажённые руки, лишние объекты и текстуры. Всегда добавляйте блок с исключениями — это базовое правило работы с SDXL.
  • Ошибка 3. Неправильное соотношение сторон
    Портрет в квадрате (1:1) — это неудачная композиция. Для портретов используйте 2:3 или 9:16, для пейзажей — 16:9 или 21:9. В Midjourney параметр --ar принимает только целые числа.

Заключение

Генерация изображений — это всегда баланс между описательной частью и техническими настройками. Слишком много деталей — и модель теряет фокус. Слишком мало — и результат становится случайным. Найдите свою золотую середину через эксперименты.

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *