gpt-image-2
ConardLi/garden-skills
Создает и редактирует изображения с помощью GPT Image 2 в трёх режимах: прямое генерация через API, совместимый с OpenAI; разработка подсказок для встроенных в хост инструментов для работы с изображениями; или исключительно предоставление рекомендаций по подсказкам. Включает более 80 структурированных шаблонов для плакатов, макетов пользовательского интерфейса, визуальных элементов продуктов, карт, слайдов и многого другого.
...Расширить всеGPT Image 2
Это специализированный навык для GPT Image 2, который работает в 3 различных средах, но его поведение значительно различается. Первым делом необходимо определить текущий режим работы.
Он выполняет только две категории задач, связанных с изображениями:
- Генерация изображений:
POST /images/generations - Редактирование изображений:
POST /images/edits
В данном документе описаны: режим работы, структура навыка, переменные среды, правила сохранения и именования, индекс шаблонов, рабочий процесс с учетом режима. Подробные шаблоны находятся в папке references/ и организованы по уровням:
- Первый уровень: каталоги по категориям
- Второй уровень: файлы Markdown с отдельными шаблонами
Режим работы (обязательно к прочтению, определитесь с ним перед началом любой работы)
Этот Skill поставляется с лёгким скриптом проверки; сначала запустите его один раз, а затем, в зависимости от результатов, решите, как действовать:
node skills/ gpt-image-2/scripts/check-mode.js
# Если требуется структурированный результат для использования в вышестоящей программе:
node skills/ gpt-image-2/scripts/check-mode.js --json
В выводе будет указано mode = A / A? / B-or-C, а также рекомендация. Три режима определены следующим образом:
Режим A · Garden — локальное генерация изображений
Условия запуска: переменная среды ENABLE_GARDEN_IMAGEGEN имеет значение «true» ( 1 / true / yes / on ) и присутствует OPENAI_API_KEY.
Поведение: полный сквозной цикл «выбор шаблона → написание промпта → запуск скрипта → вывод изображения на диск».
- Используйте файл
scripts/generate.jsдля генерации изображений по тексту иscripts/edit.jsдля редактирования существующих изображений. - По умолчанию промпты сохраняются в папке
garden- gpt-image-2/prompt/, а изображения — в папкеgarden- gpt-image-2/image/. - Это самый мощный режим: вы являетесь «владельцем» инструмента для работы с изображениями.
Режим B · Host-Native: делегирование генерации изображений хосту
Условия срабатывания: Garden не включен ( ENABLE_GARDEN_IMAGEGEN не установлен / имеет значение «false»), но текущий хост-агент имеет собственный инструмент генерации изображений или MCP для работы с изображениями.
Типичные признаки (вам следует проверить):
- в вашем наборе инструментов присутствуют названия типа
image_generation/imagegen/dalle/nano_banana/mcp__*image*/make_imageи т. п. - Пользователь вызывает данный навык в клиентах, поддерживающих нативное создание изображений, таких как ChatGPT / Codex / Gemini / Cursor и т. д.
- Пользователь явно просит: «Создай изображение с помощью своего собственного инструмента»
Поведение: данный навык превращается в руководство по созданию подсказок —
- продолжайте следовать процессу «выбор шаблона → заполнение полей → рендеринг окончательного промпта».
- Не вызывайте
скрипты node/generate.js(нет API-ключа, вызов обязательно завершится сбоем). - Непосредственно вызывайте встроенные инструменты хоста для работы с изображениями, используя отрендеренный промпт в качестве входных данных.
- Если пользователь пожелает, можно сохранить файл промпта в
garden- gpt-image-2/prompt/, номестоположение изображения определяет хост, это не является обязательным.
Режим C · Advisor — консультант по промптам
Условия запуска: Garden не включен, и у хоста-агента нет никаких инструментов для генерации изображений.
Поведение: данный навык превращается в «консультанта по написанию высококачественных промтов» —
- следуя алгоритму «выбор шаблона → заполнение полей → формирование окончательного промпта», при недостатке информации запрашивая информацию у пользователя.
- Отображает окончательный промпт непосредственно пользователю + сохраняет копию в
garden- gpt-image-2/prompt/.- .md - Добавьте краткую рекомендацию «Как использовать» (например: «Вставьте в ChatGPT / Midjourney / DALL·E / Sora / Nano Banana / собственный бэкенд / сторонний шлюз GPT Image 2»).
- Не следует создавать видимость успешного создания изображения. Чётко сообщите пользователю: «Сгенерирован высококачественный промпт, готовый к непосредственному использованию. Пожалуйста, выполните его в вашем графическом редакторе».
Таблица решений по шаблонам
| Условия | Шаблон | Вызов скрипта? | Сохранить промпт на диск? | Создать изображение при выгрузке? |
|---|---|---|---|---|
ENABLE_GARDEN_IMAGEGEN=1 + есть ключ |
A | ✅ generate.js / edit.js |
✅ Автоматически | ✅ Автоматически |
ENABLE_GARDEN_IMAGEGEN=1, но KEY отсутствует |
A? | ❌ (сначала нужен KEY) | — | — |
| Не включено + на хосте есть инструмент для работы с изображениями | B | ❌ (использовать инструменты хоста) | Необязательно | Решение принимает хост |
| Не включено + на хосте нет инструментов для работы с изображениями | C | ❌ | ✅ Обязательно | ❌ (невозможно) |
Если режим неясен
- Если вы не можете определить, какой из режимов вы используете — B или C, просто спросите пользователя: «Создавать изображение с помощью графического инструмента в вашей среде или достаточно, если я напишу подсказку?»
- Режим A: сбой при запуске скрипта (401 / сеть / квота) → выдать сообщение об ошибке и спросить: «Переключиться на режим B / C?»
Пользователь указывает инструмент
Когда данному навыку необходимо задать вопрос пользователю, следуйте следующим правилам:
- Предпочтительно используйте инструменты ввода, предоставляемые текущей средой выполнения.
- Если соответствующего инструмента нет, задавайте вопросы в виде кратких текстовых вопросов с номерами.
- Если вопросы можно объединить, старайтесь задать их все за один раз.
Структура навыка
scripts/check-mode.js: запускается в первую очередь для определения режима работы (A / B / C)scripts/generate.js: генерация изображения из текста (используется только в режиме A)scripts/edit.js: редактирование изображения на основе исходного изображения / маски (используется только в режиме A)scripts/shared.js: логика обработки запросов на совместное использование, сохранения и чтения переменных окруженияreferences/: шаблоны многоуровневых структурированных подсказок (используются во всех трёх режимах: A / B / C)
Переменные среды
Конфигурация считывается в следующем порядке:
- Параметры CLI
process.env/.env /.gateway.env ~/.gateway.env
Основные переменные:
ENABLE_GARDEN_IMAGEGEN— переключатель режима. При значении1/true/yes/onвключается режим A; если значение не задано или установлено другое, запускается режим B / C.OPENAI_API_KEY— обязателен для режима A; не требуется для режимов B / C.OPENAI_BASE_URL— по умолчаниюhttps://api.openai.com/v1, может указывать на совместимый шлюз третьей стороны.OPENAI_IMAGE_MODEL— по умолчаниюgpt-image-2, можно заменить на модель, поддерживаемую шлюзом (например,gpt-image-1/dall-e-3).
По умолчанию реализация работает через интерфейс, совместимый с OpenAI, без жесткой привязки к какому-либо стороннему шлюзу.
Каталог вывода по умолчанию
Если пользователь явно не указал путь вывода, по умолчанию используется следующий путь в текущей рабочей области:
- Каталог подсказок:
garden- gpt-image-2/prompt/( рекомендуется использовать для всех трёх режимов — A, B и C — для удобства повторного использования и управления версиями) - Каталог изображений:
garden- gpt-image-2/image/( используется только в режиме A; в режиме B определяется хостом, в режиме C изображения не генерируются)
Если каталог отсутствует, скрипт (режим A) должен автоматически создать его; в режимах B и C перед написанием подсказки необходимо вручную выполнить команду ` mkdir -p `.
Правила именования по умолчанию
Если пользователь явно не указал имя файла, скрипт должен автоматически сгенерировать имя, связанное с текущей задачей, и добавить к нему текущую метку времени, чтобы избежать дублирования имен.
Правила именования:
- Подсказка:
garden- gpt-image-2/prompt/- .md - Изображения:
garden- gpt-image-2/image/- .png
При этом:
: автоматически извлекается одно из соответствующих коротких имен в соответствии с текущим запросом пользователя: текущая временная метка, например20260424-153045
Пример:
garden- gpt-image-2/prompt/live-commerce-ui-20260424-153045.mdgarden- gpt-image-2/image/live-commerce-ui-20260424-153045.pnggarden- gpt-image-2/prompt/vr-headset-exploded-view-20260424-153102.mdgarden- gpt-image-2/image/vr-headset-exploded-view-20260424-153102.png
Правила сохранения подсказок
| Режим | Обязательно ли сохранять prompt | Описание |
|---|---|---|
| Режим A | ✅ Обязательно | Перед началом фактического процесса генерации/редактирования необходимо сохранить на диск |
| Режим B | Рекомендуется | По умолчанию рекомендуется сохранять для удобства повторного использования; если пользователь скажет «не нужно», то этот шаг можно пропустить |
| Режим C | ✅ Обязательно | Пользователь должен скопировать prompt и выполнить его самостоятельно; если не сохранить на диск, это будет бесполезно |
Общие правила (применимы к всем трем режимам):
- Если пользователь явно указал путь к файлу prompt, этот файл можно использовать напрямую в качестве входных данных.
- Если пользователь напрямую предоставил текстовый prompt, окончательный prompt также необходимо сначала сохранить в папке
garden- gpt-image-2/prompt/. - Если пользователь явно указал параметр `--
prompt-output`,следуетиспользовать указанный им путь. - В противном случае файл автоматически сохраняется по правилам именования по умолчанию.
Правила сохранения изображений (только для режима A)
- Если пользователь явно указал параметр
--imageили--output, используетсяуказанный пользователем путь. - В противном случае файлы по умолчанию сохраняются в папке
garden- gpt-image-2/image/. - Имя файла должно быть связано с семантикой текущей задачи и содержать временную метку.
В режиме B способ сохранения определяется инструментом для работы с образами; в режиме C изображения не создаются.
Краткое руководство
0. Определение режима работы ( первый шаг любой задачи )
node skills/ gpt-image-2/scripts/check-mode.js
Вывод сообщит вам, в каком режиме вы находитесь (A / B / C), что определит, следует ли далее вызывать generate.js или edit.js. Пункты 1–4 ниже используются только в режиме A.
1. Создание изображения на основе текста (режим A)
node skills/ gpt-image-2/scripts/generate.js \
--prompt "A cute baby sea otter" \
--size 1024x1024 \
--quality high
2. Генерация изображений с использованием файла подсказок (режим A)
node skills/ gpt-image-2/scripts/generate.js \
--promptfile garden- gpt-image-2/prompt/poster-20260424-153045.md
3. Редактирование существующего изображения (режим A)
node skills/ gpt-image-2/scripts/edit.js \
--image assets/source.png \
--prompt "Заменить фон на чистую студийную сцену"
4. Локальное редактирование с использованием маски (режим A)
node skills/ gpt-image-2/scripts/edit.js \
--image assets/source.png \
--mask assets/mask.png \
--prompt "Заменить только замаскированную область стеклянной вазой"
5. «Использование» режимов B / C
Нет входа через командную строку — в данном случае этот Skill представляет собой лишь подсказку Руководство по разработке:
- Режим B: сгенерировать окончательный промпт → вызвать встроенный в хост инструмент типа
image_generation(передав промпт в качестве параметра) → получить изображение. - Режим C: сгенерировать окончательный промпт → сохранить в
garden- gpt-image-2/prompt/→ напрямую отобразить содержимое пользователю → подсказать пользователю, в каких инструментах для работы с изображениями его можно напрямую использовать.- .md
Принцип работы шаблонов JSON
Если в папке references/ имеются шаблоны JSON, используйте их в соответствии со следующими правилами:
- Сначала найдите в файле
SKILL.mdнаиболее подходящую категорию. - Затем найдите конкретный файл шаблона.
- В шаблоне
{argument ...}обозначает заменяемые параметры. - Значения, явно указанные пользователем, вводятся напрямую.
- Если пользователь не указал значение, но в шаблоне есть пометка
«default», сначала можно использовать значение по умолчанию. - Если отсутствие информации может существенно повлиять на результат, необходимо самостоятельно запросить её у пользователя.
- Пользователь также может явно сказать: «Сгенерируйте случайным образом», — в этом случае можно сохранить значения по умолчанию или провести разумную рандомизацию в пределах, допускаемых шаблоном.
Правила задавания вопросов
Если в шаблоне отсутствуют ключевые переменные, не задавайте общих вопросов типа «Какой стиль вы предпочитаете?». Вопросы должны быть сформулированы точно в соответствии с полями шаблона.
Например, если в шаблоне интерфейса прямой трансляции отсутствует информация об основном объекте, в первую очередь следует спросить:
- Кто будет вести прямой эфир?
- Использовать фотографию реального человека, имя знаменитости, описание персонажа или сгенерировать полностью случайным образом?
При отсутствии информации о товаре следует спросить:
- Как называется товар?
- Указана ли цена товара?
- Хотите, чтобы я автоматически дополнял содержание комментариев и подарков?
Индекс шаблонов
В зависимости от типа задачи следует считывать только наиболее подходящие конкретные файлы шаблонов, а не загружать сразу весь каталог references/.
1. Общий документ по методологии
Сначала прочитать:
references/prompt-writing.md
Применимо, если:
- вы ещё не определились, как построить JSON-шаблон
- Вам необходимо определить, о каких полях следует спрашивать, какие поля можно оставить по умолчанию, а какие могут быть случайными
- Вам нужно абстрагировать примеры в виде повторно используемых шаблонов
2. Макеты интерфейса ( references/ui-mockups/ )
Подходят для визуализации различных макетов типа «интерфейс + контент». В настоящее время реализованы:
live-commerce-ui.md— макет скриншота прямой трансляции с продажей товаров (ведущий + чат + раздел подарков + карточка товара)social-interface-mockup.md— макет страницы подробностей публикации в социальных сетях (Twitter/X, Xiaohongshu, Weibo, Threads и др.)product-card-overlay.md— главная картинка для целевой страницы или страницы с подробной информацией (персонаж + товар + преимущества + цена)chat-interface-scene.md— макет интерфейса чата/диалога (iMessage, WeChat, групповой чат, AI-помощник)short-video-cover-ui.md— обложка короткого видео / миниатюра прямой трансляции (YouTube, Douyin, Bilibili, трансляция VTuber)landing-page-case-study.md— макет интерфейса длинной страницы с кейсом SaaS/маркетинга в тёмной цветовой схеме (несколько разделов + прокрутка + карточки данных + призыв к действию)
3. Визуальные элементы продукта ( references/product-visuals/ )
Изображения, подходящие для «визуального акцента на продукте». В настоящее время реализовано:
exploded-view-poster.md— плакат с разборным видом продукта (основной элемент, расположенный вертикально + выноска + логотип вверху + зона бренда внизу)white-background-product.md— Главная фотография товара на чисто белом фоне для электронной коммерции (один товар / несколько ракурсов / минималистичные маркетинговые наложения)premium-studio-product.md— коммерческие фотографии товара, снятые в студии высокого уровня (атмосфера уровня журнальной рекламы)packaging-showcase.md— изображение подарочной коробки / упаковки (внешняя коробка + демонстрация содержимого)lifestyle-product-scene.md— Сцены с товарами в стиле «лайфстайл» (товар в реальной обстановке)ecommerce-marketing-board.md— Комплексная маркетинговая доска для китайского электронного коммерции (главное изображение + страница с подробностями + преимущества + инструкция по использованию + сценарии использования + комбинация кадров из рекламного ролика на одном изображении)
4. Карты ( references/maps/ )
Подходит для «визуальных элементов типа карт» (инфографика выделена в отдельную категорию 17). В настоящее время реализовано:
food-map.md— Рисованная карта городских ресторанов (пронумерованные точки + легенда + талисман)travel-route-map.md— Карта туристических маршрутов (многодневные поездки / однодневные прогулки по городу / маршруты на природе)illustrated-city-map.md— иллюстрированная карта города (достопримечательности + природные пейзажи + культурные элементы)store-distribution-map.md— карта распределения фирменных магазинов / зоны обслуживанияitinerary-day-trip-map.md— плакат с разделением однодневной экскурсии (слева — карта маршрута в стиле пергамента + справа — фэнтезийно-реалистичная карта, 5–7 точек строго выровнены)
5. Слайды и визуальные документы ( references/slides-and-visual-docs/ )
Визуальные документы, подходящие для принципа «одна страница — одна тема». В настоящее время реализованы:
dense-explainer-slides.md— слайды с плотным объяснением в стиле Irasutoya × Какуганpolicy-style-slide.md— слайд в стиле политических документов / правительственных объявлений / белых книгvisual-report-page.md— страница с кратким изложением бизнес-отчета / презентация для инвесторов / обзор годового отчетаeducational-diagram-slide.md— учебные схематические диаграммы (концепции / механизмы / разбивка процессов)
6. Плакаты и рекламные кампании ( references/poster-and-campaigns/ )
Подходит для «главного визуального образа бренда + кампании + баннеров + обложек журналов». В настоящее время реализовано:
brand-poster.md— Основной плакат бренда (продукт / персонаж / чисто текстовое послание)campaign-kv.md— Ключевой визуал кампании + система производных макетовbanner-hero.md— Героический баннер для веб-сайта / целевой страницы / приложения (горизонтальная композиция + призыв к действию)editorial-cover.md— обложка журнала / периодического издания / публикацииbiomimetic-concept-poster.md— концептуальный плакат по биомиметическому промышленному дизайну (природный прототип → эволюционная шкала → рендер главного изображения → технические чертежи с несколькими ракурсами)vintage-editorial-infographic.md— Ретро-архив / Редакционный инфографический плакат в стиле 1940-х (персонажи + формулы + временная шкала + модели, в стиле Bell Labs)character-catalog-poster.md— инфографический плакат с несколькими версиями одного персонажа (карточки серий «Знаки зодиака» / «Химические элементы» / «Династии» / «Личности»)lineup-comparison-poster.md— Инфографический плакат с сравнением линейки продуктов (более 30 SKU на одном изображении + легенда + шкала уровней)
7. Портреты и персонажи ( references/portraits-and-characters/ )
Подходит для «визуального представления персонажей». В настоящее время реализовано:
professional-portrait.md— профессиональные деловые портреты (LinkedIn / страница команды / иллюстрации для СМИ)founder-portrait.md— портреты основателей для СМИ (театральное освещение + место для заголовка)virtual-host.md— личная карточка VTuber / виртуального ведущего + превью стримаcharacter-sheet.md— комплексный набор характеристик персонажа (три вида + мимика + одежда + палитра цветов)pose-reference-sheet.md— справочная таблица поз N×N (различные позы одного персонажа: танец / бой / фитнес)
8. Сцены и иллюстрации ( references/scenes-and-illustrations/ )
Визуальные материалы в стиле иллюстраций, подходящие для передачи «атмосферы + сюжета + эмоций». В настоящее время реализовано:
healing-scene.md— Иллюстрации повседневных и сезонных сцен в стиле «исцеления»concept-scene.md— концептуальные масштабные сцены в кинематографическом стиле / ключевые изображения для IPpicture-book-scene.md— иллюстрации для детских книг / страниц иллюстрированных книг / праздничных открытокminimalist-mood-scene.md— минималистичные атмосферные изображения с пустым пространством / литературные обои
9. Рабочие процессы редактирования ( references/editing-workflows/ )
Подходит для задач по обработке изображений «на основе существующих изображений» (соответствует scripts/edit.js ). В настоящее время реализовано:
background-replacement.md— Замена фона (товары / портреты / пейзажи / студийные сцены)local-object-replacement.md— Замена отдельных объектов (с использованием масок или без)object-removal.md— удаление посторонних предметов / прохожих / проводов / дефектовproduct-retouching.md— точная ретушь товаров (блеск / этикетки / тени / дефекты)portrait-local-edit.md— Локальная корректировка портретов (причёска / одежда / макияж / аксессуары)
10. Аватары и профили ( references/avatars-and-profile/ )
Подходит для визуальных элементов категории «личный образ», таких как «стилизованные аватары / персонажи / сетки / наклейки / серии портретов». В настоящее время реализовано:
style-transfer-selfie.md— преобразование персонажа с эталонного изображения в любой стиль: косплей / готика / ретро-пленка / фотосессия айдола и т. д.character-grid-portrait.md— портреты одного персонажа в сетке n×n (разные профессии / выражения лица / эпохи / стили)themed-3d-icon.md— аватарки в стиле Kawaii 3D / Minecraft / реалистичного 3D в виде значков приложенийsticker-set.md— наборы стикеров / коллекции смайликов (отдельные элементы + контур + метки)cultural-portrait-series.md— Серия портретов по эпохам / мифологии / литературе / этнографии
11. Сюжетные доски и последовательности ( references/storyboards-and-sequences/ )
Подходит для визуальных элементов типа «нарративных последовательностей», таких как «многокадровые сюжеты / комиксы / схемы взаимосвязей / пошаговые инструкции». В настоящее время реализовано:
four-panel-comic.md— 4-кадровые комиксы / карикатуры / юмористические комиксы (вступление, развитие, кульминация, развязка + диалоговые пузыри)manga-spread-page.md— раскадровка комикса на одной странице / развороте (нерегулярная сетка + диалоги + внутренние монологи)anime-key-visual.md— ключевые визуалы аниме / обложки лайкей-романов / постеры по IPcharacter-relationship-diagram.md— плакат с диаграммой отношений персонажей (карточки + связующие линии + легенда)recipe-process-flowchart.md— Блок-схема рецепта / учебного руководства / рабочего процесса (нумерация + иллюстрации + пояснения)product-tvc-storyboard.md— раскадровка рекламного ролика продукта (9-панельная текстура реальной съемки + описание кадров + продолжительность)cinematic-storyboard-grid.md— Контактный лист кинематографического сториборда (3×4 / 4×4, непрерывный сюжет + кинематографические кадры)process-photo-board.md— Кинематографическая фото-табло с реальными людьми (одевание снаряжения / макияж / тренировка / пошаговая инструкция, нумерация + последовательность шагов)
12. Сетки и коллажи ( references/grids-and-collages/ )
Подходит для визуальных материалов типа «многопанельные сетки / коллажи / проектные доски». В настоящее время реализовано:
banner-grid-2x2.md— набор маркетинговых баннеров 2×2 (4 изображения из единой серии за один раз)lookbook-grid.md— 7-дневный лукбук / 9-клетчатая таблица по уходу за собой / список «ТОП N»mixed-style-multi-panel.md— смешанная многопанельная коллаж (различные художественные стили для одной темы)anime-pitch-board.md— питч-доска для аниме, игр и кинопроектов (ключевой визуал + персонажи + вселенная + тексты)ad-banner-multi-grid.md— Сетка рекламных баннеров для различных отраслей и тем (в каждой ячейке — отдельная отрасль, стиль и текст)
13. Брендинг и упаковка ( references/branding-and-packaging/ )
Подходит для визуальных материалов типа «система фирменного стиля / талисман / дизайн упаковки». В настоящее время реализовано:
brand-identity-board.md— доска системы фирменного стиля (логотип + цветовая палитра + шрифт + макеты применения)mascot-brand-kit.md— многопанельный набор фирменного стиля с талисманом (основной образ + три вида + эмоции + примеры применения)cosmetic-packaging.md— упаковка косметики / средств по уходу за кожей: отдельные флаконы / серии / подарочные наборыbeverage-label-design.md— Дизайн этикеток для напитков / продуктов питания / приправ (в стиле «Guochao» / японском / западном)full-mascot-brand-doc.md— Крупный набор фирменного стиля из 18+ модулей + полная документация по талисману (DNA / модборд / эскизы / линейные наброски / 3D / цветовая палитра / материалы / обзор применения на одной картинке)character-merch-board.md— Комплексная бренд-доска с персонажами IP + сопутствующие товары / упаковка / плакаты / профили в соцсетях
14. Типографика и верстка текста ( references/typography-and-text-layout/ )
Подходит для типографики, где текст является основным визуальным элементом, например, «текстовый приоритет» или «двуязычный макет». В настоящее время реализовано:
title-safe-poster.md— плакаты с крупным текстом (японский стиль с высокой энергетикой / швейцарский минимализм / ретро-печать)bilingual-layout-visual.md— визуальные решения для двуязычного макета (китайский-английский / китайский-японский) (культурные / академические / межкультурные бренды)
15. Ресурсы и реквизит ( references/assets-and-props/ )
Подходит для визуальных решений типа «наборы иконок / скриншоты игр» и других «комплектов материалов / игровых ресурсов». В настоящее время реализованы:
retro-skeuomorphic-icons.md— набор иконок в стиле скевоморфизма / Y2K / пиксельной графики (единый стиль всего набора)game-screenshot-mockup.md— макет скриншота из игры (HUD + титры + панель задач)
16. Академические иллюстрации ( references/academic-figures/ )
Иллюстрации, подходящие для «научных статей / материалов для ведущих конференций / академических постеров / презентаций для защиты диссертаций / защит диссертационных проектов / графических аннотаций для журнальных статей».В целом: белый фон + шрифты, используемые в публикациях + геометрическая точность + не насыщенные технические цвета (преимущественно темно-синий / серо-синий / черно-серый, не более 3 основных цветов) + возможность одноцветной печати. Строго запрещается выдумывать количественные данные (числовые значения / контурные линии / диапазоны цветовой шкалы / формулы).
Направления CS / CV / ML:
method-pipeline-overview.md— обзорная схема метода / рисунок конвейера (многоэтапные блоки + поток данных; вариант 4 предлагает техническую дорожную карту в виде трёхсекционного схемного изображения в стиле «слева/в центре/справа»)neural-network-architecture.md— схема архитектуры нейронной сети (блоки слоёв + форма тензора + переходы)qualitative-comparison-grid.md— таблица качественного сравнения нескольких методов ( строки = образцы, столбцы = методы )
Общие для инженерных наук / естественных наук / защиты диссертаций:
scientific-schematic.md— схема концепции / принципа / экспериментальной установки (высокая степень свободы, шаблон на естественном языке)mechanism-diagram.md— схема механизма / причинно-следственные связи / пути преобразования (центральный объект + многоэтапное преобразование + область результатов; включает три варианта: причинно-следственную цепочку из трёх звеньев, циклическую самоподдерживающуюся цепочку и конкуренцию с несколькими ветвями)multi-condition-comparison.md— диаграмма сравнения результатов для нескольких рабочих режимов / условий (параллельные результаты для одного и того же объекта при разных условиях, 2×2 / 1×N / M×N; особое внимание уделяется строгому единообразию между панелями)publication-chart.md— готовые к публикации диаграммы данных (столбчатые / линейные / точечные / тепловые карты / ящиковые)
Обзор / Резюме / Главная страница защиты:
graphical-abstract.md— графический абстракт для подачи в журнал (четыре варианта: горизонтальный 4-секционный / разворачивающийся по центру / квадратный / вертикальный)research-overview-poster.md— обзорная диаграмма исследования для презентации темы / защиты / отчёта (три уровня: верхний, средний, нижний + пять модулей; включает три варианта: с центральным расположением, с двумя колонками слева и справа, минималистичный)
Рекомендации по выбору: для статей по CS/CV/ML предпочтительны
варианты method-pipeline-overview+qualitative-comparison-grid; для статей в области инженерии / энергетики / химической инженерии / материаловедения предпочтительны вариант 4method-pipeline-overview+mechanism-diagram+multi-condition-comparison;для иллюстраций в аннотациях статей, подаваемых в журналы, используйте«графическое резюме»; для титульного слайда презентации на защите диссертации используйте«плакат с обзором исследования».
17. Инфографика ( references/infographics/ )
Подходит для «инфографики / научно-популярных материалов с высокой плотностью информации / рисованной инфографики / панелей KPI» и других «крупных изображений для визуализации информации». В настоящее время реализованы:
legend-heavy-infographic.md— научно-популярные материалы с высокой плотностью легенд / цепочки причинно-следственных связей / эволюционные схемы / анатомические схемы (двуязычные)hand-drawn-infographic.md— инфографика в стиле ручной рисовки (макарон / моранди / доска / крафт-бумага; шаблоны на естественном языке)bento-grid-infographic.md— модульная инфографика в стиле «бенто» (высокоплотное расположение многомодульных виджетов)comparison-infographic.md— инфографика с двоичным / многомерным сравнением (A vs B / тарифные планы / заблуждения vs правильные ответы)step-by-step-infographic.md— Пошаговая инструкция в формате инфографики (в стиле иллюстраций, тёплая атмосфера; не техническая блок-схема)kpi-dashboard-infographic.md— инфографика в стиле панели KPI (годовой обзор / Wrapped / бизнес-дашборд)
18. Технические диаграммы ( references/technical-diagrams/ )
Подходит для инженерных схем, таких как «системная архитектура / процессы / временные последовательности / автоматы состояний / ER-диаграммы / интеллект-карты / сетевая топология». Единый тёмный фоновый сетка + шрифт с фиксированной шириной + цветовая схема с кодировкой ролей; каждый шаблон имеет вариант в светлых тонах.
⚠️ Внимание: в этом каталоге генерируются растровые изображения в формате PNG,а не редактируемые SVG-файлы; если вам нужны редактируемые файлы, используйте mermaid / draw.io / excalidraw / Figma. В настоящее время реализованы:
system-architecture.md— схема системной архитектуры (фронтенд + бэкенд + БД + кэш + очередь + внешние компоненты)flowchart-decision.md— блок-схема / диаграмма принятия решений (семантика фигур BPMN + ветвления «Да/Нет»)sequence-diagram.md— диаграмма последовательности (участник + линия жизни + стрелки сообщений + полоса активации)state-machine.md— автомат состояний / диаграмма жизненного цикла (состояние + переход + условие / действие)er-diagram.md— ER-диаграмма / диаграмма модели данных (сущность + поле + PK/FK + отношения типа «лапка ворона»)mind-map-tech.md— интеллект-карта по технической тематике (центральный узел + радиальные ветви)network-topology.md— схема сетевой топологии (символы устройств + зоны / VPC + пропускная способность / обозначения протоколов)
Рабочий процесс с подсказками (с учетом шаблонов)
Независимо от A / B / C, первые 6 шагов являются общими; различие заключается только в том, как «создать диаграмму» на 7–8-м шагах.
- Запустите
check-mode.js, чтобы определить режим (A / B / C). - Определите, требуется ли создать новую диаграмму или изменить существующую.
- Определите, к какому каталогу шаблонов она относится (см. «Указатель шаблонов» ниже).
- Считывайте только соответствующий конкретный файл шаблона, не считывайте сразу весь каталог references/.
- Строго соблюдайте формат шаблонов: большинство шаблонов используют основной шаблон JSON (предпочтительный для структурированных задач), а некоторые шаблоны (например,
infographics/hand-drawn-infographic.md,academic-figures/scientific-schematic.mdи т. д.) используют смешанный формат «структурированный естественный язык + параметры», поскольку принудительное использование JSON ограничивает творческую свободу. - Сопоставьте ввод пользователя параметрам шаблона; при недостатке ключевой информации самостоятельно задавайте целенаправленные уточняющие вопросы.
На этом промпт готов. Далее следует разветвление по режимам:
7-A. Режим A: сохраните окончательный промпт в garden- gpt-image-2/prompt/, вызовите scripts/generate.js или scripts/edit.js; изображение будет сохранено в garden- gpt-image-2/image/.
7-B. Режим B: передайте окончательный промпт напрямую в вызываемый хост-инструмент для работы с изображениями;по необходимости сохраняет копию промпта в папке garden- gpt-image-2/prompt /.
7-C. Режим C: сохраняет окончательный промпт в папке garden- gpt-image-2/prompt/ и в файле промпт пользователю в диалоге, сопровождая его краткой рекомендацией «Как использовать / Рекомендуемые инструменты».
- По завершении задания сообщите пользователю одним предложением: какой режим сейчас активен, где находится промпт и где находятся изображения (если есть).
Важные ограничения
Общие:
- JSON в файле шаблона представляет собой шаблон структуры промпта, а не шаблон тела запроса API.
- Во всех трех режимах в конечном итоге в модель обработки изображений передается «оконвертированная строка промпта» — это может быть преобразованный JSON или структурированный абзац на естественном языке, который используется в соответствии с шаблоном.
- Если пользователь явно не требует этого, не копируйте «описание режима» из файла SKILL.md в окончательный промпт — это метаинформация, предназначенная для агента.
Применимо только к режиму A:
- Скрипт генерации использует JSON-тело
- Скрипт редактирования использует данные многочастной формы
- Ответ в первую очередь анализируется как
data[0].b64_json, но также поддерживается форматdata[0].url - Не вводите дополнительные специальные параметры запроса, если это явно не требуется исходным интерфейсом
Когда задавать вопросы
Задавайте вопросы только в том случае, если эта информация отсутствует и это существенно влияет на результат:
- Отсутствует цель промпта
- При редактировании изображения отсутствует исходное изображение
- Идентичность объекта или визуальный тип определяют направление результата
- Товар / цена / рекламный текст / текст интерфейса являются ключевыми компонентами изображения
- Пользователь одновременно сформулировал несколько противоречащих друг другу целей
В остальных случаях следует самостоятельно установить разумные значения по умолчанию и продолжать работу в соответствии с ними.
---
name: gpt-image-2
description: Generates and edits images using GPT Image 2 across three modes: direct generation via OpenAI-compatible API, prompt engineering for host-native image tools, or pure prompt advisory. Includes 80+ structured templates for posters, UI mockups, product visuals, maps, slides, and more.
---
# GPT Image 2
这是一个面向 GPT Image 2 的聚焦型技能,在 3 种运行环境下都能用,但行为差异显著。**第一步必须先确定当前运行模式**。
它只做两类图像任务:
- 生成图片:`POST /images/generations`
- 编辑图片:`POST /images/edits`
本文件保留:运行模式、技能结构、环境变量、保存 / 命名规则、模板索引、模式感知工作流。详细模板全部放在 `references/`,分层组织:
- 一级:分类目录
- 二级:单模板 Markdown 文件
## 运行模式(必读,做任何事之前先确定)
本 Skill 自带一个轻量探测脚本,先跑一次,再根据结果决定怎么干活:
```bash
node skills/gpt-image-2/scripts/check-mode.js
# 想拿结构化结果给上层程序用:
node skills/gpt-image-2/scripts/check-mode.js --json
```
输出会给出 `mode = A` / `A?` / `B-or-C` 以及 `recommendation`。三个模式定义如下:
### Mode A · Garden 本地生图
**触发条件**:环境变量 `ENABLE_GARDEN_IMAGEGEN` 为真(`1` / `true` / `yes` / `on`)**且** 存在 `OPENAI_API_KEY`。
**行为**:完整端到端跑通"选模板 → 写 prompt → 调用脚本 → 出图落盘"。
- 用 `scripts/generate.js` 文本生图、`scripts/edit.js` 编辑现有图。
- prompt 默认落盘到 `garden-gpt-image-2/prompt/`、图片落盘到 `garden-gpt-image-2/image/`。
- 这是最强的模式:你是图像工具的"持有者"。
### Mode B · Host-Native 委托宿主出图
**触发条件**:未启用 Garden(`ENABLE_GARDEN_IMAGEGEN` 未设置 / 为假),但**当前宿主 Agent 自带图像生成工具或图像 MCP**。
**典型识别信号**(你应该自检):
- 你的工具集里出现 `image_generation` / `imagegen` / `dalle` / `nano_banana` / `mcp__*image*` / `make_image` / 类似名字
- 用户在 ChatGPT / Codex / Gemini / Cursor 等支持原生出图的客户端中调用本 Skill
- 用户显式说"用你自己的工具出图"
**行为**:本 Skill **退化成提示词工程指引**——
1. 仍按"选模板 → 填字段 → 渲染最终 prompt"的流程走。
2. **不要调用 `node scripts/generate.js`**(没有 API key、必失败)。
3. 直接调用宿主自带的图像工具,把渲染好的 prompt 作为输入。
4. 如用户希望可顺手把 prompt 文件保存到 `garden-gpt-image-2/prompt/`,但图片去向由宿主决定,不强制。
### Mode C · Advisor 纯提示词顾问
**触发条件**:未启用 Garden,**且**宿主 Agent 也没有任何图像生成工具。
**行为**:本 Skill 退化为"高质量 prompt 撰写顾问"——
1. 按"选模板 → 填字段 → 渲染最终 prompt"流程走,缺信息就问用户。
2. 把最终 prompt **直接打印给用户** + 保存一份到 `garden-gpt-image-2/prompt/<task-slug>-<timestamp>.md`。
3. 附一句简短的"如何使用"建议(如:丢进 ChatGPT / Midjourney / DALL·E / Sora / Nano Banana / 自己后端 / 第三方 GPT Image 2 网关)。
4. **不要假装出图成功**。明确告知用户:"已生成可直接复用的高质量 prompt,请用你的图像工具执行。"
### 模式决策表
| 条件 | 模式 | 调用脚本? | 落盘 prompt? | 落盘图片? |
|---|---|---|---|---|
| `ENABLE_GARDEN_IMAGEGEN=1` + 有 KEY | **A** | ✅ `generate.js` / `edit.js` | ✅ 自动 | ✅ 自动 |
| `ENABLE_GARDEN_IMAGEGEN=1` 但没 KEY | A? | ❌(先要 KEY) | — | — |
| 未启用 + 宿主有图像工具 | **B** | ❌(用宿主工具) | 可选 | 由宿主决定 |
| 未启用 + 宿主无图像工具 | **C** | ❌ | ✅ 必须 | ❌(无法) |
### 模式不确定时
- 如果你判断不清自己是 B 还是 C,**直接问用户一句**:"是用你环境里的图像工具出图,还是只要我写好提示词?"
- Mode A 调脚本失败(401 / 网络 / 配额)→ 报错并询问"切到 B / C 吗?"
## 用户输入工具
当此技能需要向用户提问时,遵循以下规则:
1. 优先使用当前运行时提供的用户输入工具。
2. 如果没有对应工具,则用简短的纯文本编号问题提问。
3. 能合并的问题尽量一次问完。
## 技能结构
- `scripts/check-mode.js`:**先跑这个**,检测运行模式(A / B / C)
- `scripts/generate.js`:文本生图(仅 Mode A 使用)
- `scripts/edit.js`:基于原图 / 遮罩改图(仅 Mode A 使用)
- `scripts/shared.js`:共享请求、保存、环境变量读取逻辑
- `references/`:分层结构化提示词模板(A / B / C 三模式都用)
## 环境变量
按以下顺序读取配置:
1. CLI 参数
2. `process.env`
3. `<cwd>/.env`
4. `<cwd>/.gateway.env`
5. `~/.gateway.env`
核心变量:
- `ENABLE_GARDEN_IMAGEGEN` — **模式开关**。`1` / `true` / `yes` / `on` 时启用 Mode A;未设置或其它值则进入 Mode B / C。
- `OPENAI_API_KEY` — Mode A 必需;B / C 不需要。
- `OPENAI_BASE_URL` — 默认 `https://api.openai.com/v1`,可指向第三方兼容网关。
- `OPENAI_IMAGE_MODEL` — 默认 `gpt-image-2`,可换成网关支持的型号(如 `gpt-image-1` / `dall-e-3`)。
默认实现按 OpenAI 兼容接口工作,不写死任何第三方网关。
## 默认输出目录
如果用户没有明确指定输出路径,统一使用当前工作区下的:
- 提示词目录:`garden-gpt-image-2/prompt/`(**A / B / C 三种模式都建议用**,方便复用与版本管理)
- 图片目录:`garden-gpt-image-2/image/`(**仅 Mode A 使用**;Mode B 由宿主决定,Mode C 不产生图)
如果目录不存在,脚本(Mode A)必须自动创建;Mode B / C 在写 prompt 前手动 `mkdir -p`。
## 默认命名规则
如果用户没有明确指定文件名,脚本应自动生成与当前任务相关的文件名,并追加当前时间戳,避免重名。
命名规则:
- 提示词:`garden-gpt-image-2/prompt/<task-slug>-<timestamp>.md`
- 图片:`garden-gpt-image-2/image/<task-slug>-<timestamp>.png`
其中:
- `<task-slug>`:根据当前用户要求自动提取一个相关短名称
- `<timestamp>`:当前时间戳,例如 `20260424-153045`
示例:
- `garden-gpt-image-2/prompt/live-commerce-ui-20260424-153045.md`
- `garden-gpt-image-2/image/live-commerce-ui-20260424-153045.png`
- `garden-gpt-image-2/prompt/vr-headset-exploded-view-20260424-153102.md`
- `garden-gpt-image-2/image/vr-headset-exploded-view-20260424-153102.png`
## Prompt 保存规则
| 模式 | 是否必须保存 prompt | 说明 |
|---|---|---|
| Mode A | ✅ 必须 | 进入实际生成 / 编辑流程必落盘 |
| Mode B | 推荐 | 默认建议保存方便复用;用户说"不用"就略过 |
| Mode C | ✅ 必须 | 用户拿走 prompt 自己执行,不落盘等于白干 |
通用规则(适用三种模式):
1. 如果用户显式给了 prompt 文件路径,可直接使用该文件作为输入。
2. 如果用户直接给的是文本 prompt,也要先把最终 prompt 保存到 `garden-gpt-image-2/prompt/`。
3. 如果用户显式指定了 `--prompt-output`,则尊重用户指定路径。
4. 否则使用默认命名规则自动保存。
## 图片保存规则(仅 Mode A)
1. 如果用户显式指定了 `--image` 或 `--output`,则尊重用户指定路径。
2. 否则默认保存到 `garden-gpt-image-2/image/`。
3. 文件名应和当前任务语义相关,并附加时间戳。
Mode B 由宿主图像工具决定保存方式;Mode C 不产生图片。
## 快速用法
### 0. 检测运行模式(**任何任务的第一步**)
```bash
node skills/gpt-image-2/scripts/check-mode.js
```
输出会告诉你当前是 Mode A / B / C,决定后续是否调用 `generate.js` / `edit.js`。下面 1~4 仅在 **Mode A** 下使用。
### 1. 文本生图(Mode A)
```bash
node skills/gpt-image-2/scripts/generate.js \
--prompt "A cute baby sea otter" \
--size 1024x1024 \
--quality high
```
### 2. 用提示词文件生图(Mode A)
```bash
node skills/gpt-image-2/scripts/generate.js \
--promptfile garden-gpt-image-2/prompt/poster-20260424-153045.md
```
### 3. 编辑已有图片(Mode A)
```bash
node skills/gpt-image-2/scripts/edit.js \
--image assets/source.png \
--prompt "Replace the background with a clean studio scene"
```
### 4. 带遮罩的局部编辑(Mode A)
```bash
node skills/gpt-image-2/scripts/edit.js \
--image assets/source.png \
--mask assets/mask.png \
--prompt "Replace only the masked area with a glass vase"
```
### 5. Mode B / C 的"用法"
没有命令行入口——本 Skill 此时只是**提示词工程指南**:
- **Mode B**:渲染好最终 prompt → 调用宿主自带的 `image_generation` 类工具(参数中传入 prompt)→ 拿到图。
- **Mode C**:渲染好最终 prompt → 保存到 `garden-gpt-image-2/prompt/<task-slug>-<timestamp>.md` → 把内容直接展示给用户 → 提示用户在哪些图像工具中可以直接复用。
## JSON 模板工作方式
当 `references/` 中提供 JSON 模板时,按下面规则使用:
1. 先从 `SKILL.md` 找到最贴近的分类目录。
2. 再定位到具体模板文件。
3. 模板中的 `{argument ...}` 表示可替换参数。
4. 用户明确提供的值,直接填入。
5. 用户没有提供,但模板标了 `default` 的,默认可以先用默认值。
6. 如果缺失信息会显著影响结果,主动询问用户。
7. 用户也可以明确说“你随机生成”,这时可以保留默认值或在模板允许范围内合理随机化。
## 询问规则
当模板缺少关键变量时,不要笼统地问“你想要什么风格?”。应当根据模板字段精确提问。
例如直播 UI 模板缺少主体时,应优先问:
- 主播是谁?
- 用真人照片、名人名字、人物描述,还是完全随机生成?
缺少商品信息时应问:
- 商品名称是什么?
- 商品价格是否指定?
- 是否希望我自动补全评论和礼物内容?
## 模板索引
按任务类型只读取最贴近的具体模板文件,不要一次性全读整个 `references/`。
### 1. 方法论总文档
先读:
- `references/prompt-writing.md`
适用于:
- 你还没决定怎么构造 JSON 模板
- 你需要判断哪些字段该问、哪些字段可默认、哪些字段可随机
- 你需要把案例抽象成可复用模板
### 2. UI Mockups (`references/ui-mockups/`)
适合各种“界面 + 内容”的样机视觉。当前已落地:
- `live-commerce-ui.md` — 电商直播带货截图样机(主播 + 聊天区 + 礼物区 + 商品卡)
- `social-interface-mockup.md` — 社交平台动态详情页样机(Twitter/X、小红书、微博、Threads 等)
- `product-card-overlay.md` — 落地页 hero / 详情页主图(人物 + 商品 + 卖点 + 价格)
- `chat-interface-scene.md` — 聊天 / 对话界面样机(iMessage、微信、群聊、AI 助手)
- `short-video-cover-ui.md` — 短视频封面 / 直播缩略图(YouTube、抖音、B 站、VTuber stream)
- `landing-page-case-study.md` — 深色 SaaS / 营销 case study **长页面** UI mockup(多 section + 滚动叙事 + 数据卡 + CTA)
### 3. Product Visuals (`references/product-visuals/`)
适合“以商品为视觉中心”的图。当前已落地:
- `exploded-view-poster.md` — 产品爆炸视图海报(主体垂直堆叠 + callout + 顶部 logo + 底部品牌区)
- `white-background-product.md` — 电商纯白底主图(单品 / 多角度 / 极简营销叠层)
- `premium-studio-product.md` — 高级影棚商业产品图(杂志广告级氛围)
- `packaging-showcase.md` — 礼盒 / 包装展示图(外盒 + 内容物展示)
- `lifestyle-product-scene.md` — 生活方式产品场景图(商品出现在真实场景中)
- `ecommerce-marketing-board.md` — 中式电商超复合销售看板(主图 + 详情页 + 卖点 + 使用步骤 + 场景 + TVC 分镜组合一图)
### 4. Maps (`references/maps/`)
适合“地图类视觉”(信息图已抽离到独立分类 17)。当前已落地:
- `food-map.md` — 城市美食手绘地图(编号点位 + 图例 + 中心吉祥物)
- `travel-route-map.md` — 旅行路线图(多日行程 / 单日 city walk / 户外路线)
- `illustrated-city-map.md` — 城市风貌插画地图(地标 + 江山 + 文化元素)
- `store-distribution-map.md` — 品牌门店 / 服务覆盖分布图
- `itinerary-day-trip-map.md` — **一日游** split 海报(左 parchment 行程卡 + 右奇幻写实地图,5-7 站点严格对齐)
### 5. Slides & Visual Docs (`references/slides-and-visual-docs/`)
适合“一页讲清楚一件事”的视觉文档。当前已落地:
- `dense-explainer-slides.md` — Irasutoya × 霞关混合高密度讲解 Slide
- `policy-style-slide.md` — 政策 / 政府公告 / 白皮书风格说明 Slide
- `visual-report-page.md` — 商业报告执行摘要 / 投资人简报 / 年报概览页
- `educational-diagram-slide.md` — 教学示意图(概念 / 机制 / 流程分解)
### 6. Poster & Campaigns (`references/poster-and-campaigns/`)
适合“品牌主视觉 + campaign + banner + 杂志封面”。当前已落地:
- `brand-poster.md` — 品牌主海报(产品 / 人物 / 纯文字主张)
- `campaign-kv.md` — Campaign Key Visual + 衍生 layout 系统
- `banner-hero.md` — Web hero / 落地页 / app banner(横向构图 + CTA)
- `editorial-cover.md` — 杂志 / 期刊 / 出版物封面
- `biomimetic-concept-poster.md` — 仿生工业设计概念海报(自然原型 → 演化条 → hero render → 多视图技术图)
- `vintage-editorial-infographic.md` — 复古档案 / 1940s 编辑式信息图海报(人物 + 公式 + 时间轴 + 模型,Bell Labs 风)
- `character-catalog-poster.md` — 同一角色多版本信息图海报(星座 / 元素 / 朝代 / 人格系列卡片)
- `lineup-comparison-poster.md` — 系列产品 lineup 对比信息图海报(30+ SKU 同图 + 图例 + 等级 key)
### 7. Portraits & Characters (`references/portraits-and-characters/`)
适合“人物视觉”。当前已落地:
- `professional-portrait.md` — 职业级商务肖像(LinkedIn / 团队页 / 媒体配图)
- `founder-portrait.md` — 创始人媒体大片肖像(戏剧灯光 + 留标题位)
- `virtual-host.md` — VTuber / 虚拟主播个人卡 + 直播预览
- `character-sheet.md` — 角色综合设定稿(三视图 + 表情 + 服装 + 配色板)
- `pose-reference-sheet.md` — N×N 姿势 / 动作字典参考表(同一角色多姿势,舞蹈 / 战斗 / 健身)
### 8. Scenes & Illustrations (`references/scenes-and-illustrations/`)
适合 “氛围 + 故事 + 情绪” 的插画类视觉。当前已落地:
- `healing-scene.md` — 治愈系日常 / 季节场景插画
- `concept-scene.md` — 电影感概念大场景 / IP key art
- `picture-book-scene.md` — 童书 / 绘本内页 / 节日卡片
- `minimalist-mood-scene.md` — 极简留白氛围图 / 文学性壁纸
### 9. Editing Workflows (`references/editing-workflows/`)
适合“基于现有图片做编辑”的图改任务(对应 `scripts/edit.js`)。当前已落地:
- `background-replacement.md` — 背景替换(商品 / 人像 / 户外 / 棚景)
- `local-object-replacement.md` — 局部对象替换(配合或不配合蒙版)
- `object-removal.md` — 杂物 / 路人 / 电线 / 瑕疵去除
- `product-retouching.md` — 产品精修(光泽 / 标签 / 阴影 / 瑕疵)
- `portrait-local-edit.md` — 人像局部修改(发型 / 服装 / 妆容 / 配饰)
### 10. Avatars & Profile (`references/avatars-and-profile/`)
适合“风格化头像 / 人设 / 网格 / 贴纸 / 系列肖像”等"个人形象"类视觉。当前已落地:
- `style-transfer-selfie.md` — 把参考图人物转成 cosplay / 哥特 / 复古胶片 / 偶像写真等任意风格
- `character-grid-portrait.md` — 同一角色 n×n 网格肖像(多职业 / 多表情 / 多朝代 / 多风格)
- `themed-3d-icon.md` — Kawaii 3D / Minecraft / 拟物 3D 应用图标式头像
- `sticker-set.md` — 贴纸套装 / 表情包合集(独立元素 + 描边 + 标签)
- `cultural-portrait-series.md` — 朝代 / 神话 / 文学 / 民族系列肖像
### 11. Storyboards & Sequences (`references/storyboards-and-sequences/`)
适合“多分镜 / 漫画 / 关系图 / 流程步骤”等"叙事性序列"类视觉。当前已落地:
- `four-panel-comic.md` — 4 格漫画 / 讽刺漫画 / 段子漫画(起承转合 + 对话气泡)
- `manga-spread-page.md` — 单页 / 跨页漫画分镜(不规则格子 + 对话 + 心声)
- `anime-key-visual.md` — 单图动漫 KV / 轻小说封面 / IP 海报
- `character-relationship-diagram.md` — 角色关系图海报(卡片 + 关系连线 + 图例)
- `recipe-process-flowchart.md` — 食谱 / 教程 / 流程步骤图(编号 + 插图 + 说明)
- `product-tvc-storyboard.md` — 产品 TVC 商业广告分镜板(9-panel 实拍质感 + 镜头描述 + 时长)
- `cinematic-storyboard-grid.md` — **电影感叙事分镜** contact sheet(3×4 / 4×4,连续叙事 + cinematic still)
- `process-photo-board.md` — 真人 cinematic 流程板(装备穿戴 / 化妆 / 训练 / 操作分解,编号 + 步骤递进)
### 12. Grids & Collages (`references/grids-and-collages/`)
适合“多面板网格 / 拼贴 / 立项 board”类视觉。当前已落地:
- `banner-grid-2x2.md` — 2×2 营销 banner 套装(一次出 4 张统一系列设计)
- `lookbook-grid.md` — 7 日 lookbook / 9 宫 self-care / TOP N 清单图
- `mixed-style-multi-panel.md` — 多风格混合拼贴(同一主体不同画风演绎)
- `anime-pitch-board.md` — 动漫 / 游戏 / 影视立项 pitch board(KV + 角色 + 世界观 + 文案)
- `ad-banner-multi-grid.md` — 多行业 / 多主题混合广告 banner 网格(每格独立行业 + 风格 + 文案)
### 13. Branding & Packaging (`references/branding-and-packaging/`)
适合“品牌识别系统 / 吉祥物 / 包装设计”类视觉。当前已落地:
- `brand-identity-board.md` — 品牌识别系统板(logo + 配色 + 字体 + 应用 mockup)
- `mascot-brand-kit.md` — 吉祥物多面板品牌识别套装(主形象 + 三视图 + 表情 + 应用)
- `cosmetic-packaging.md` — 化妆品 / 护肤品 单瓶 / 系列 / 礼盒包装
- `beverage-label-design.md` — 饮料 / 食品 / 调味品标签设计(国潮 / 日式 / 西式)
- `full-mascot-brand-doc.md` — **18+ 模块大型品牌识别 + 吉祥物全流程文档**(DNA / moodboard / 草图 / 线稿 / 3D / 配色 / 材质 / 应用一图概览)
- `character-merch-board.md` — IP 角色 + 周边 / 包装 / 海报 / 社交 profile 多元素综合品牌板
### 14. Typography & Text Layout (`references/typography-and-text-layout/`)
适合“字面优先 / 双语版式”等"以文字为主视觉"的类型。当前已落地:
- `title-safe-poster.md` — 大字主张型海报(日式高能量 / 瑞士极简 / 复古印刷)
- `bilingual-layout-visual.md` — 中英 / 中日双语版式视觉(文化 / 学术 / 跨文化品牌)
### 15. Assets & Props (`references/assets-and-props/`)
适合“图标集 / 游戏截图”等"成套素材 / 游戏资产"类视觉。当前已落地:
- `retro-skeuomorphic-icons.md` — 拟物 / Y2K / 像素 图标集(成套统一风格)
- `game-screenshot-mockup.md` — 游戏内截图 mockup(HUD + 字幕 + 任务面板)
### 16. Academic Figures (`references/academic-figures/`)
适合“论文 / 顶会投稿 / 学术海报 / 答辩 PPT / 开题答辩 / 期刊投稿 Graphical Abstract”的配图。整体偏白底 + 出版物字体 + 几何精确 + 低饱和工程色(深蓝 / 灰蓝 / 黑灰为主,≤3 主色)+ 可单色印刷。**严格禁止虚构定量数据**(数值 / 等值线 / 色标范围 / 公式)。
CS / CV / ML 方向:
- `method-pipeline-overview.md` — 方法总览图 / pipeline figure(多 stage 块 + 数据流;变体 4 提供工程类左/中/右 三段式技术路线图)
- `neural-network-architecture.md` — 神经网络架构图(layer 块 + tensor shape + 跳连)
- `qualitative-comparison-grid.md` — 多方法 qualitative 对比网格(**行 = 样本,列 = 方法**)
工程 / 自然科学 / 答辩通用:
- `scientific-schematic.md` — 概念 / 原理 / 实验装置示意图(自由度高,自然语言模板)
- `mechanism-diagram.md` — 机理示意图 / 因果链路 / 转化路径(中心对象 + 多阶段转化 + 结果区;含三段式因果链 / 循环自激发 / 多分支竞争 三种变体)
- `multi-condition-comparison.md` — **多工况 / 多条件结果对比图**(同一对象在不同 condition 下的并列结果,2×2 / 1×N / M×N;强调 panel 间严格统一)
- `publication-chart.md` — publication-ready 数据图表(bar / line / scatter / heatmap / box)
总览 / 摘要 / 答辩首页:
- `graphical-abstract.md` — 期刊投稿 Graphical Abstract / 图形摘要(横向 4 段式 / 中心展开 / 方形 / 竖版四种变体)
- `research-overview-poster.md` — 开题 / 答辩 / 汇报首页研究总览图(上中下三层 + 五模块;含中心辐射 / 左右双栏 / 极简 三种变体)
> 选择策略:CS/CV/ML 论文首选 `method-pipeline-overview` + `qualitative-comparison-grid`;工程 / 能源 / 化工 / 材料方向首选 `method-pipeline-overview` 变体 4 + `mechanism-diagram` + `multi-condition-comparison`;投稿期刊摘要图用 `graphical-abstract`;答辩 PPT 首页用 `research-overview-poster`。
### 17. Infographics (`references/infographics/`)
适合“信息图 / 高密度科普 / 手绘信息图 / KPI 仪表盘”等"信息可视化大图"。当前已落地:
- `legend-heavy-infographic.md` — 高图例密度科普 / 因果链 / 演化 / 解剖图(双语)
- `hand-drawn-infographic.md` — **手绘风**信息图(macaron / morandi / 黑板 / 牛皮纸;自然语言模板)
- `bento-grid-infographic.md` — 便当格模块化信息图(高密度多模块 widget 排布)
- `comparison-infographic.md` — 二元 / 多元对比信息图(A vs B / 套餐档位 / 误区 vs 正解)
- `step-by-step-infographic.md` — 步骤教程信息图(插画感、温暖;非工程流程图)
- `kpi-dashboard-infographic.md` — KPI 仪表盘式信息图(年度回顾 / Wrapped / 业务 dashboard)
### 18. Technical Diagrams (`references/technical-diagrams/`)
适合“系统架构 / 流程 / 时序 / 状态机 / ER / 思维导图 / 网络拓扑”等工程示意图。统一暗色 grid 背景 + 等宽字体 + 角色编码配色,每个模板都附 light 变体。
⚠️ 注意:本目录生成的是 **PNG 位图**,**不是可编辑 SVG**;需要可编辑请改用 mermaid / draw.io / excalidraw / Figma。当前已落地:
- `system-architecture.md` — 系统架构图(前端 + 后端 + DB + 缓存 + 队列 + 外部)
- `flowchart-decision.md` — 流程图 / 决策图(BPMN 形状语义 + Yes/No 分支)
- `sequence-diagram.md` — 时序图(actor + lifeline + 消息箭头 + 激活条)
- `state-machine.md` — 状态机 / 生命周期图(state + transition + guard / action)
- `er-diagram.md` — ER 图 / 数据模型图(实体 + 字段 + PK/FK + crow's foot 关系)
- `mind-map-tech.md` — 技术主题思维导图(中央 + 放射式分支)
- `network-topology.md` — 网络拓扑图(设备 glyph + zone / VPC + 带宽 / 协议标)
## 提示词工作流(模式感知)
无论 A / B / C,**前 6 步是共用的**;区别只在第 7-8 步如何"出图"。
1. **跑 `check-mode.js` 确定模式**(A / B / C)。
2. 判断任务是生图还是改图。
3. 识别它属于哪个分类目录(参考下方"模板索引")。
4. 只读取对应的具体模板文件,**不要一次读整个 references/**。
5. 严格遵循模板格式:大部分模板用 JSON 主模板(结构化任务首选),少数模板(`infographics/hand-drawn-infographic.md`、`academic-figures/scientific-schematic.md` 等)使用「结构化自然语言 + 参数」混合形式,因为强行 JSON 会限制创作自由。
6. 把用户输入映射到模板参数;关键信息不足时主动发起有针对性的澄清问题。
到此 prompt 已渲染好。下面按模式分叉:
7-A. **Mode A**:把最终 prompt 保存到 `garden-gpt-image-2/prompt/`,调用 `scripts/generate.js` 或 `scripts/edit.js`,图片落到 `garden-gpt-image-2/image/`。
7-B. **Mode B**:把最终 prompt 直接传给宿主的图像工具调用;按需保存 prompt 副本到 `garden-gpt-image-2/prompt/`。
7-C. **Mode C**:把最终 prompt 保存到 `garden-gpt-image-2/prompt/<task-slug>-<timestamp>.md`,并把完整 prompt 在对话中展示给用户,附一句简短的"如何使用 / 推荐工具"建议。
8. 任务结束后用一句话告诉用户:当前模式是什么、prompt 落在哪、图(如有)落在哪。
## 重要约束
通用:
- 模板文件中的 JSON 是**提示词结构模板**,不是 API 请求体模板。
- 三种模式下,最终交给图像模型的都是"渲染后的 prompt 字符串"——可以是拍平的 JSON、可以是结构化自然语言段落,按模板原样使用。
- 除非用户明确要求,否则**不要把 SKILL.md 里的"模式说明"复制到最终 prompt 里**——那是给 Agent 看的元信息。
仅 Mode A 适用:
- 生成脚本使用 JSON body
- 编辑脚本使用 multipart form data
- 响应优先按 `data[0].b64_json` 解析,也兼容 `data[0].url`
- 除非上游接口明确要求,不额外引入特殊 query 参数
## 何时提问
只在这些信息缺失且会显著影响结果时提问:
- 没有 prompt 目标
- 改图时没有原图
- 主体身份或视觉类型决定结果走向
- 商品 / 价格 / 文案 / UI 文本是画面核心组成部分
- 用户同时表达了多个互相冲突的目标
除此之外,优先自己做合理默认并继续执行。
Все файлы
103 файловУстановить gpt-image-2
Скачайте файлы навыков и распакуйте их в каталог .claude/skills/.
Скачать ZIPКлонируйте репозиторий и скопируйте файлы навыка в свой проект.
git clone https://github.com/ConardLi/garden-skills/tree/main/skills/gpt-image-2 # Copy SKILL.md to your .claude/skills/ directory
Копировать





Дом
