context-infra 检查与复盘infra.guiming.net · 全内容自包含呈现 · 生成于 2026-07-21 16:28 UTC

图片生成与放大

Z3 全文↑ Z2 条目

术-操作 · 术层 skill 全文

← 返回术层 skill 索引 · 返回方法论区

本页是 <code>rules/skills/generate_image.md</code> 的逐字投影(仅隐私清洗,零改写)。

时点提示:本页是仓内文件 rules/skills/generate_image.md 的逐字投影(仅做隐私清洗:仓库根绝对路径→相对路径、家目录→~/;除此零改写)。若源文件后续有修订,以仓内真源为准。

Skill: 图片生成与放大

使用 Gemini 或 GPT-Image-2 模型生成图片、编辑图片或放大图片分辨率。单文件 CLI 工具,也可作为 Python 模块 import。

When to Use

用户说出以下意图时触发:

Prerequisites

Usage

工具路径:tools/generate_image.py

两种模式通过 --upscale flag 切换。

文生图(默认 Gemini Flash,1K)

python tools/generate_image.py -p "A serene mountain lake at sunset" -o lake.jpg

显式选择模型

python tools/generate_image.py -p "A cinematic mountain lake" -o lake.jpg --model gemini-pro
python tools/generate_image.py -p "A cinematic mountain lake" -o lake.jpg --model gemini-flash
python tools/generate_image.py -p "A cinematic mountain lake" -o lake.jpg --model gpt-image-2

图片编辑(图 + 文输入)

# 单图编辑
python tools/generate_image.py -p "Remove the watermark" -i photo.jpg -o clean.jpg

# 多图合成
python tools/generate_image.py -p "Combine these two styles" -i style.jpg -i content.jpg -o merged.jpg

# GPT-Image-2 单图编辑
python tools/generate_image.py -p "Make this image look like an observatory-grade photo" -i photo.jpg -o enhanced.jpg --model gpt-image-2

指定分辨率和宽高比

python tools/generate_image.py -p "Wide banner" -o banner.jpg --size 4K --aspect-ratio 16:9

对 GPT-Image-2 来说,CLI 会把 1K / 2K / 4K 和 aspect ratio 映射成实际像素尺寸。例如:

当前 GPT-Image-2 的 CLI 映射遵循实测边界:最长边不超过 3840。6K 不支持。

放大图片(Upscale)

保持内容不变,提升分辨率到 4K。

# 默认宽高比 16:9
python tools/generate_image.py --upscale -i small.jpg -o big.jpg

# 头像等正方形图片用 1:1
python tools/generate_image.py --upscale -i avatar.jpg -o avatar_hd.jpg --aspect-ratio 1:1

--upscale 当前只支持 Gemini 模型,不支持 gpt-image-2

参数速查

参数短写说明默认值
--prompt-p生成 prompt(生成模式必需)
--input-i输入图片路径(可多次使用)
--output-o输出路径/前缀output
--size-s1K / 2K / 4K1K
--aspect-ratio-a1:1 / 4:3 / 16:9 / 9:16 / 3:4生成不设,放大 16:9
--model-mgemini-flash / gemini-pro / gpt-image-2,也支持 exact model id默认 Gemini Flash
--upscale切换到放大模式False

模型配置

可通过环境变量覆盖默认模型:

环境变量默认值用途
IMAGE_GENERATION_MODEL统一覆盖默认生成模型选择
GEMINI_FLASH_IMAGE_MODELgemini-3.1-flash-image-previewGemini Flash 生成模式
GEMINI_IMAGE_GENERATION_MODELgemini-3.1-flash-image-preview旧的 Gemini Flash 兼容变量
GEMINI_PRO_IMAGE_MODELgemini-3-pro-image-previewGemini Pro 生成模式
OPENAI_IMAGE_MODELgpt-image-2GPT-Image-2 生成模式
GEMINI_IMAGE_UPSCALE_MODELgemini-3-pro-image-preview放大模式

Python Import

from tools.generate_image import generate, upscale

# 文生图
generate(prompt="A cat", output_prefix="cat", image_size="1K")

# GPT-Image-2 文生图
generate(prompt="A cat", output_prefix="cat", image_size="1K", model="gpt-image-2")

# 放大
upscale(image_path="small.jpg", output_path="big.jpg", aspect_ratio="1:1")

与 Slides Workflow 的关系

本工具是 workspace 级通用工具。Slides Workflow 在 <slides-repo> 内有自己的批量渲染器(generate_slides.py),两者独立、场景不同。本工具的代码源自该 repo 的 gemini_generate_image.pygemini_enlarge_image.py,合并为单文件。


← 返回术层 skill 索引 · 返回方法论区