图像生成
3495 字约 12 分钟
domain/aiai/multimodal
2026-07-24
AI 根据文本、图像等输入自动生成视觉内容的技术。从 2014 年 GAN 开创深度生成范式,到 2020 年 Diffusion Model 崛起,再到 2024-2026 年 DiT 和 Rectified Flow 成为新主流,图像生成已经过三次技术代际跃迁。
1. 核心结论
- 图像生成经历了 GAN → VAE → Diffusion → DiT/Rectified Flow 四次架构革命
- 2026 年主流工具:Midjourney V7、DALL-E 4、FLUX 2、Stable Diffusion 4、Imagen 4、Ideogram 3
- Latent Diffusion(在压缩潜空间中做扩散)是当前绝大多数模型的底层范式
- ControlNet、LoRA、IP-Adapter 三大控制技术让生成结果可控、可定制
- 提示词工程(Prompt Engineering)是高质量图像生成的核心技能
2. 技术架构演进
2.1 架构代际总览
2.2 四大架构范式对比
| 范式 | 代表模型 | 优势 | 劣势 |
|---|---|---|---|
| GAN | StyleGAN, BigGAN | 生成速度快,图像清晰 | 训练不稳定,模式崩塌,可控性差 |
| VAE | VQ-VAE-2, Parti | 训练稳定,有显式概率建模 | 图像模糊,细节不如 GAN |
| Diffusion | DDPM, Score SDE | 图像质量最高,多样性好 | 推理速度慢(需多步去噪) |
| Latent Diffusion | SD, SDXL, FLUX | 质量高 + 计算高效 + 可控 | 仍需多步采样(Turbo/LCM 可加速) |
2.3 Latent Diffusion 核心流程
2.4 从 U-Net 到 DiT:去噪网络的进化
传统 Latent Diffusion(SD 1.x/2.x)使用 U-Net 作为去噪网络,而新一代模型(SD3、FLUX、Sora)转向 DiT(Diffusion Transformer)架构:
DiT 的关键改进:
- 将图像分成 patch 后用 Transformer 处理,天然支持多分辨率和任意 aspect ratio
- Joint Attention 让文本和图像 token 在同一注意力层交互,融合更深
- AdaLN-Zero 将时间步信息注入每层,控制去噪强度
- 模型规模更容易扩展(scaling law 更友好)
2.5 Rectified Flow:从扩散到直线流
FLUX 模型的核心创新是用 Rectified Flow 替代传统扩散过程:
Rectified Flow 原理: 不是让噪声沿随机游走路径逐步去噪,而是学习从噪声到数据的直线映射(ODE 直线化)。好处是推理步数大幅减少,同时保持甚至提升图像质量。
3. 主流模型与工具(2026)
3.1 模型能力矩阵
| 模型 | 架构 | 开源 | 分辨率 | 核心优势 | 定价 |
|---|---|---|---|---|---|
| Midjourney V7 | 闭源 DiT | 否 | 最高 2048×2048 | 艺术风格、角色设计、美学品质最佳 | $10-120/月 |
| DALL-E 4 | 闭源 | 否 | 最高 2048×2048 | ChatGPT 原生集成,多模态理解强 | API $0.04-0.08/张 |
| FLUX 2 Pro | Rectified Flow + Transformer | 开放权重 | 最高 2048×2048 | 照片级真实感,开源可定制 | API $0.05-0.10/张,自部署免费 |
| Stable Diffusion 4 | Latent Diffusion + DiT | 开源 | 最高 2048×2048 | 完全开源,LoRA/ControlNet 生态最丰富 | 自部署免费,API $0.02-0.05/张 |
| Imagen 4 | Cascade Diffusion + T5-XXL | 闭源 | 最高 2048×2048 | 摄影级真实感,人脸/自然场景最佳 | Vertex AI $0.04-0.08/张 |
| Ideogram 3 | 闭源 | 否 | 最高 2048×2048 | 文字渲染能力最强,排版/Logo | 免费额度,$7-50/月 |
| Recraft V3 | 闭源 | 否 | 可变 | 矢量图、品牌设计 | 订阅制 |
| Adobe Firefly 4 | 闭源 | 否 | 可变 | 商业安全(训练数据有版权保障) | Creative Cloud 包含 |
3.2 模型选型决策树
4. 高级控制技术
4.1 三大控制技术概览
4.2 控制技术详细对比
| 技术 | 控制维度 | 是否需要训练 | 典型参数 | 应用场景 |
|---|---|---|---|---|
| ControlNet | 空间结构(边缘、深度、姿态) | 需要(预训练模型可用) | 控制权重 0.0-1.5 | 建筑设计、产品渲染、姿势控制 |
| LoRA | 风格、角色、概念 | 需要(轻量微调) | rank 4-64, alpha 1-64 | 角色一致性、品牌风格、艺术风格 |
| IP-Adapter | 图像级提示(风格+内容) | 不需要 | 权重 0.0-1.0 | 风格参考、face swap、零样本迁移 |
| T2I-Adapter | 轻量结构控制 | 需要(更轻量的 ControlNet) | 约 77M 参数 | 低资源场景的结构控制 |
| InstantID | 人脸一致性 | 不需要 | 单张照片 | 人像写真、角色一致性 |
4.3 高级工作流组合
实际生产中,多种技术经常组合使用:
常见组合模式:
- 产品渲染:ControlNet(深度图)+ LoRA(品牌风格)→ 产品图
- 角色设计:IP-Adapter(参考角色)+ LoRA(画风)→ 角色图
- 建筑可视化:ControlNet(线稿)+ Inpainting(细节调整)→ 建筑渲染
- 人像写真:InstantID(面部一致性)+ LoRA(风格)→ 写真照
5. 图像编辑与扩展
除了从零生成,图像编辑也是重要能力:
| 技术 | 说明 | 代表工具 |
|---|---|---|
| Inpainting | 局部重绘:选区内修改,保留周围内容 | SD Inpainting, DALL-E Edit |
| Outpainting | 画布扩展:向选区外延伸图像内容 | SD Outpainting, DALL-E Expand |
| Img2Img | 图像到图像:基于原图变换风格/内容 | SD img2img, Midjourney --iw |
| Super Resolution | 超分辨率:提升图像清晰度和细节 | Real-ESRGAN, SD Upscaler |
| Style Transfer | 风格迁移:保持内容,改变视觉风格 | IP-Adapter, Midjourney --sref |
6. Prompt Engineering(图像提示词工程)
6.1 提示词结构框架
好的图像 Prompt 通常包含以下层次:
示例:
A golden retriever puppy playing in autumn leaves, soft bokeh background, warm golden hour lighting, shot on Canon EOS R5, 85mm f/1.4, shallow depth of field, photojournalistic style
分层拆解:主体(golden retriever puppy)→ 动作(playing in autumn leaves)→ 背景(soft bokeh)→ 光照(golden hour)→ 设备参数(Canon EOS R5, 85mm f/1.4)→ 风格(photojournalistic)
6.2 常用技巧
- 权重控制:
(keyword:1.3)增强权重,(keyword:0.5)降低权重(SD 语法) - 负面提示:
--no text, watermark, blurry(Midjourney)或 Negative Prompt 框(SD) - 风格引用:
--sref URL(Midjourney Style Reference)、--cref URL(Character Reference) - 多概念融合:
cat :: dog ::0.5(Midjourney 多 Prompt 混合) - 构图控制:指定视角(bird's eye view, close-up)、构图规则(rule of thirds, centered)
7. 生产工作流与工具链
7.1 典型工作流
7.2 工作流工具
| 工具 | 定位 | 适用场景 |
|---|---|---|
| ComfyUI | 节点式工作流 | SD/FLUX 高级用户,精细控制每个环节 |
| Automatic1111/Forge | 经典 WebUI | SD 快速上手,插件生态丰富 |
| Midjourney (Web/App) | 对话式生成 | 快速出图,设计师日常使用 |
| ChatGPT (DALL-E) | 对话式生成 | 与文本工作流融合 |
| Leonardo.ai | 在线平台 | 游戏资产、设计原型 |
| Adobe Firefly | 商业安全 | 品牌素材、商用内容 |
8. 应用场景深度解析
8.1 产品与电商
- 产品图生成:用 ControlNet 保持产品外形精确,搭配 LoRA 控制品牌调性
- 场景替换:Inpainting 更换产品背景,实现不同使用场景的快速切换
- 模特图:虚拟试穿、虚拟模特,大幅降低拍摄成本
8.2 设计与创意
- 概念设计:快速生成 UI 原型、建筑概念图、工业设计方案
- 品牌素材:LoRA 训练品牌专属风格,确保视觉一致性
- 插画/漫画:保持角色一致性的系列插画创作
8.3 影视与游戏
- 概念原画:世界观设定、角色设计、场景概念图
- 纹理/贴图:游戏资产的纹理生成和风格化
- 分镜图:快速生成分镜头脚本图(参见 AI短剧创作系统)
8.4 个人创作
- 社交媒体内容:封面图、信息图、故事配图
- AI 写真:InstantID/IP-Adapter 实现低成本个人写真
- 壁纸/艺术创作:高自由度艺术表达
9. 版权与伦理
| 议题 | 现状 | 应对策略 |
|---|---|---|
| 训练数据版权 | 多国法律仍在界定,EU AI Act 要求披露训练数据 | 使用 Adobe Firefly 等商业安全工具 |
| 生成内容归属 | 美国版权局:纯 AI 生成不受版权保护,人类参与编辑可获得版权 | 保留创作过程记录 |
| Deepfake 风险 | 肖像权侵害、虚假信息传播 | 遵守使用政策,不生成真人虚假图像 |
| NSFW 内容 | 各平台有不同限制策略 | 遵守平台使用规范 |
10. 技术趋势与展望
2026 关键趋势:
- 统一架构:图像和视频生成模型趋于融合(如 FLUX 团队同时探索视频生成)
- 推理加速:Distillation、LCM、Turbo 等技术将生成时间压缩到 1 秒内
- 端侧部署:量化后的小模型(FLUX.2-klein-4B 等)可在手机/笔记本上运行
- 物理一致性:光照、反射、阴影等物理规律的正确表达仍是挑战
- 3D 一致性:从单张图到多视角一致的 3D 资产生成