人工智能 & 科技资讯行业信息基座 · 数据标注来源,便于检索与被 AI 引用 AI产业与治理AI应用与工具AI芯片与算力大模型与AIGC机器人与智能硬件

AI绘画高频术语解析:从扩散模型到提示词

打开AI绘画工具,满屏的专业名词容易让人发懵。这一篇带你逐一弄清,从底层原理到实操参数,不再被概念绕晕。

扩散模型:AI绘画的“底层发动机”

扩散模型是当前主流AI绘画工具(比如Stable Diffusion、Midjourney、DALL·E)背后的核心技术。它的工作方式可以简单理解成“从噪声里慢慢还原图像”。一开始是一张纯噪点图,模型一步步去除噪声,同时根据你给的文字描述修正细节,最终生成符合描述的清晰画面。整个过程就像把一团混乱的灰尘逐步塑造成雕像。

关键特点:

  • 每次去噪都依赖“文本指导”,所以提示词写得越准确,结果越贴近预期。
  • 不同模型版本(如SD 1.5、SD XL、SD 3.5)在画质、风格理解、资源消耗上有明显差异。
  • 模型本身不“认识”物体,而是学习海量图片和文字配对数据后形成统计规律。

实际使用注意:

  • 同一个提示词在不同版本模型下输出可能差别很大,新手建议先固定一个主流模型,熟悉后再尝试其他。
  • 扩散模型通常需要GPU加速,低显存(低于4GB)设备可能跑不动较大模型,但小模型或优化版本(如TinySD)可以降低门槛。
  • 2026年,开源社区推出了更多轻量级扩散模型,让普通电脑也能本地运行AI绘画。

CLIP:连接文字与画面的“翻译官”

CLIP(Contrastive Language-Image Pre-training)是图像和文本之间的桥梁。它把文字和图片都转换成一组数字向量,通过对比学习让语义上匹配的文字和图片向量更靠近。当你输入“一只戴帽子的猫”,CLIP会告诉扩散模型:“这张图应该偏向猫、帽子、站姿等元素”。

为什么重要:

  • CLIP的质量直接影响模型理解提示词的能力。同一个模型配合不同CLIP分支(如OpenCLIP、LAION-2B CLIP),对中文或抽象概念的支持程度不同。
  • 很多用户发现同样的提示词在不同工具里效果不同,背后可能就是CLIP版本或训练数据的差异。

常见误区:

  • 认为CLIP能“理解”人类常识,实际上它只是统计学关联,比如“猫坐在椅子上”和猫的图片向量接近,但不懂“坐”是什么姿势。
  • 过于复杂的提示词可能让CLIP困惑,反而削弱效果,建议用简洁、具体的短语。

LoRA:给模型“打补丁”的轻量插件

LoRA(Low-Rank Adaptation)是一种微调技术,它不修改原有扩散模型的所有参数,而是插入少量小模块,通过额外训练让模型学会某个特定风格、角色或物体。比如你想生成某动漫角色的同人图,训练一个LoRA文件(通常几MB到几十MB),然后加载到基础模型上就能生成该角色的形象。

应用场景:

  • 角色定制:固定某个虚拟人物或真人的面部特征(真人伦理需谨慎)。
  • 风格迁移:动漫风、油画风、像素风等,无需重新训练完整模型。
  • 物体控制:生成特定款式的汽车、建筑等。

使用要点:

  • 权重(Weight)调节:加载LoRA时可以设置强度(常见0.5~1.0),过高可能破坏画面自然度。
  • 多LoRA叠加:可以同时加载多个LoRA(比如人物脸+场景风格),但叠加过多会导致冲突或画风杂乱。
  • 训练自己的LoRA需要少量样本(10~100张图)和显卡时间,2026年在线平台已大幅简化流程,普通用户也能操作。

ControlNet:精确控制画面结构的“指挥棒”

ControlNet是一种附加模块,能通过额外输入图(如边缘线、深度图、人物骨架)引导扩散模型在生成时严格遵循特定构图。它像给模型一个“轮廓草图”,后续细节再按提示词填充。常见的控制模式有:

  • Canny边缘:根据黑白线条还原,适合固定形状。
  • 深度图:依据景深信息控制物体前后关系。
  • OpenPose:传入人物骨架,控制姿态(手、脚、身体)。
  • Scribble:手绘简单线条,模型填充细节。

价值:

  • 解决AI绘画“手部乱长”“构图偏掉”的痛点,尤其适合需要精确控制画面布局的场景。
  • 配合多个ControlNet可同时控制不同维度,比如边缘+深度,但计算量倍增。

局限:

  • 并非所有模型原生支持ControlNet,需要特定架构(如Stable Diffusion 1.5/XL)。
  • 过度依赖控制图可能限制创意,适合参考图修改而非完全自由创作。

采样器与步数:图像生成的“精加工参数”

采样器是扩散模型去噪过程中使用的算法,不同采样器影响生成速度、画质和风格。常见的有DDIM、DPMSolver、DPM++ 2M、Euler A、LMS等。步数(Step)则代表去噪的迭代次数,一般20~50步即可,太多浪费计算,太少细节不足。

选型指南:

  • 速度优先:DPMSolver系列(如SDE Karras)能在10~15步内出可接受结果,适合快速试验。
  • 画质优先:DPM++ 2M Karras或DDIM通常需要30步左右,细节更丰富。
  • 风格倾向:Euler A有随机性,适合艺术化效果;LMS更稳定但略慢。

关键点:

  • 步数并非越多越好,超过某阈值(如50步)改善不明显,反而增加计算时间。
  • 采样器与模型有隐式关联,某些模型可能对特定采样器更友好,建议同一提示词多试两三种。
  • 2026年新采样器(如LCM-LoRA)能实现1~4步超快生成,但画质略降,适合实时生成预览。

提示词与负提示词:AI的“指令语言”

提示词(Prompt)是用户用自然语言描述想生成的画面,负提示词(Negative Prompt)则告诉模型“不要出现什么”。两者共同构成了对扩散模型的约束。

提示词写作技巧:

  • 前后顺序: 越靠前的词权重越高(在Stable Diffusion中),把核心元素放前面。
  • 权重语法: 使用 (word:1.2) 提高权重,或 [word:0.8] 降低。注意不要过度堆砌,容易引发冲突。
  • 质量词汇: 使用“masterpiece, best quality, highres”等标准词有助于提升画质,但不同模型有各自偏好。

负提示词的陷阱:

  • 常用负提示词:low quality, bad anatomy, extra limbs, blurry, distorted等。
  • 过度使用负提示词可能让画面“死板”,比如禁止“手”可能导致无手人物。
  • 中文提示词在部分模型下效果差,建议中英文混合或使用英文。

2026年趋势:

  • 自然语言提示词越来越智能,很多平台支持长段落描述,甚至对话式修改。
  • 负提示词逐渐被“反向描述”取代,用户直接说“不要红色背景”,模型理解更准确。

常见问题

扩散模型和VAE是什么关系

VAE(变分自编码器)常作为扩散模型的前置图像压缩器,减少计算量。生成时VAE先降噪再解码,两者配合使用,但不是必须分开理解的术语。

CLIP模型中文支持如何

早期CLIP主要基于英文训练,对中文理解较弱。近年有社区训练的中文CLIP,但效果仍参差。建议使用英文提示词加少量中文专有名词。

LoRA训练需要多少张图

通常10~50张高质量图片即可,但要避免背景杂乱。训练轮数20~100 epoch,简单场景可少,复杂细节需多。2026年在线平台可自动优化。

ControlNet和图片到图片生成有何区别

图片到图片(img2img)基于原图加噪后重新生成,保留整体构图;ControlNet则用边缘/深度等控制结构,可以完全改变风格但保持轮廓。

采样器Euler A和DPM++ 2M哪个更好

侧重点不同:Euler A随机性强,适合艺术化风格;DPM++ 2M更稳定细节多,适合写实。建议同一提示词各出几张对比,选喜欢的。

提示词权重怎么写最有效

使用括号加数字如 (cat:1.3),数值1~1.5常见,超过1.5易导致过拟合。也可用交替语法 (cat|dog|bird) 生成组合。优先调整顺序而非乱加权重。

负提示词为什么会导致画面变差

负提示词会抑制模型产生某些特征,如果词汇过多或语义冲突,模型可能忽略合理元素。建议使用常见的5~10个负面词即可,避免长篇否定。