前言
本书主要是全面完整性的来解析AI是如何生图的,并以comfy这款开源应用来讲解整个流程,这样不仅可以让我们学会如何使用Comfy同时也可以理解,AI的工作流程,这样方便我们选择什么样的工作方式。
如果你在选择线上模型还是搭建自己的生图服务时,看完本书,会对你如何选择会有更清晰的方向和目标。
虽然这本书主要是以Comfy的应用作为主题来开展,但当你你完整学习完这本书的内容后,同时也具体使用SD的知识,可以说Comfy只是一个裁体,这本书真正的内容是在解构AI绘图的原理。当然我们也不可否认Comfy这种工作流的形式,本身就是需要对模型的构成有足构的了解才可以去把控每一个节点的,这点与Blender的节点流也是相通的。
智能数媒的工作原理,其实就是将人类创作过程的所有步骤细节规范化,流程化,从而大大节省了创作过程耗时,耗材的工作环节,一个分镜,基本可以通过智能数媒工作就可以快速生成对应的创作思想。在这一个时代是了不起的工作。打破了传统的创作流程,大大提升了工作的效率和产出的速度。
但对于人类来说他是一个工作,一个高效的工具,如果单纯把他当成一个工具来说,那确实是一个强大而高效的。他是一个封闭的大脑,如果单纯说他是一个无意识的工具,有时我并非如此认为,就像人工作一样,你一句话,别人也可以正常产出,只不过产出的内容或许不是你想要的,因此你得在整个工作流程中去介入,去把控,这就是智能数媒的创作链条,现实世界中也是如此的,一个工程项目,一部电影,到成品的完成,都需要投入极大的人力物力,去产出最终的成品,每个人物各司其积去把控项目的进度和目标效果。因此你有一个智能数媒工作,你还需要一个完整的链条去把控自己的项目和进度。
在日常工作产出中,这类工具能提高不错的产出效率。
的发展迭代是十分迅速的,但他,传统数媒创作已经逐渐被智能数媒所替代,因为他更能体现,表达一个创作的构思和创作方向,这无疑对于创作者来说是一个相当不错的机会与机遇,
本教程会教您如何使用ComfyUI,从基础的界面操作到功能再到发散生图,以及对所需要用到的模型,罗拉等进行介绍梳理。
如何工作
有些模型会打包VAE调色器作为基调,因此可以能通过内置的VAE和主模生成图片,但是如果模型内没有
我们用普通人到专业人员举个例子来说明,这就好理解了,
比如,一个人想画一幅画,比例得有头脑,想画一幅怎样的画,这是一个构想,就是我们的大模型要作的思想,做创意,做想法,我们能过和大脑不断地交流去调整图片的内容,这就是clip(prompt,negtive)所要做的事,有了大脑后,接下来,得有笔或是颜料,通过笔,颜料(调色盘),就可以绘制出一幅画,且不说技术如何,能画出基本轮廓和造型,专业人员如果经常训练就可以绘制出不同风格,不同造型的画作,这就是Lora的作用。
因此在刚开始前很多手部,姿体出现问题,基本是因为模型不太理解导致的,通过加入Lora基本可以解决这一问题,也可以通过Lora让人物绘画得更好看,通过Lora替换同不同风格效果,通过Lora实现不同的技法。
VAE调色器的作主要是色感,比如果要明艳点的,莫兰迪色系,马卡龙色系,基本可以通过VAE实现。
所以 Checkpoint/大脑 + Lora/技法 + VAE/颜色 就可以绘制出画作了,这就是AI工作的基本原理。
当然实际应用中不仅仅只有这些,还有大量的操作,比如提示词,角度,镜头,人物,动作,图片优化等等。我们在本章课程中也会涉及。
Comfy与SDWeb的对比
SDWeb更加傻瓜化,可以理解为SDWeb是封装好后的Comfy,他将一些必要的参数,比如图片优化,降噪,细化这些都封装在一起了,而Comfy里需要自己再去手动设置,相当于,
SDWeb是一个加了特效的相机,拿起来就能拍摄,能直接出片能直接生产,大大减少了工作量,这就是为什么SDWeb的出图效果要优于Comfy的原因。
Comfy相当于一幅单反,还需要对图片进行后期,需要去配置这些优化项,每一个细节都需要留意到,比较考验对于细节与精度的把控。
简单点来说SDWeb更加友好,也方便使用,而Comfy是作为一些更为具体的创意服务的。
ComfyUI是一个节点工具,用过Blender的节点和写过流程图之类的对于这种工具是好理解的,他的区别在于可控性强,这点就是区别于stable diffusion的。
ComfyUI能做什么 图片,视频,音频,3D基本都可以通过Comfy进行自动化生成
第一章 应用介绍
在第一章中,我们主要对Comfy这个应用进行基础界面应用的功能点进么介绍,这样有助于我们知道他是如何使用的,也可以快速定位到我们要的功能,找到我们需要解决的问题功能位置,Comfy是一个工具,只有知道工具如何使用才可以快速完成工作内容。
第一节 界面

以上就是Comfy的整体应用界面,他分别以 1 左侧栏 2 画面 3 右侧栏 和 4 标签栏 组成

左侧栏
主要是 资产 节点 功能性的东西基本集中在左侧栏中,标识处的下展箭头可以对文件进行保存和导出等其它操作以及一些设置主题的内容,这些都是相对比较能用的菜单项,我们逐一介绍,这样就能对这个应用有大致上的理解,下次找对应的功能也会更加容易。
菜单
Comfy里将File/文件,这种通用的菜单做成了隐藏式的标识下展菜单,现在很多应用也是如此设计的,比如Figma也是如此。在传统的菜单里,有时候一些功能是重复的,但也有存在的必要性吧,

菜单里包含了新建,文件(保存,导入导出),编辑,视窗,主题,版本号以及模板,设置,扩展,帮助,都是一些基本的功能项 可以通过Theme切换主题。
设置
我们可以通过设置中的 Comfy项 -> Locale/区域设置 更换 应用界面语言 直接切换为 中文界面,同时也可以切锦其它

画面
主要是设置面布里的显示形式,比如标签和连接的样式。
外观
主查设置整个应用界面的形式,比如节点背景的透明度,左右侧边栏的设置这些基本信息。
**遮罩编辑器 **
3D
主要是设置3D视角的相关参数
快捷键
用来设置一些快捷发键的触发事项
扩展
是用来管理插件以及功能项的
左侧栏下部份分别为
说明/帮助

可以这里反馈问题以及查看相关文档,也是相当方便的
控制台
这个可以实时跟踪应用的输入日志,对于开来说这是比较重要的功能,能实时查看应用出现哪些状态,出错也会在这里输出日志,也能方便用户实时获取发生错误的对应信息。

第二节 模型
在comfyui中使用模型分为免费和收费两种模型,一般来说像PRO基本都是收费的,SDXL这是免费开源的,如果要自己封装模型可以学习开源的。正常情况下,黄色一般都是云上模式,需要开通才可以使用的。
红色的框:代表本地无对应的模型或是库,需要下载,只需要根据右侧的列表进行下载即可,还是十分方便的。
黄色的框:只需要开通线上接口就可以了。

因此我们将模型分为两类来讲解,本地模型以及云上模型。
本地模型
红色框是找不到本地的模型和对应的依赖对象,因此报警红色,并提供下载地址,我们只需要根据连接地址进行下载即可,当然还得放到对应的位置,要不然应用也还是会报错。而黄色的框是没有配置好对应的API接口。

云端模型
黄色框就是没有找到登陆信息,或是Key,连接不通,此时需要配置帐号等相关相息

云模型一般是按次来收费的,点击Run,会弹出提示,按照提示一步一步进行,即可以配置云模型


第三节 资产
comfy中常用功能基本集中在左侧的这一部份,工具栏

这部份后期应该会改动的吧,或是变成那种可设定的。
整个Comfy基本是围绕这部份张开了,生成,模板,资产基本就这一块在统一查看管理,我们对他进行逐一介绍
这部份主要是管理你导入的图片,和生成的图片,

第四节 节点
整个流程的所有节点基本都在这里搜索,然后拉取到画布中进行连线,同时我们也可以在画布中右击去添加对应的节点

这里有个蓝图,可以将你需要的某段工作流进行整合成蓝图进行重复利用,在Figma中这种一般称为components或是母板,或是说可以理解为UE里的蓝图和Blender里的节点组,其目的主要是封装同类内容进行复用

第五节 模型
我们下载或导入模型基本会出现在的这里,一般是对应项目根目录下的models文件夹,如果是手动下载的,建议根据文件夹名存放对应的模型或文件

工作流
这里主要保存我们的工作流,一般我们保存都会存放在这个列表中,他不会以固定形式存放为文件的,换个角度,我们要吧理解为他将文件存放在了浏览器里了,如果我们需要可以通过,文件就是顶部的标识下拉菜单进行对应文件的导出。

应用
把你搭好的节点工作流,封装成干净简洁、无复杂节点图的傻瓜式网页应用界面

模板
这里有大量模板可以选择,可以通过搜索模型的对应名称,找到对应的生成工节流,这也是十分方便的

以上就是整个 Comfy 的工作模式式了,以节点的模式,链路的模式去打造对应的自动化流程,其实简单点的可以理解为拓谱图结构流程,也可以说是把你的工作流程做成可以复制的形式,现在的工具形式基本是闭式的形式去发展了,像Comfy和figma等基本都是这条链路,也可以说新生代的应用基本是以一个完整的生态在打造应用的生存模式,在我看来Comfy还是有很大的发展空间的
比SDwebui复杂,但自由度比SDwebui高,也可以打造自动流程化,这点确实是比SDweb的创作形式高出了另一个纬度
第二章 模型与工作流及蓝图
第一章我们主要讲 comfyUI 的界面内容,对整个应用进行界面,而在这一章中,我们主要来讲一个什么是模型,模型是个什么东西,他能做什么,实现什么,怎么划分以及蓝图的作用
第一节 模型是什么
我们先要弄清模型是什么,才能知道他的工作原理,这样就方便我们后期对模型进行筛选,也能理解模型是需要怎么使用的。
我们以文生图模型来作一个例子,来理解,模型是什么,它究竟是如何工作的。
模型的原理
模型(Checkpoint)就相当于大脑,同理我们需要理解模型是如何构成的,我们以大脑来举个例子
人的大脑是由左右脑构成的,有逻辑,有感性,有情感,有思路,有视觉 能分辨颜色,有嗅觉,等等一些大脑的基本功能模块,通过中枢系统,激素,前叶等等这些统一由大脑处理,比如后期的绘画技能,工作技能这些基本都是后期学习的。AI生图基本也是依赖这个逻辑来的,模型就是他的大脑,一个有全功能的模型,就是这个模型就包含文本理解,图像理解,颜色理解,这就是绘画所要的内容了,如果是拆分的模型,就需要文本理解模块Clip和VAE色盘模块来添充,因此如果一个非全功能的模型,我们还需要引入Clip文件理解和VAE颜色理解的模型,去为主模型服务,缺一不可。但是大多数都会包含一些Clip和VAE的基础模型,这种姑且称为全功能模型Checkpoint吧,因为他只需要载入一个即可生成,也可以将Checkpoint比喻成一个压缩包,全不全,在于他打包了多少东西,同时也是可以打包音频这些的,因此一个完全体的Checkpoint可以打造一个完整的大脑。
Checkpoint就相当一个打包好的模型,将权重,文本理解和色调都打包成一个大脑,就是一个压缩包了,然后我们通过线去接出他对应的内容,这个有点类似脑机接口,直接从脑中去接出我们要的内容。
模型的拆分
需要用到权重(Unet),想法(Clip),颜料(VAE)这三个主要的内容,Lora(技巧/技艺)主要是用来深化的,这个我们后面关于Lora部份再作讲解。
那如果是一个非打包好的呢?我们就需要引入Unet,Clip,Vae这些东西,如下图,形成一个Checkpoint

所以我们可以理解,Checkpoint是一个模组集合,是一个由多个功能不同功能的模组组成的集合。
从上面的结构中,我们基本可以理解一个大脑,一个模型的构成是如何构成的,是如何工作的,但上面的例子中,仅是以文生图作一个例子来说明,模型的组成方式,但是模型的类型是多种多样的。
在文生图中,又分为:文生图,图文生图。在视频生成中,又可以分成:文生视频,首尾帧视频,多图视频,等等,还有音频模型,这些当然是有所区别了,我们同时也可以理解为,一个画师,一个导演,一个音乐创作者,他的技能是彼此不同的,因此,在我们要达成图,视频,音频,就需要去选择不同模型,搭配不同的lora或其它一大堆不同的插件技能树。而且不同的模型像Clip,vae这些也不一定能通用的,而且每个功能块也不可混用,就是因为有他这种专用特性,因此Checkpoint这种集合的,是较为主流的方式,也是最便捷使用的,

我们引用models这个文件来说明,模型的拆分基本也可以分为这些内容,这就好像比一个大脑,一个模型由哪些模块构成,对应存放,这样才会被识别,就相当于大脑,在语言板块中,没有日语,法语这两个模组,自然是听不懂的,因此我们需要在语言板块中,放入日语,法语这两个模组,就可以理解日语和法语这两个语种了,各司其职,各配其器,总不能在听觉的板块中,放入触觉的相关内容,自然是行不通的。
第二节 工作流及蓝图
工作流就相当于人的思维逻辑
蓝图,更像方法乱,比如我们已经做做了,走通了一个逻辑,这里为工作流,蓝图的作用就是将他封装,做成一套可以重复使用的流程,他可以是一整块,也可以是工作流的一个分支。
第三节 图文模型
当然了,我们在生成时使用蓝图(封装好的节点)是最高效的,当不是都有现成的蓝图可以使用,因此理解模型的构成是基础,这有两于我们后期去去配置我们的节点,或是个修改蓝图的内容,这样我们就能更好的定制我们需要的创意内容。
根据我们前面说到的,使用 comfy 生图时,需要用到权重(Unet),想法(Clip),颜料(VAE)这三个主要的内容,Lora(技巧/技艺)主要是用来深化的,这个我们后面关于Lora部份再作讲解。
模型的构成与原理
模型(Checkpoint)就相当于大脑,同理我们需要理解模型是如何构成的,我们以大脑来举个例子
人的大脑是由左右脑构成的,有逻辑,有感性,有情感,有思路,有视觉 能分辨颜色,有嗅觉,等等一些大脑的基本功能模块,通过中枢系统,激素,前叶等等这些统一由大脑处理,比如后期的绘画技能,工作技能这些基本都是后期学习的。AI生图基本也是依赖这个逻辑来的,模型就是他的大脑,一个有全功能的模型,就是这个模型就包含文本理解,图像理解,颜色理解,这就是绘画所要的内容了,如果是拆分的模型,就需要文本理解模块Clip和VAE色盘模块来添充,因此如果一个非全功能的模型,我们还需要引入Clip文件理解和VAE颜色理解的模型,去为主模型服务,缺一不可。但是大多数都会包含一些Clip和VAE的基础模型,这种姑且称为全功能模型Checkpoint吧,因为他只需要载入一个即可生成,也可以将Checkpoint比喻成一个压缩包,全不全,在于他打包了多少东西,同时也是可以打包音频这些的,因此一个完全体的Checkpoint可以打造一个完整的大脑。
一般全功能的模型,Clip文本理解和VAE色盘可能会有点不太理想,那同样你可以外接自己的Clip和VAE来增强生成的效果。

我们从左侧的 节点 - 搜索 Load Checkpoint 然后交过个节点拖入画布,我们就可以获得我们需要的扩散器模型的加载器了。因此在我们使用第三方模型时,需要了解他是完整模型还是分离的模型,根据模型去补充对应的内容。
权重(UNet)
Unet为权重,我们知道,生成图的原理是从噪点到降噪后形成的图片,是一个扩散点阵的原理,这点就类似,我们从一个不规则的图形中找出规律的轮廓创作,这里我引用我之前创作绘制的作品,这样能让我们更好的理解他是如何形成图像的

就是以点阵出轮廓,然后跟据这个轮廓去生成具象内容。比如用到Clip文本理解的模型,如果提词写的是女性,那么他就往右上靠陇生成,如果写的是大便则是右下。
文本(Clip)
Clip是片段就是我们经常用到的Prompt ,Negtive Prompt,就是提词和消极提词,提词是你的目标和方向内容,消极提词,就是你要避免的内容,根据我之前绘画创作的一个例子,来说明应该可以更形象理解他的原理,如下图,
Prompt: 中亚风格的女性

还原原图的风格还是差一点,但形态基本没错,因为是使用了参考图
Prompt: 这个是一位中亚女性露肩的,头发是带着发带头发是扎起来的,坐在盘转的木制台上,

这个基本还原来了稿线图的内容了,因此Clip这部份如果理解力强,就能减少自己的描述文字内容。因此如果Clip的模型能力超强,就超能精准的理解你的创作思路。
图像色彩 & 清晰度转换器(VAE)
Variational Autoencoder 的主要作用是负责上色、校正色彩、还原光影、把 AI 算完的隐形数据变回肉眼可见图片,包含编码和解码器
- Encoder 编码器:图片进模型前,压缩缩小尺寸
- Decoder 解码器:生成结束后,还原色彩、细节、画面
记住这两个码器,在节点中也是需要经常用到的,Encoder是用于参考图,Decoder用于收尾出图。
VAE就是你决定一个成像的色调风格,因此需要根据场景需求去选择自己的VAE模型,也是能提高成图的质感的,
- 写实的图片,色彩柔和、偏电影质感、肤色自然
- 动漫风格的图片:饱和度更高、鲜亮二次元配色
- 复古风格的图片:偏黄、低饱和胶片色调
这个相当于佳能相机暖和的色调整和尼康那种锐利的成像效果。

第四节 蓝图使用
蓝图是指一些封装好后的节点,就是一个特定的固定的效果,一些常规的模型一般都是有封装好的蓝图的,我们直接使用蓝图进行生成就十分之方便,像我们这里使用的就是已经预制好,官方Comfy自带的Flux2蓝图

点击蓝图右上角图标,就可以进入该蓝图的具体配置,当然我们是可以对蓝图的参数进行更改的,但是同时要确保原始数据有一份,这样方便后期的复原。

进入后,我们可以看到该蓝图是如何连接节点的,需要哪些模型以及节点,最后直接输出Image。因此使用蓝图能快速提高我们的工作效率,就像造元子弹一样,如果有制作蓝图,就不用从零开始研究了。

因此我们在使用时,一般优先使用蓝图,这个是最方便的,如果不存在蓝图,再自己去配置对应的节点,时间成本相对会较高。
第五节 如何配置蓝图
Subgraph 子图蓝图 把一堆节点打包压缩成单个独立面板,像原生节点一样,可以收起来、展开编辑、重复调用,选中所有节点,在Mac中按住Command+框选,选中的呢节点后,右击,选择“转换为子工作流”

我们就可以得到一个子图蓝图

这个为整个子图蓝图的内容,我们需要进去子图蓝图,再进行输入,输出端的绑定

左侧为输入端,或侧的点为输出端

可以给每个输入输出的引入重新命名,这样就可以更清楚得知道引脚需要接入哪些内容。

这样一个子图蓝图就配置好了。
第三章 节点的使用
我们在第二章中已经理解什么是模型,模型的工作原理,再把模型看作大脑,不同大脑产出不同作品。在这一章中我们要理解并使用节点去构建一个完整的工作流程。
第一节 Load Checkpoint模型加载节点
根据模型的工作原理,基本上可以理解他需要输出哪些内容,我们可以根据对应的特性引入到对应的节点上,以下就是一个可以输出图片的基础节点连接

Model
这个是模型的主要内容,也是Chickpoint的主要功能块,在这里我们过各左侧工具栏的节点找到 K采样器 直接引入到K采样器的对应model引脚,K采样器你可以理解为他是捕捉模型生成的内容的,在第三章 节点的使用,针对每个节点进行理解,因此在这里我们不展开说具体的功能细节。
Clip
Vae
主要应用在Encoder解码器和Decoder编码器上,我们这样理解解码器以及编码器是如何工作的。 Encoder(编码器):接收图片 → 理解、压缩图片信息。 Decoder(解码器):接收潜数据 → 重建、生成输出图片
Encoder 编码器 图像 → 压缩表征(Latent / 图像 Embedding) 作用:看懂、理解图片,把图片转换成 AI 模型能计算的数据。

Decoder 解码器 压缩表征(Latent)→ 图像 作用:把 AI 计算完的数据还原成可视图片,输出画面。

以下就是一个基础的输入参考图,再生成图片的简单节点边接方式

编码器位于采样器的左侧,解压器位于采样器的右侧

第二节 Sampler 采样器节点
我们可以将采样器当成大脑灵感或创意的收集器,就如当我们大脑喷发出灵感,创意时,如果不收集,记录起来,就容易丢失,不能真正落地实现,因上采样器的工作就相当于收集大脑的灵感和创意并指导大脑应该如何工作,将从模型中收取到的相关信息,对应再输送到对应的节点上,这就是采样器的主要工作原理。在整个链路程中,采样器相当于一个指挥调度中心,人的中枢神经。
KSampler/K采样器

学术界和 AI 爱好者持续推导新的微分方程算法:
Euler初代 → DPM系列 → DPMPP系列 → SDE随机系列 → LCM极速采样
每一代都会修复上代缺点,于是越攒越多。
- 适配完全不同的创作需求,没有万能一款不同场景最优选择不一样,所以需要分类:
① 日常写真、书籍封面、写实照片(你做木簪首饰封面主打场景) 首选:dpmpp_2m(你截图里的 DPMPP_2M_SDE 同源家族) 优势:细节扎实、光影柔和稳定、20~28 步画质拉满,速度均衡,就是 A1111 WebUI 出厂默认采样器,也是通用性最强的万金油。
② 二次元插画、手绘氛围感创作 适合:Euler Ancestral(欧拉祖先采样) 特点:随机性更强,笔触、艺术氛围更足,画面不会过于写实死板。
③ 想要超快出图、预览草稿(10 步以内极速生成) LCM 系列采样器(截图里 LCM 缩放采样器) 专门为低步数优化,4~8 步就能出完整画面,牺牲一点点细节换取极致速度,用来快速试关键词构图。
④ 电影感、朦胧氛围感、抽象艺术图 带 SDE 后缀的所有采样器(DPMPP_2M_SDE、DPMPP_3M_SDE) SDE = 随机微分方程,生成过程会加入微小随机扰动,光影层次更丰富、虚化质感更强,氛围感拉满,但同步数会比普通版本慢一点。
- 搭配不同调度器(Scheduler)组合,效果天差地别 采样器(算法公式)+ 调度器(控制每一步降噪幅度的节奏方案)是绑定搭档: 同一个采样器,搭配 karras、exponential、simple 调度器,最终画面质感完全不同; 开发者干脆把热门常用组合,直接封装成独立节点展示在列表里,所以看起来数量爆炸。
- 小众定制向:玩家自制魔改采样器 截图底部:VOIDSampler、SEEDS2、SASolver、EulerAncestralCFG++ 这类 都是爱好者基于原版算法微调的改版: 有的专门优化 CFG 过高时色彩不会炸裂 有的专门适配风景大图、全景画面 有的适配图生图重绘场景 面向小众细分需求,普通日常出图基本用不上。 二、给你精简归类你截图里所有采样器用途
- 日常万能首选(90% 工作流只用这一类) DPMPP_2M_SDE / DPMPP_2S_Ancestral ✅ 写实、产品封面、人像通用,稳定细腻,对标 WebUI 默认效果
- 二次元艺术画风 EulerAncestral(欧拉祖先) 自由随性,插画手绘质感强
- 极速低步数预览草稿 LCM缩放采样器、SamplerLCM 几秒出图,适合反复调试提示词构图
- 氛围感电影质感画面(柔光、景深层次) 所有带 SDE 后缀:DPMPP_2M_SDE、DPMPP_3M_SDE、DPMPP_SDE 随机扰动更强,光影更温润
- 老旧淘汰款(现在基本没人用) LMS 采样器:初代算法,细节差、容易色阶断层,仅老教程遗留
- 小众魔改实验款(新手直接忽略)
VOID、SEEDS2、SASolver、CFG++ 系列
特殊场景调试使用,常规出图没必要选
三、新手极简固定公式(你做首饰封面直接照搬)
采样器:dpmpp_2m
调度器:karras
步数:22
26 步 CFG:77.5 这套就是 A1111 后台默认配置,也是画质、速度、稳定性平衡天花板。 四、补充小知识 你最上方的「K 采样器」是整合通用节点: 点开可以下拉自由挑选任意采样器 + 调度器组合; 下面一长串独立节点,只是把热门组合单独拎出来方便一键选用,二者底层计算逻辑完全一致
就像画画有:铅笔、水彩笔、油画笔、马克笔、速写炭笔; 没有一支笔能画所有风格,不同笔触对应不同画面效果,采样器就是 AI 画画的各类画笔。
1. 种子:0
- 作用:随机生成画面的唯一编号密钥 同一个种子+完全一致所有参数,每次生成图片会一模一样;种子数字改变,画面构图、细节就会随机变化。
- 生成后控制:
randomize含义:每点击一次生成,种子自动随机换新数字,每次出不同画面,适合批量试稿挑选构图。 - 优化建议: 看到满意的成品后,把当前种子数字固定记下,后续微调色彩、细节都不会打乱整体构图。
2. 步数:20
- 作用:AI迭代降噪打磨画面的总次数
- 当前情况:20步属于偏低档位 ✅ 优点:出图速度快 ❌ 缺点:木纹、雕刻细节、光影层次打磨不足,首饰精致度不够
- 成品推荐:24~26步,细节饱满且速度均衡
3. CFG:8.0
全称:引导系数
- 作用:控制AI听从提示词的严格程度 数值越高,越死板严格遵守文字描述;数值越低,AI自由度越高、画面更柔和。
- 当前8.0略微偏高: 容易出现色彩生硬、饱和度溢出、细节紧绷,画面容易偏假。
- 写实静物/木簪产品最优区间:7.0 ~ 7.5
4. 采样器名称:euler(欧拉)
- 特点:老一代经典采样器,随机性强、艺术氛围感尚可,但物体结构稳定性差、细节刻画偏弱,刻画实木纹理、精致首饰不适合。
- 替换首选:dpmpp_2m(写实产品画质天花板)
5. 调度器:simple
- 特点:全程均匀力度降噪,节奏平直,后期没有精细化收尾步骤,容易丢失微小纹理,现已基本淘汰。
- 固定替换:karras(细节收敛最好,静物、产品通用标配)
6. 降噪:1.00
- 含义:当前是文生图模式(从零纯噪点生成整张图片),必须固定1.0,完全正确无需修改。
只有高清放大、图生图改图场景,才会降到0.3~0.4区间。
二、适配黄花梨发簪/奢侈品首饰封面 标准最优参数配置
| 参数 | 推荐设置 | 理由 |
|---|---|---|
| 种子 | 随机/randomize | 试稿随机出图;定稿后锁定种子 |
| 步数 | 24 | 细节拉满,速度适中 |
| CFG | 7.5 | 提示词贴合+画面柔和通透平衡 |
| 采样器 | dpmpp_2m | 写实细节、纹理保留最强 |
| 调度器 | karras | 后期精细化打磨光影、木纹 |
| 降噪 | 1.00 | 文生图固定数值 |
三、补充小贴士
- 这套参数搭配外置MSE优质VAE,色彩不会发灰,木材质感会大幅提升;
- 想要柔光艺术海报质感,可把采样器换成
dpmpp_2m_sde,光影层次更强; - LCM极速预览仅用于草稿构思,不要用它导出最终成品。
Scheduler/调度器
高度器的主要作用是降噪的算法
采样器和调度器
在KSampler/K采样器里我们需要关注的是两套方式,采样品和调度器,
1. 日常通用万能画质首选(95%写实/静物/产品图首选,最稳妥)
采样器:dpmpp_2m + 调度器:karras
也就是你列表里的:DPMPP_2M
✅ 优势:
- 细节锐利均衡:木纹、雕刻纹路、金属光泽、首饰细小结构保留最完整,不会糊也不会过度锐化发假;
- 光影过渡自然,色彩柔和不炸裂,搭配外置VAE后色调通透,完美对标A1111 WebUI默认画质;
- 22~28步区间画质上限极高,出错率最低,几乎适配所有写实大模型;
- 速度和画质平衡拉满,出成品图标准标配。
2. 追求极致氛围感、电影柔光、景深层次(静物大片、艺术感海报)
带SDE随机微分系列:dpmpp_2m_sde / dpmpp_3m_sde
区别:
普通dpmpp_2m:规整、写实、细节硬朗(适合清晰展示首饰器物细节) dpmpp_2m_sde:降噪全程加入微小随机扰动,画面光影更温润柔和、虚化层次更强,氛围感拉满; 小缺点:
- 相同步数下比普通2m稍慢一点;
- 画面随机性更强,同参数每次出图会有细微差别,适合艺术创作,不适合需要固定一致的商品展示图。
3. 二次元/手绘插画画质最优
Euler Ancestral(欧拉祖先采样) 笔触随性、艺术感强,线条松弛,专门适合插画、国风手绘,写实静物不推荐。
4. 这些不要当成画质最优(短板明显)
- LCM:只求速度,细节大量丢失,成品禁用;
- LMS、老旧初代采样器:色阶断层、细节糊,早已淘汰;
- 各类小众魔改采样器(VOID、SEEDS2、SASolver):仅限特殊实验场景,通用性差。
5. 拉高画质不止靠采样器,配套黄金参数(直接照搬)
| 参数项 | 成品固定设置 |
|---|---|
| 采样组合 | dpmpp_2m + karras |
| 步数 | 24~26 |
| CFG Scale | 7 ~ 7.5 |
| 降噪强度(图生图/放大) | 0.33~0.38 |
| 必备搭配 | 单独挂载mse优质VAE + Hires高清二次放大 |
大白话最终取舍
- 要清晰写实、精准展现木头纹理、首饰工艺细节(商品主图):dpmpp_2m+karras 画质第一
- 要柔光氛围感、艺术大片质感(宣传海报):dpmpp_2m_sde
第四章 图像
第五章 视频
第六章 音频
第七章 三维
第一节 加载器
图2.1.2 是加载器的列表,可以从列表中看出,加载器是用来加载各模型,萝啦,Vae等内容的,
图 2.1.2
CheckPoint 加载器
作用
CheckPoint 加载器主要用于加载深度学习模型的权重参数,这些参数是模型在训练过程中学习到的知识体现。在图像生成任务中,它能加载预训练的生成模型,如 Stable Diffusion 等模型的核心权重,使模型具备生成图像的能力。
功能
参数读取:从保存的模型文件(如.ckpt 格式)中读取网络结构的权重数据,将其加载到内存中,以便模型在推理阶段能够使用这些参数进行计算。
模型初始化:根据读取的参数初始化模型的各个层,确保模型处于可执行状态,为后续的图像生成或其他任务做好准备。
跨平台兼容性:支持在不同的深度学习框架(如 PyTorch)和硬件环境(CPU、GPU)下加载模型参数,方便模型在各种场景下运行。
输出
加载完成后,输出一个已初始化好参数的深度学习模型,该模型可接收输入数据(如文本描述、随机噪声等),通过内部的计算和推理过程,输出图像数据或其他中间结果,用于后续的图像生成或处理。
VAE 加载器
作用
VAE(变分自动编码器)加载器用于加载 VAE 模型,VAE 在图像生成中主要负责对图像进行高效编码和解码,将高维图像数据压缩到低维空间表示,并能够从低维表示中还原出图像。在 AI 绘画流程中,它常与生成模型配合,提升图像生成的质量和效率。
功能
编码功能加载:加载 VAE 模型的编码器部分,能够将输入的图像数据转换为潜在空间的特征向量,这些向量包含了图像的关键特征信息,实现对图像的压缩和抽象表示。
解码功能加载:加载 VAE 模型的解码器部分,将潜在空间的特征向量还原为图像数据,在图像生成中,通过对潜在向量的操作和转换,生成符合要求的图像。
优化图像质量:VAE 加载器加载的模型可以对生成图像的细节、色彩等方面进行优化,使生成的图像更加真实、自然,减少生成图像中的伪影和噪声。
输出
输出经过编码或解码处理后的图像数据。在图像生成过程中,接收生成模型输出的潜在向量,通过解码输出最终的图像;在图像编码场景下,接收原始图像,输出对应的低维特征向量。
LoRA 加载器
作用
Lora(Low-Rank Adaptation,低秩自适应)加载器用于加载 Lora 模型,它的作用是在不改变原始大型预训练模型(如 Stable Diffusion)主体结构和权重的基础上,通过加载小型的 Lora 权重文件,对模型进行快速微调,以适应特定的风格、主题或任务需求。
功能
权重融合:将 Lora 模型的权重与原始基础模型的权重进行融合,在推理时,使模型在保留基础能力的同时,引入 Lora 所学习到的特定知识和风格。
快速适配:针对不同的应用场景,如特定的艺术风格、人物形象、场景主题等,通过加载不同的 Lora 模型,实现模型快速适应新的生成需求,无需重新训练整个基础模型,节省计算资源和时间。
参数管理:管理 Lora 模型的参数加载和存储,确保 Lora 权重与基础模型的正确交互和使用,并且支持多个 Lora 模型的叠加使用,进一步丰富生成效果。
输出
输出经过 Lora 权重调整后的模型推理结果,即生成符合特定风格或任务要求的图像。这些图像在保留基础模型生成能力的基础上,融入了 Lora 模型所带来的独特特征和风格。
ControNet 网络模型 加载器
作用
ControNet 加载器用于加载 ControNet 模型,ControNet 是一种能够对图像生成过程进行精确控制的技术。它通过引入额外的条件输入(如线稿、深度图、人体姿态图等),引导生成模型按照指定的结构、姿态或风格生成图像,极大地增强了图像生成的可控性。
功能
条件输入处理:加载 ControNet 模型后,能够接收并处理各种条件输入数据,将这些条件信息与原始的文本或噪声输入相结合,为生成模型提供更丰富的指导信息。
结构引导:根据输入的条件数据(如线稿),引导生成模型生成符合特定结构的图像,确保生成图像的轮廓、布局等与输入条件一致,常用于线稿转彩色图像、根据草图生成真实场景等任务。
风格和姿态控制:利用姿态图、风格图等条件输入,控制生成图像的人物姿态、艺术风格等特征,使生成图像能够满足用户对特定风格和姿态的要求。
输出
输出在特定条件控制下生成的图像,这些图像严格遵循输入条件所设定的结构、风格或姿态要求,同时结合文本描述等其他信息,生成高质量、符合预期的图像结果。
ControlNet/diff 加载器
作用
ControlNet/diff 加载器是对 ControNet 的一种扩展或变体加载器,它可能侧重于处理与图像差异(diff)相关的条件输入,进一步增强对图像生成过程中细节变化的控制能力。它可以利用图像之间的差异信息,引导生成模型在已有图像基础上进行更精确的修改和生成。
功能
差异信息处理:加载 ControlNet/diff 模型后,能够解析和处理图像差异数据,将这种差异信息转化为生成模型可利用的条件,指导模型生成与原始图像存在特定差异的新图像。
局部修改控制:基于差异输入,实现对图像局部区域的精确修改和生成,例如在保持图像整体风格和结构的前提下,对某个物体的颜色、形状进行改变,或者添加特定的细节元素。
渐进式生成:利用差异信息实现渐进式的图像生成和优化,逐步调整图像细节,使生成结果更加符合用户对图像变化的预期。
输出
输出根据图像差异条件生成的修改后图像,这些图像在保留原始图像部分特征的基础上,按照差异条件进行了针对性的调整和生成,实现对图像的精细化编辑和创作。
风格 加载器
作用
风格加载器主要用于加载各种风格模型或风格参数文件,其作用是使图像生成模型能够生成具有特定艺术风格(如梵高风格、水墨风格等)的图像,满足用户对不同艺术表现形式的需求。
功能
风格模型加载:从存储的风格模型文件中加载风格相关的参数和结构,这些模型通常学习了特定艺术风格的特征和表现形式。
风格迁移:将加载的风格模型与基础图像生成模型相结合,在图像生成过程中,将学习到的风格特征迁移到生成图像上,使生成图像具备目标艺术风格。
风格参数调整:支持对加载的风格参数进行调整,如风格强度、色彩饱和度等,用户可以根据自己的喜好灵活控制生成图像的风格表现程度。
输出
输出具有特定艺术风格的图像,这些图像在内容上符合输入的文本或其他条件要求,同时在视觉风格上呈现出加载的风格模型所对应的艺术效果。
CLIP 加载器
作用
CLIP(Contrastive Language-Image Pretraining,对比语言 - 图像预训练)加载器用于加载 CLIP 模型,CLIP 模型能够建立文本和图像之间的语义联系。在图像生成中,它可以帮助模型理解输入的文本描述,并生成与之语义相符的图像。
功能
特征提取:加载 CLIP 模型后,能够分别对输入的文本和图像进行特征提取,将文本和图像转换为高维空间中的特征向量,便于后续进行语义相似度计算。
语义对齐:通过计算文本和图像特征向量之间的相似度,实现文本和图像的语义对齐,帮助图像生成模型理解用户输入的文本描述意图,生成符合语义要求的图像。
多模态检索:在图像生成过程中,CLIP 加载器支持基于文本描述进行图像的检索和筛选,从大量图像数据中找到与文本语义匹配的参考图像,辅助生成模型生成更准确的图像结果。
输出
输出经过语义对齐和处理后的信息,这些信息用于指导图像生成模型生成与输入文本语义一致的图像。在实际应用中,CLIP 加载器输出的特征向量和语义相似度信息会与其他生成模型组件协同工作,最终生成符合文本描述的图像。
unCLIPCheckpoint 加载器
作用
unCLIPCheckpoint 加载器用于加载 unCLIP(一种改进的 CLIP 相关模型或技术)的模型权重或检查点文件。它在图像生成和处理中,进一步优化了文本与图像之间的映射关系,能够生成更高质量、更符合语义的图像,同时可能具备一些新的特性,如支持更复杂的文本描述、生成更大分辨率的图像等。
功能
高级模型加载:从存储文件中加载 unCLIP 模型的权重参数和网络结构,使模型具备处理文本和图像生成任务的能力,相比传统 CLIP 模型,unCLIP 模型可能具有更先进的架构和训练策略。
增强语义理解:通过加载的 unCLIP 模型,实现对文本描述更深入的语义理解,能够捕捉到文本中的细微语义差异和复杂语义关系,从而指导生成模型生成更精确、更细腻的图像内容。
图像质量提升:unCLIPCheckpoint 加载器加载的模型可以对生成图像的分辨率、细节等方面进行优化,生成更高质量的图像,满足用户对图像清晰度和视觉效果的更高要求。
输出
输出基于 unCLIP 模型生成的高质量图像,这些图像在语义准确性和视觉效果上都有较好的表现,能够精准匹配输入的复杂文本描述,为用户提供更优质的图像生成结果。
第二节 采样器
第四章 插件使用
第三章 节点使用
第三章 脚本使用
command + Alt + I 启动
allow pasting
(() => {
function copyGraphToClipboard() {
const graphJson = JSON.stringify(window.app.graph.serialize(), null, 2);
navigator.clipboard.writeText(graphJson)
.then(() => alert("已复制 JSON!"))
.catch(err => console.error("复制失败:", err));
}
function addButton() {
const btn = document.createElement("button");
btn.innerText = "复制 JSON";
btn.style.position = "fixed";
btn.style.bottom = "20px";
btn.style.right = "20px";
btn.style.zIndex = "1000";
btn.onclick = copyGraphToClipboard;
document.body.appendChild(btn);
}
addButton();
})();
就可以复制当前节点转为Json
模型的分类
- .Safetensors
safetensors 完整包 头身脚都打包成一个,直接使用即可能 safetensors
评论
发表评论