我的 AI 工具链:四个模型怎么分工

一句话结论:我不追求「一个模型解决所有问题」。四个模型各管一段——Anima 负责二次元出图,Krea 2 负责补细节与超分,MiniMax-H3 负责视频,Qwen-Image 2.1 负责通用生成与工作流底座。它们全部跑在一台 8GB 显存的笔记本上。

为什么不用一个万能模型

刚开始我也想过,找一个最强的模型就够了。跑了几个月之后发现:通用能力和专项能力是两条不同的曲线。通用模型理解力强、什么都能画,但在某个具体风格上往往不如专项模型;专项模型把一种风格做到极致,换个场景就立刻失效。

与其在两者之间反复妥协,不如让每个模型只做它最擅长的那一段。

四段分工

模型 它负责的一段 为什么是它
Anima-2.9B 二次元出图 Danbooru 标签模型。颜色鲜亮、姿势大胆,能直接生成热门作品的角色,也能模仿画师的画风
Krea 2 细节补充与超分 通用模型里理解力最强的一档。用它做二次采样,能把画面的细节密度拉上去
MiniMax-H3 图生视频 / 参考生视频 把静态画面变成镜头,是本地产出动态内容的路径
Qwen-Image 2.1 通用生成与工作流底座 覆盖面宽,适合做兜底方案,也是改造其他社区工作流的起点
Anima 生成的初音未来立绘,欧式小镇街道场景
Anima 负责的这段:构图与角色先立住,细节留给后面的模型去补

它们怎么串起来

实际跑的时候,这四个模型不是并列关系,而是一条链:

  1. Anima 出草图。先快速跑出构图和角色。这一步不追求细节,追求的是方向对不对——方向错了,后面再怎么补都是白费。
  2. Krea 2 做二采。把选中的图送进 Krea 2 做二次采样补细节。前提是输入必须达到 2K,否则角色一致性会崩,甚至出现大量噪音。
  3. 超分收尾。用 4x-AnimeSharp 把画风拉回 Anima,再用 Lanczos 把输出控制在可用尺寸——不加这一步,产出的图会大到不好用。
  4. 需要动起来就交给 H3。把成图作为首帧或参考帧,接进 MiniMax-H3 的工作流出视频。

8GB 显存意味着什么

整条链路跑在 RTX 5060 Laptop / 8GB 显存 / 16GB 内存的配置上。8GB 是个很硬的约束,所有模型都必须在量化版本和显存优化之间做选择,工作流也要逐条按显存重新调。

但这不等于「跑不了大模型」。视频侧最重的一次,我把 47GB 的权重放进了 8GB 显存里跑通——靠的是量化、分块加载和节点级的显存优化,而不是更大的显存。

为什么坚持本地跑

不是为了省钱。只有自己从头跑通一遍,才知道每一步的取舍在哪里:哪一步吃显存、哪一步是瓶颈、哪一步能用更省的方案替代。这些看教程看不出来。

下一步

每一段我都单独写过。Anima 的完整入门在《新手看了就会用的 Anima 教程》,进阶玩法(Lora、超分、Krea 2 二采)在《Anima 进阶》;整套工作流的清单整理在《我的 ComfyUI 工作流资产》。

Anima进阶——Lora,超分与Krea2二采

一句话结论:想让 Anima 的出图从“能看”到“耐看”,靠的是三件事——用 Lora 补上模型不认识的角色,用超分把图放大,再用 Krea 2 二采把细节密度拉满。最后一步是我自己做的工作流。

先补上模型不懂的部分:Lora

想必你也看过那些用 Anima 生成的超级精美的图片吧——不仅细节更多,而且还有 2K、4K 的尺寸。这里主要用到的,就是 Lora 和超分的技巧。

Lora 加超分之后的成图:初音未来立于星空之下,向发光的星辰伸手,白色礼服
Lora + 超分之后的成品:这个尺寸下的细节密度,是直出给不了的

Lora 主要是弥补模型所不了解的部分,比如画风、人物、服装、姿势等等,相当于让模型重新学习一个内容。画风 Lora 可以在 Civitai 上面下载,因为画风仁者见仁智者见智,所以我不做推荐。

从零训练一个自己的 Lora

如果你要跑的角色比较新或者比较冷门、Anima 完全不认识,或者是你的 OC,就可以通过 Lora 让模型学习。这里以我自己训练的卡拉彼丘角色米雪儿为例,这个角色比较冷门。

  1. 搜集素材。为了让模型能够充分学习,至少准备 20 张高质量训练图,越多越好。图片要主体清晰、没有干扰项,并且覆盖角色在不同场景下的状态——正面侧面、站起坐下、喜怒哀乐。为了保证学习时不被干扰,图片尽可能画风一致或接近,角色特征鲜明。
  2. 打标。通常使用 WD14 模型。为了保证质量,模型处理完之后还要人工检查一遍。打标涉及触发词和学习词:触发词是训练好之后调用 Lora 时要输入的词,因此要放在首位;学习词比较反直觉——如果你希望模型学到什么,就要把它删掉。训练时模型会把学习词 tag 与图片内容一一对应,最后学到的是剩下的部分。
  3. 训练。训练 Lora 比较吃配置,一般租用云端来跑,一个 Lora 大约 5–10 元。不同训练器的用法不一样,跟着各自教程走即可,没有统一的训练方法。
打标后的 LoRA 训练集文件列表:每张图片配一个同名 txt 标签文件
打标后的训练集:图片与同名 .txt 标签文件成对出现
省力技巧

打标这一步可以借用有视觉能力的大模型来帮忙,比如 DeepSeek V4.1,效果很好。

自训 Lora 生成的米雪儿,猫主题服装,坐在床上
自训 Lora 效果 · 一
自训 Lora 生成的米雪儿,橙色连帽卫衣,坐在床上揉眼睛
自训 Lora 效果 · 二

超分:把图放大,还要更好看

超分也就是在保持原有质量的同时放大图片,本质是重绘。从易到难,有三条路线。

方案 做法 代价
Lanczos 放大 ComfyUI 自带节点,可实现任意倍数放大 最省事,至于效果嘛……
超分模型 用 4x-AnimeSharp 这类超分模型做 4 倍放大 保持原有质量,甚至进一步优化细节
二次采样放大 不同模型接力,各取所长 效果最好,但要自己搭工作流

Krea 2 二采:我的原创工作流

先说 Krea 2。它是目前开源社区最强大的通用模型,理解能力强、生成画面质量高、多场景适配。但它本身不是专门生成二次元的,所以直出的二次元图片比较单薄,也认不出画师和人物——需要配合社区调整过的模型,或者用画风 Lora 来约束。

拿它来做二采,就是希望借助它来丰富细节、提高画面质量。

Krea 2 二采超分工作流的 ComfyUI 节点全景图
Krea 2 二采工作流全貌

这是我对这个工作流的完整讲解,里面有工作流和模型下载链接:B 站 · Anima + Krea 2 二采超分工作流。

两个必须注意的点

  1. Krea 2 二采对输入图片有要求,最低 2K,否则无法保持角色一致性,甚至可能出现大量噪音——这和 Krea 2 训练时学习的图片尺寸有关。
  2. 二采出来之后,还有一个 4xAnimeSharp 放大的步骤,这是让画风回归 Anima 的步骤,但会让产出的图片非常大,可以在中间用 Lanczos 缩小。
二采加超分后的成图:初音未来坐在蓝色房间地板上,面前摊开一本书,周围散落书本与相框
二采 + 超分后的成图:书本、窗帘、地板纹理的细节明显更密
还没入门?

如果连模型文件和提示词都还没搞明白,先看《新手看了就会用的 Anima 教程》——把基础流程跑通,再回来做进阶。