2026-09-07 痛点归档
https://aigc.cygongju.cn/day/2026-09-07/
用户想要"打字描述编辑需求→自动出图"的云端式体验,ComfyUI 里没有现成工作流,需自己懂节点+手搓 LLM 管道
产品假设「一句话图片编辑器」:LLM 意图解析→自动路由到 Qwen-Edit/Klein/Krea2 最适模型→一键执行的本地 ComfyUI 套壳,主打非技术创作者
付费信号间接付费:同类用户在 fal.ai 上跑 Klein 管道按次付费(见 pp-20260907-009 同帖链)
竞品格局RunComfy / comfy.org 模板库(云端模板):有模板但需懂节点,无自然语言入口;OpenArt Edit Image(Web 工具(闭源)):有该体验但不开源不可本地,按订阅付费;ComfyGPT(论文)/ComfyGen(研究原型):学术系统,无可用产品
现场证据与现有方案
场景r/comfyui 求助:想要像云端 AI 模型一样"输入一句修改描述就完成图片编辑"的工作流。评论区给出 3 条拼凑路径:Flux.2 Klein KV 模板+info 节点、textgenerate 节点(Qwen3.5/Gemma4)喂系统提示词再接 Klein 9B、自建 LLM 理解→模型编辑管道——每条都要用户自己组装,无开箱即用方案。发帖人明确说"get a little lost, some of them are very complex"
时间成本拼装+调试 LLM 管道每次数小时;不折腾则付云端月费
现有方案官方 Flux.2 Klein KV 模板(需自找模型)、textgenerate+LLM 组合(YouTube 教程级,非产品)
社区方案部分:评论给出 Klein KV 模板路径+pastebin 系统提示词,但组件多、门槛高
当前做法下载官方模板手改;或 LLM 节点+编辑模型手工拼管道;或放弃本地转用 fal.ai/纳米等云端(月费)
MiniMax H3 视频的 ref2video 参考精度极强,但没有对应的 ref-to-image 工作流:图片创作者要的是"多参考图→单张商品级图",被迫用视频模型单帧抽图绕过
产品假设「多参考图商品图工作台」:基于 H3 Omni Reference 逻辑封装图片端工作流(参考图拼合+自动布局+截帧质控),服务电商/插画创作者,官方图片模型发布前是时间窗
付费信号明确付费:SECourses 教程 $12.99/月 paywall 有人讨论;间接:视频模型绕行本身是算力浪费
竞品格局Krea2 多图编辑(模型+ComfyUI 工作流):B站有教程但复杂场景一致性不足;Qwen-Image-Edit 2511(开源模型):多图参考 ID 保持弱于闭源;gpt-image 系(闭源)(API):参考精度高但贵且不过审内容受限
现场证据与现有方案
场景r/comfyui 帖:"Minimax H3 has incredible reference to video accuracy. Any way to make a reference(s) to image workflow?" 21 评论。高赞回复:Omni Reference 模式可拼 50+ 参考项、SECourses 的教程被 paywall($12.99/月)、官方确认"image model for this exact use 正在做"。用户当前绕法:用视频模型生成再截帧(浪费算力+帧质量不可控)
时间成本每张图用视频模型绕行多花 5-10 倍算力时间
现有方案H3 Omni Reference 模式(视频向)、Krea2 多图编辑(图片向但参考精度弱于 H3)、千问 Edit(一致性弱)
社区方案部分:Omni Reference 模式+拼参考图技巧被分享,但非正式图片管线
当前做法视频模型生成→截帧;或付费看 Patreon 教程($12.99/月);或等官方图片模型
「源图+物件mask+参考图→房间里的家具被参考物件无缝替换」这类电商/室内场景需求,现有模型保不住参考物件的 ID 细节
产品假设「保 ID 物件替换流水线」:参考物件专用 encoder(类似 PuLID 思路但物件向)+自动 mask+细节回贴(原纹理保留),切电商家具/服装类目,本地跑 Z-Image/Krea2 底座
付费信号间接付费:电商摄影是高付费场景(商品图外包单张 50-500 元);FLUX.2 max Object Swap 是 API 按次付费且明确瞄准 furniture swap
竞品格局FLUX.2 max Object Swap(BFL API 工作流):官方明确支持 furniture swap,按次付费,细节保真最好但闭源收费;Put It Here Kontext(本地工作流):免费但电商实测细节模糊;千问换装工作流(本地+B站教程):4步采样快,面部/花纹一致性拉胯
现场证据与现有方案
场景r/comfyui 帖(正文完整三输入格式):卧室换床/沙发场景,最看重 reference object identity preservation,现有方案物件花纹细节丢失。B站同症状:Krea2 换装视频评论区"衣服上的花纹细节都是模糊的""替换后人物面部完全变样"(208赞视频下方)。同一痛点跨中英文社区+跨图/视频域
现有方案Put It Here Kontext(RunComfy)、FLUX.2 [max] Object Swap(BFL API)、Qwen Edit 换装工作流(B站教程多)——用户实测花纹/面部细节丢失
社区方案无(新帖未回复;B站评论区同类抱怨多但无解)
当前做法Put It Here Kontext / FLUX.2 Object Swap 等工作流硬跑,接受细节失真后 PS 修;或找摄影师重拍
动漫图批量局部重绘(去纹身/修四肢/去路人)的自动遮罩工具集体失灵:mask 不准导致"要去的没去掉、要留的被抹掉"
产品假设「动漫专用分割+重绘包」:微调 SAM 类模型专攻动漫多人物语义分离(角色A/角色B/杂物),配套批量 inpaint 队列+mask 人工快修界面
付费信号间接付费:用户已花 Claude 订阅费求方案未果
竞品格局SAM 3.1 官方节点(官方节点):文本提示分割强,但动漫风格/亲密多人场景识别差;AnimeSeg / anime-focused segmentor(开源模型):小众,维护断续
现场证据与现有方案
场景r/comfyui 今日帖:"what are the best automask or batch impainting tools for anime ai art? The ones ive tried suck at anime"——需求清单:去纹身/去杂物/修肢体/去多人。实测问题:想 mask 掉男性角色时把女性也 mask 了;"Claude 推荐的模型浪费我时间"。SAM 系在动漫 NSFW 上语义识别弱
时间成本逐张手绘 mask 每张 5-15 分钟,批量 100 张=整天
现有方案SAM3.1(官方支持文本提示分割)、ComfyUI_Segment_Mask、自训 face mask 模型(r/comfyui 有发布)——动漫+NSFW 域均弱
当前做法逐张手绘 mask(批量场景不可行);或换真人向工具硬跑+大量返工
804 页长篇条漫本地量产:整页多分镜一次生成(gpt-image 能做到)在开源栈不可复现,逐格生成+拼版又慢又难保 7 个角色一致
产品假设「条漫产线」:角色资产库(四视图+UUID 标准化)+分镜模板化面板生成+自动拼版质检的端到端 ComfyUI 工作流,按"页"为单位输出,切中文漫剧出海市场
付费信号明确付费:发帖人参考稿本身就是花钱买 gpt-image 产的;B站教程用"课程资料+整合包"引流变现已跑通(7892 粉丝),漫剧创作者群体付费意愿强
竞品格局gpt-image / Seedream(闭源 API):整页直出质量天花板,贵且内容审查;知漫剧/即梦(中文云端平台):订阅制,一致性靠平台内角色库,不可本地;面板级+合成(DIY)(本地拼装):免费但每页 30-60 分钟人力
现场证据与现有方案
场景r/comfyui 技术帖(正文极详细):单卡 4080 16G + ComfyUI 0.33.2,参考页有 C2PA 凭证证明是 gpt-image 整页直出(3-4 分镜+沟槽+背景群像+气泡),本地尝试复现失败,问整页 vs 面板级+合成哪条路。中文侧同需求:B站"AI漫剧"教程爆火(189小时教程/全套工作流分享),评论区高频词=人物一致性、模型缺失("缺少ae.sft")、云端排队
时间成本长篇项目按页计:本地逐格+合成每页 30-60 分钟,是规模化瓶颈
现有方案gpt-image(闭源 API)、nano banana 类(并发降低成本上涨)、知漫剧等中文平台(云端订阅)
当前做法逐格生成+PS 拼版(每页 30-60 分钟);或买 gpt-image API 整页直出(贵,长篇 800 页成本数千美元)
ComfyUI 新内存系统(aimdo/Dynamic VRAM/Comfy Compiler)上线后显存行为黑箱化:占用暴涨/OOM/变慢,用户只会加 flag 盲调,无观测工具
产品假设「显存透视镜」桌面小工具:实时曲线+节点级归因(哪一步分配/释放了多少)+升级前后 A/B 基准对比+一键生成 issue 报告,给重度用户和维护者省排查时间
付费信号间接付费:5090 用户(万元级卡)是付费能力最强的群体;已有 Distorch VRAM Manager 等付费倾向节点
竞品格局KJNodes VRAM_Debug(节点):只打印节点前后 VRAM 快照;Distorch VRAM Manager(节点包):NVML 自动调预留,社区反馈好但仍是自动黑箱;nvidia-smi 手动盯(原生命令):无工作流上下文关联
现场证据与现有方案
场景本周三个独立 issue:#16140(更新后 5090 显存 80%→98%、UI 卡顿,13 评论中美中用户混着求 --reserve-vram 救命)、#16144(compiler 与 Block Sparse Attention 冲突 OOM)、#16150(H3 工作流疑似 regression 9 评论)、KJNodes#750(H3 Low VRAM attention 崩溃)。维护者反复要求用户提供"前后性能对比数据"——用户没有工具采集。#16134 Comfy Compiler 反而拖慢 H3 生成。共同根因:内存调度决策不可见
时间成本每次 ComfyUI 升级后重新调内存参数+跑基准 1-3 小时;OOM 崩溃损失长任务
现有方案KJNodes VRAM_Debug 节点(打印前后 VRAM)、DistorchMemoryManager(NVML 检测外部占用)——都是快照不是行为分析
社区方案部分:维护者给了 flag 和 PR#16148 修复,但"哪个 flag 组合适合我的卡"仍靠试
当前做法加启动 flag 盲试(--disable-comfy-compiler/--vram-headroom/--reserve-vram)或回退版本
AI 视频多段拼接处出现可见"打嗝"(闪烁/跳变),缺一站式无缝续接工作流,用户不知道用哪个方案
产品假设「无缝续片向导」:对比测试三家续接方案并封装成一键节点(自动选最优衔接算法+自动校色),卖点是省去用户试错时间
付费信号无信号(但 H3 Multishot 包在 HF 免费发布且被大量下载讨论,间接说明需求密度)
竞品格局MiniMax H3 Extender(自定义节点包):组合 Ref2VA+Motion Context+缓存,功能全但学习曲线陡;H3 Multishot(节点包+工作流):v2.7.0 需多个第三方包,缺一个包整个 graph 校验失败;Seedance Extend(官方模板)(云端工作流):仅限 Seedance 2.0 API 付费使用
现场证据与现有方案
场景r/comfyui 求助"Best way to smoothly daisy-chain AI video clips without a visible hiccup?"。评论指路 motion-context 项目族+LTX-2 缝合工作流+Minimax H3 方案,但分散在多个项目/帖子中,无标准答案。同周 r/StableDiffusion 另帖求"extending or continuing MiniMax H3 videos like WAN SVI"(50+ 评论,arctic 只收录到垃圾评论但热度真实),两个独立求助=共性
现有方案H3 Continuum(Manager 可装)、ComfyUI_MiniMax_H3_Extender(tritant)、MiniMax-H3-Multishot(joeygambino)——三包并存竞争,质量参差,用户选择困难
社区方案是:H3 Continuum / MiniMax H3 Extender / Multishot 三个节点包都被推荐,但用户需自己比较试用
当前做法手动找 motion-context fork 尝试;或最后一帧作首帧重新生成(亮度漂移需后期校色);或放弃长视频
想训 LoRA 的用户连"训练数据怎么准备"都没有好用的 ComfyUI 工作流:图片生成→筛选→打标→建数据集全靠 PS 手动
产品假设「数据集工坊」ComfyUI 节点包:生成图→人审筛选→自动打标(Florence-2/WD14 双引擎)→脏数据检测→一键导出训练集,把散装工具串成可视化流水线
付费信号间接付费:Civitai 站内 LoRA Trainer(自动打标+托管训练)是官方付费方案,证明该环节有付费习惯
竞品格局Civitai On-site LoRA Trainer(Web 托管训练):自动打标+一键训练,但数据集准备仍要用户手动上传整理;autocap(Python 脚本):命令行工具,非可视化,小白用不了;Kohya ss(GUI 训练工具):功能全但界面劝退,打标环节仍要外挂 tagger
现场证据与现有方案
场景r/comfyui 帖"I really need a LoRA dataset preparation images workflow"(4 评论)。回帖人自述"doing it by hand with Photoshop",另一人提出可以给 demo 讲解 captioning 要点。同时 B站评论区(BV19MQMB6Eqs)有用户问裁剪节点能否集成标准证件照尺寸——通用模式:用户要的是"数据集准备流水线"而非单节点
现有方案autocap(Florence-2 脚本)、Civitai 站内 Trainer、Kohya ss——都是独立工具,ComfyUI 内无整合工作流
当前做法PS/Photopea 手动处理+手动打标;或散装工具(autocap 脚本、Miaoshouai Tagger)自行拼接
B站视频宣称分享"MiniMax H3 局部视频编辑工作流",实际附件上传错误/不含遮罩部分,粉丝投币后拿不到能跑的工作流,评论区集体讨要
产品假设「工作流验货市场」:上传工作流自动做依赖解析+沙箱试跑+截图验证,跑通才上架,按次付费下载分成给作者——解决"下载即翻车"的信任问题(视频向尤其缺)
付费信号间接付费:用户已为视频投币/三连(B站注意力付费);shuzihub.net 等工作流市场按次浏览付费正在兴起
竞品格局shuzihub.net(中文工作流市场):评论区自发推荐,质量参差;OpenArt workflows(云端工作流市场):英文向,模型绑定云端;Civitai workflow tag(社区上传):无跑通验证,缺模型清单校验
现场证据与现有方案
场景201赞/4213播放教程视频,评论区前 14 条里 8 条在指出"工作流上传错了""网盘里的不对""带mask的实际上没有",1 条"不发真正工作流白投币了,害得我拿AI自己编一个",另有人指路 GitHub MaskVidExperiments(ltx 基础) 自救。视频类工作流分享的"标题党+附件缺失"是系统性问题
时间成本每个"假分享"视频浪费用户 10-30 分钟下载验证+重新找源
现有方案数字联邦 shuzihub(评论区被推荐)、GitHub 开源仓库、Civitai workflow 标签(2260 个)——质量审核缺失,跑不通没人管
当前做法评论区互相指路 GitHub/civitai 自找;或自己从教程视频反推重搭
漫画/条漫对话框文字替换没有专用 ComfyUI 工作流:AI 编辑模型能改字但多泡迭代时错字率+排版失控,专业翻译本地化仍靠 PS 手动
产品假设「漫画本地化流水线」:OCR 检测泡内文字→翻译 API→字体匹配+矢量排版回写(非生成式重绘),做成 ComfyUI 批处理节点,切翻译嵌字外包市场
付费信号间接付费:漫画本地化是成熟付费外包市场(翻译+嵌字按页计价)
竞品格局llamagen.ai Bubble Studio(Web 工具):做气泡生成而非文字替换本地化,方向不同;PS/Gimp 手动(传统工具):业界标准,慢但可控;AI 编辑模型(Krea2/Qwen)(模型):单泡可用,多泡排版失控
现场证据与现有方案
场景r/comfyui 求助"How replace text inside bubble speech on comics"。评论实测:用编辑模型 prompt 改字可行(首次成功率高),但被质疑"多个 bubble+多次迭代因为 model got one letter wrong 就要重来,比 PS 还慢";建议回到 PS/Gimp/LayerForge 节点。翻译本地化场景(中文漫画→英文)需要批量+字体排版控制,现有 AI 编辑模型做不到
时间成本一页 10+ 泡手动处理 20-40 分钟;AI 重试每泡 2-3 次
现有方案无专用方案。llamagen.ai 有"气泡生成"功能(英文向,非本地化翻译替换);ComfyUI 内 LayerForge/PaintPro 节点可手绘
社区方案是但否定:社区共识是"AI 更麻烦",PS 仍是正解
当前做法PS/Gimp 手动擦除+重打字(100% 控制但慢);或 AI 编辑模型逐泡重试(错字率高)
Desktop 版内置模型下载功能失效(下不动/失败),新用户卡在第一步"把模型放进正确目录",与"工作流引用大量缺失模型"痛点叠加
产品假设「模型管家」本地免费版 RunComfy:解析工作流 JSON→列出缺失模型清单(含 Civitai/HF 直链+哈希校验)→多线程断点续传+自动归位目录
付费信号无信号(但 RunComfy 自动装模型是付费云的核心卖点,反向证明价值)
竞品格局Model Linker(扩展):fuzzy 匹配重链接本地已有模型,不下新的;RunComfy auto-setup(云端付费):上传 JSON 自动装全部依赖,正是本地缺的能力
现场证据与现有方案
场景r/comfyui 今日帖"ComfyUI Desktop can’t download models"。同期生态信号:r/comfyui 有人发布"Huggingface Downloader - Made to fix slow, stalled downloads"自制工具(说明官方通道之烂有人已动手);Minimax H3 Workflow request 帖里用户因 404 拿不到工作流文件求"send the json text"
时间成本大模型 10-60GB 断流重下每次 30 分钟-数小时
现有方案RunComfy 云端自动装(付费)、Model Linker(fuzzy 匹配 missing 模型)、ComfyUI Manager(装节点不装模型)
社区方案部分:民间工具已出现(Huggingface Downloader)
当前做法手动浏览器下载+手动放 models/ 子目录;或用民间下载器
Kijai WanVideoWrapper 生态缺"可开关的 LoRA stacker"节点:rgthree Power Lora Loader 不兼容,用户被迫放弃整套 Kijai 节点
产品假设「WanVideo 系 LoRA 开关堆叠器」节点:兼容 Kijai 私有模型加载路径的 lora stack(启停/单独强度/懒加载不占显存),填补 rgthree 覆盖空白
竞品格局rgthree Power Lora Loader(节点):通用场景标杆,但 WanVideoWrapper 私有加载路径不兼容
现场证据与现有方案
场景r/comfyui 帖(正文+7 评论完整):要"允许部分启停的 LoRA loader/stacker",回复确认 rgthree 不兼容 Kijai 系;讨论发现 strength=0 仍会加载 LoRA 占显存、"有的 LoRA 0 强度仍影响输出"。发帖人最终"ended up giving up on the Kijai nodes"改用原生节点+Distorch2 offload——工具缺口直接把用户赶出生态
现有方案rgthree Power Lora Loader(不兼容 WanVideoWrapper)、原生 LoRA Loader 链(无开关)
社区方案无解:确认"does not work with these nodes, which was the point of the post"
当前做法手写原生节点组合;或逐个 bypass 节点;或放弃 Kijai 全家桶
新模型(Qwen-Image-Edit)火了但配套 LoRA 生态真空:Flux 时代的老 LoRA 不通用,用户"需要 X 效果的 LoRA"时发现根本没有,被建议换模型
产品假设「LoRA 兼容性雷达」:按底模聚合 Civitai/HF LoRA 供给+需求缺口(求助帖数)的站点/爬虫,帮创作者判断"该模型生态是否成熟再入坑",也可给训 LoRA 的人指需求方向
竞品格局Civitai 模型库(模型市场):新品 LoRA 上架滞后模型发布 2-8 周,搜索无"底模兼容"过滤
现场证据与现有方案
场景r/comfyui 帖"I need a lora for nipples under clothes for Qwen edit image"(23 评论)。高赞解答直接说:"The lora for Qwen Edit does not exist. But you don’t need it"——因为 Qwen Rapid AIO NSFW 版更宽松不需要 LoRA。反映普遍现象:模型迭代快于 LoRA 生态,每换一次底模用户就得重新找/训全部 LoRA
现有方案Civitai 上 Flux 时代 LoRA 富集但 Qwen Edit/Krea2/Z-Image 新模型 LoRA 极少
社区方案是:指向 Qwen Rapid AIO 等替代模型版本
当前做法换回老模型+老 LoRA;或用模型自带能力绕过;或自己训(门槛高)
AMD 9070XT 用户在 Windows 上跑 ComfyUI 慢到不可用(SDXL 12 分钟/图),官方 ROCm 支持已发布但性能/GGUF 问题一堆,社区解法=装 Linux
产品假设「AMD 一键调优包」:脚本化检测 Windows ROCm 配置错误(驱动/功耗墙/GGUF 路由)+自动应用社区最优 flag 组合+性能基准报告,收一次买断费(AMD 用户价格敏感需验证)
付费信号间接付费:AMD 用户买卡省的钱(vs NVIDIA 溢价)部分愿意花在托管云上;RunComfy 等云服务有 AMD 转化叙事
竞品格局ComfyUI Desktop ROCm 版(官方支持):能跑但比 Linux 慢 20%+,GGUF 场景不可用;ZLUDA 民间方案(翻译层):安装复杂,版本跟不动
现场证据与现有方案
场景r/comfyui 帖"Looking for a workflow for 9070XT and 9700X that does not take ages"(10 评论):默认 SDXL 12 分钟,评论区诊断是 Windows ROCm 未正确调用硬件,最终解法"装了 Ubuntu 26.04 现在 krea2 每张 10 秒"。同期:Linux+9060XT 新机 3 小时装不上(7 评论求助)、GitHub #16062 ROCm/Windows VAE Decode 卡顿。AMD 用户群的部署+性能双坑
时间成本装系统+配置 4-8 小时;不装则每张图等 10+ 分钟
现有方案官方 ROCm on Windows(2026-01 起)、ZLUDA、WSL2——Windows 原生路径仍坑多(GGUF 功耗墙 120W、it/s 减半)
社区方案是:评论区给出 Ubuntu 实测数据+官方 ROCm 博客链接
当前做法装双系统 Linux(折腾一天);或 ZLUDA 等民间方案;或忍
官方 Partner Nodes 付费节点混在免费节点调色板里,老牌 CGI 艺术家反感且不知道怎么关闭/过滤,同天两人发帖求"禁用付费节点"
产品假设「节点防火墙」小扩展:一键隐藏/过滤付费节点+自定义黑名单(也可顺带过滤低质节点包),瞄准开源洁癖用户(量级存疑,防御性产品)
付费信号明确付费(反向):Comfy Cloud Creator 订阅 $35/月有真实用户在付,且出现重复扣费客诉
竞品格局官方 Partner Nodes(内置付费节点):被传统 CG 背景用户抵触,扣费客诉已有
现场证据与现有方案
场景r/comfyui 同日两帖("There should be no paid nodes in my CGI software"/"...in my pallete"):发帖人是 AE/Nuke/Maya/Blender 全家桶老炮,观点"要么整体付费要么免费+捐赠,不该软件内塞付费工具";尝试 --disable-api 无效。另一侧 GitHub #15483:用户被 Comfy Cloud 订阅重复扣费 $35/月×2 且工作流仍锁死。商业化与开源社区价值观的摩擦开始具象化
现有方案无过滤方案;官方文档只讲怎么接 API key 用付费节点
当前做法试 --disable-api(无效)或忍受