2026-09-18 痛点归档
https://aigc.cygongju.cn/day/2026-09-18/
'这张图的人换成那条视频里的人'——用户想要零配置的人物替换视频工作流,试遍 workflow after workflow 全失败
产品假设基于 Wan Animate/H3 Ref2Vid 封装一个本地'图+视频→换人'一键工作流(自动 depth/mask 前处理),卖 $15-30 给不想按条付费给 viggle 的创作者
付费信号间接付费:viggle.ai 等闭源按条收费工具存在且有市场,用户在本地找不到等价物
竞品格局闭源端成熟(viggle/Higgsfield/Monet);本地 ComfyUI 端空白——Wan Animate 模型已开源但无'零配置 THIS PERSON > THAT VIDEO'工作流/一键工具
现场证据与现有方案
场景创作者想用一张角色图替换实拍视频中的人物(动作/运镜完全保留,只换人),这是 VFX 换角色、AI 翻拍、风格化 MV 的核心需求。用户找到的 viggle 型工作流要么需要深度图前置流程,要么输出像隔毛玻璃
时间成本未提及(暗示数小时级试错:'workflow after workflow after workflow')
现有方案viggle.ai(闭源收费,JST-1 模型,8000+模板);Monet Vision Video Swap(Wan Animate,限2人);Higgsfield Recast(订阅制)。本地 ComfyUI 侧只有松散组件无整合工作流
社区方案部分:评论建议 depth buffer + ref2va、hybrid 模型复制更准/f2la 更能改内容,但都承认'没法完全保住背景'
当前做法用户试了多个 Wan/Ref2va 工作流都失败;评论给出的方案是手动做 depth buffer video + ref2va,或用闭源 viggle.ai(每条收费)
实拍视频换背景(保人物+保运镜+透视光照一致)找不到可靠方案,用户列了5项优先级逐个问模型
产品假设做一个'运镜感知的本地视频换背景'工作流:SAM3 逐帧抠像+轨迹稳定+背景图生视频+自动调色匹配,对准电商/广告投放团队收一次性授权费
付费信号间接付费:付费闭源编辑模型(Seedance Edit/Kling)被当作更省事的选择
竞品格局闭源编辑模型成熟;本地 ComfyUI 有组件(SAM/RMBG/合成节点)无整合高质工作流;RunningHub 老工作流质量差
现场证据与现有方案
场景有运镜的实拍素材,要求人物不动、运镜不变、只换背景且透视光照匹配——广告/VFX 刚需。用户不知道选 Luma/Kling/Seedance/WAN/Flux Video Edit 哪个
时间成本未提及;传统 rotoscope 每镜头以小时计
现有方案闭源 Seedance 2.5 Edit 效果好但收费;RunningHub 有视频换背景工作流(2024年, SVD 时代, 质量 outdated);B站有跟随运镜换背景教程但散落
社区方案有:SAM3.1 抠像 + 传统合成,但这是'绕开 ComfyUI'的方案
当前做法评论指路:rotoscope 先抠像(SAM3.1 起手)→合成软件里换天——即退出 ComfyUI 用传统 VFX 流程做;或用 Seedance 2.5 Edit(闭源)
AI 视频最后一步'成品感打磨'没有现成工作流,用户自创降采样加噪再放大土法炼丹
产品假设打包一个'AI 视频成品感一键 pass'工作流(latent refine + 闪烁稳定 + 胶片颗粒 + 锐化链),以 $9-19 卖给不想买 Topaz 的本地用户
付费信号间接付费:Topaz Video AI($299)、LetsEnhance、fal 上的 upscaler($0.14-1.2/10s) 都在为此收费,证明付费市场存在
竞品格局闭源成熟(Topaz);开源有能力但无产品化整合——'去AI味 final pass'定位是空白
现场证据与现有方案
场景AI 视频直出有'AI 味'(塑料感/闪烁/不通透),用户听说有 final polishing 环节但搜不到任何 prebuilt workflow,只能自己拼 downscale→noise→upscale 流程,惊讶'竟然没有预置工作流'
时间成本'lost my weekend' 式摸索;每条视频都要手动拼打磨链
现有方案Topaz Astra 2/Starlight(闭源收费,强);docs.comfy.org 有视频 upscale 教程(SeedVR2/HitPaw/Topaz 节点)但无'AI味去除'打包工作流;开源 FlashVSR/SeedVR2 需自拼
社区方案部分:Seedhunter 工作流里的二次 refine pass,但藏在大型工作流内无人知晓
当前做法自创土法:downscale + 加噪 + upscale;评论区推荐 minimax latent upscale 二次过(0.4 denoise 8步)藏在 Seedhunter 工作流里
YuE2 音乐生成接入 ComfyUI 后参考音频模式极慢:2 分钟曲目要等 2 分钟以上,疑似跑在 CPU 上
产品假设复刻 FastH3 套路做'FastYuE':蒸馏/量化+分窗并行把 reference 模式提到近实时,开源引流+托管 API 收费
付费信号间接付费:Suno 订阅($10/月)是现状替代;r/SD 上 YuE2 是'first real Suno local competitor' 高热帖证明需求浓度
竞品格局YuE2 加速/工程化是空白(FastH3 已有先例 61 赞,同套路可复制)
现场证据与现有方案
场景YuE2 是首个本地 Suno 竞品(r/SD 周榜 218 赞 127 评),已进 ComfyUI,但 reference audio 生成是 realtime 级慢——做翻唱/MV 的音乐创作者无法批量试错
时间成本每首 2 分钟曲=2+ 分钟等待;做一张 MV 十几首 demo 就是小时级
现有方案Suno(闭源订阅);ComfyUI-Olm-YuE2 分段生成方案(r/comfyui 75赞)缓解长度问题但不解速度;FastVideo 类加速未见 YuE2 版
社区方案无(有人确认 PR 刚合并,性能问题无人解)
给 20 个工作流各排 100 个任务时必须守在当前 tab 等队列传完,切 tab 队列就串到别的工作流
产品假设做一个 ComfyUI 前端侧'批量任务编排面板'插件:按文件夹/CSV 给多工作流派发参数组合并后台排队,卖给批量出图的工作室
付费信号无信号(但批量生产者是已付费人群:多卡/云 GPU)
竞品格局空白为主:没有好用的'多工作流批量编排台'产品
现场证据与现有方案
场景批量生产者开 20 个工作流 tab,每个要 queue 100 jobs;现在 queuing 过程不能切 tab,否则后 50 个任务变成新 tab 的——排队本身成了体力活
时间成本每天以十分钟计的纯等待(20 工作流×排队时间),且阻断多工作流并行生产
现有方案外部批量工具 rsandagon/comfyui-batch-image-generation(19 stars, 老旧需手改代码);OpenClaw 有编排层但重;ComfyUI 原生 queue 无此能力
24GB 显存跑不动 '本地 LLM + ComfyUI' 双栈:MCP agent 和出图模型互相挤显存,用户手写卸载调度脚本
产品假设做一个'双栈显存调度器'节点/守护进程:LLM 推理与 ComfyUI 任务互斥自动换页+优先级队列,解决 MCP agent 用户的 OOM 痛点
付费信号间接付费:这些人已经在为算力花钱(3090/4090 + 64GB RAM 配置普遍)
竞品格局空白:'本地 agent + 生图双栈显存编排'无成熟工具
现场证据与现有方案
场景用 Claude/Qwen 本地模型通过 MCP 操控 ComfyUI 是本周最热工作流趋势(68 赞 100 评),但 LLM(22GB) + MiniMax H3 同卡必 OOM,用户自己写'用 LLM 时卸载 comfy 模型'的服务器端调度
时间成本搭一次调度脚本数小时;每次切换模型仍要等加载
现有方案ComfyUI v0.35 动态 VRAM(尚有 BSOD bug 见 #16246);无现成 'LLM+Comfy 共存调度器';Hermes 等框架自带部分能力但未产品化
社区方案部分:评论区分享动态 vram swapping 经验与新版 comfy 模型切换修复,但方案零散、每人自己造轮子
当前做法手写 Python 调度脚本动态换入换出模型;或换小模型(qwen 9B distill)牺牲能力
人物换装/换姿势/换场景的脸和身体一致性仍无满意方案,用户逐个试模型发帖求'best'推荐
产品假设做'角色一致性工作站':一个角色多参考图管理+自动选最优编辑模型+批量换装/换景输出的包装工具
付费信号间接付费:闭源 nano banana pro 被反复当基准('like nbp but uncensored'),说明用户在为编辑能力付费
竞品格局图片编辑一致性:模型层竞争激烈但'工作流层打包+角色库管理'仍有空间
现场证据与现有方案
场景电商/IP 创作者要同一角色换衣、换姿势、换活动、换地点,试过 PuLID 不如原生 Klein 9B/Qwen,发帖求'上传2张图保一致性'的方案——同类帖本周至少 3 条(r/comfyui 2条 + r/SD 周榜 'Reference image → Character design' 2.1k 赞 135 评)
现有方案PuLID(免费但弱于新模型);闭源 nbp/Gemini 编辑(收费+审查);Qwen Edit 2511(接近但需自己拼流程)
社区方案部分:推荐 Qwen edit 2511 角色表 + H3 当编辑模型,但承认要多帧折损
当前做法在 PuLID/InstantID/Qwen Edit/MiniMax H3 当图编模型之间反复试;有人用 H3 生成 5 帧取 1 帧的奇技淫巧
买卡前找不到可信的'各 GPU 跑 MiniMax H3 生成时间'基准:大家报的数字不带工作流/优化细节,无法对比
产品假设建一个'ComfyUI GPU 基准站':标准工作流+timer 节点协议,众包各卡耗时数据,靠推荐位/联盟链接变现
竞品格局空白:'ComfyUI 硬件基准数据库'无人做
现场证据与现有方案
场景用户持双 7900XTX 想为 ComfyUI 攒 N 卡机,帖子里求大家报数(附自己 5s@0.4MP=5m27s 等数据),回复五花八门无标准化——购卡决策靠猜
现有方案无第三方标准基准站;Reddit 报数帖零散;'Use timer node' 帖提议统一计时节点但未成气候
社区方案无标准方案;'Use timer node when you talks about speed'(另一帖)呼吁统一计时规范
当前做法发帖求报数+自己跑模板测;评论区数字互相不可比(5090 报 69s,有人 40s 用 3步 lora 但'质量不好')
LoRA 加载器缺少按步数区间控制(start/end step)与可靠的预览图加载,且 civitai.red NSFW 预览需手动配 key
产品假设做一个集 step 区间控制+Civitai 元数据预览+批量开关的超级 LoRA 加载器节点,填补 rgthree 与原生之间的空档
竞品格局部分覆盖:预览侧有 XTNodes/Visualizer,step 控制侧无整合——'全功能 LoRA 管理加载器'仍是无主之地
现场证据与现有方案
场景rgthree Power Lora Loader 是事实标准的 LoRA 管理节点,用户要求加 hooks/keyframes 按 step 开关 LoRA(进阶控制刚需);同周另一 issue 报 Firefox 预览全挂
现有方案原生 loader 有 step 控制无便利性;XTNodes Load Lora with Previews 提供 Civitai hash 拉取触发词/预览;ComfyUI-Lora-Visualizer 可视化 tag
当前做法用 ComfyUI 原生 LoRA Loader(有 start/end 但无 rgthree 的批量便利),两者取一
Civitai 站内 LoRA 训练器对新底模(Anima/MiniMax)连续故障一周+,用户 Buzz 被退回无从训练
产品假设新底模发布日即支持的第三方 LoRA 训练服务(吃 Civitai trainer 故障窗口的溢出需求)
付费信号明确付费:用户已在花 Buzz(平台币)训练,退款说明付费意愿存在
竞品格局云端 trainer 有 RunComfy;'新底模当日支持'的快速跟进训练服务是差异点
现场证据与现有方案
场景SDXL/Illustrious 能训但 Anima/MiniMax 数据集几分钟即失败,持续一周+——新底模的 LoRA 供给瓶颈卡在平台工具层,创作者想给新模型出 LoRA 无门
现有方案Civitai 站内训练器(故障中);本地 AI Toolkit/OneTrainer(门槛高);RunComfy trainer(云端收费)
本地跑'真实感无审查'生成:新手不知道哪个模型能替代 nano banana pro,社区被重复提问淹没且互相羞辱
产品假设做一个按'任务+显存+审查偏好'检索的本地模型推荐器(数据源 Civitai API+评测帖挖掘),内容站+工具混合
付费信号间接付费:nbp/Gemini 订阅是现状替代
竞品格局模型选型导航是空白;但偏内容站,工具化空间一般
现场证据与现有方案
场景6GB VRAM 新手求'best model for realism gens like nbp but uncensored',评论区老鸟烦躁('每周 500 次同题')——反映模型发现/选型信息供给严重不足
现有方案civitai.red(模型发现,但信息密度低);Reddit 搜索(散);无'按任务+硬件选模型'的决策工具
社区方案部分:civitai.red 被建议置顶;有人推荐 Wan2GP+Krea 2 identity edit(10GB 3-5分钟/图)
当前做法发帖问→被喷'use search';自己海量试模型
热门节点包在新版 ComfyUI 上连环断裂:Impact-Pack 在 V0.30.2+ 失效、WAS 在 Python 3.11 挂、rgthree 装不上、Custom-Scripts 工作流目录迁移后丢
产品假设升级前'兼容性预检'工具:扫描已装节点与目标版本已知冲突,给出锁定/升级建议清单
竞品格局RunComfy(云)与整合包已覆盖部分;本地'兼容性体检+回滚'工具仍缺
现场证据与现有方案
场景本周 7 个主流节点仓库共 14 条 issue,其中 6 条是'新版 ComfyUI/Python 后节点失效'——版本兼容是节点生态常态性阵痛,用户每次升级都在赌
现有方案ComfyUI Manager 可装节点不解兼容;RunComfy/Wonderful Launcher 帮修红节点(云端/桌面整合包形态)
当前做法锁定旧版 ComfyUI 不敢升级;或在 issue 区排队等修复
长任务无系统级完成通知(切窗就不知道生成了);VAE 解码 OOM 直接掉到 tiled 而不先试卸载重试
产品假设系统级通知小插件(Win/macOS/手机 push 通道)一小时级别 MVP,引流性质;OOM 重试策略可做成 patch 节点
竞品格局通知侧基本空白(小而美独立插件机会);解码策略侧属核心仓域能力
现场证据与现有方案
场景两条同周 feature request:a) Windows 原生通知(生成完/失败)可选开关;b) VAE 解码 OOM 时先释放其他模型重试常规解码再降级 tiled(6GB 卡的画质/速度权衡)
时间成本a) 每次长生成数十分钟无效等待注意力;b) 每次解码损失秒级-分钟级
现有方案通知:Custom-Scripts 有浏览器通知(无系统级);OOM:--disable-dynamic-vram 等开关粗糙
当前做法a) 干等或反复切窗看;b) 手动 tiled 解码损失速度/质量