tech · aivideo.site 团队
技术分享:基于 ComfyUI + Wan2.2 的 AI 视频生成管线实践
拆解 aivideo.site 的图生视频管线:Wan2.2 双模型 + LightX2V LoRA 的实现细节
技术ComfyUIWan2.2管线
技术分享:基于 ComfyUI + Wan2.2 的 AI 视频生成管线实践
aivideo.site 的图生视频(I2V)阶段基于 ComfyUI + Wan2.2 构建。本文将拆解管线的实现细节。
架构概览
分镜图片 ─→ ComfyUIVidClient(wan.aivideo.site)
│ POST /upload/image(上传分镜图)
▼
build_i2v_workflow() → POST /prompt
▼
GET /history 轮询(10s 间隔,超时 300s)
▼
GET /view 下载视频片段Wan2.2 双模型管线
Wan2.2 图生视频使用 high_noise + low_noise 双模型 + LightX2V LoRA:
UNETLoader(high_noise) ─→ LoraLoader(high) ─→ ModelSamplingSD3 ─→ KSampler #1 (step 0-2)
UNETLoader(low_noise) ─→ LoraLoader(low) ─→ ModelSamplingSD3 ─→ KSampler #2 (step 2-4)
CLIPLoader ─→ CLIPTextEncode(positive) ─────→ KSampler #2
LoadImage ──→ WanImageToVideo ──→ VAEDecode ──→ CreateVideo(fps) ──→ SaveVideo帧数公式:帧数 = fps × 分镜时长 + 1(+1 保留起始帧)。
关键设计
- 独立服务:文生图(comfyui.aivideo.site)与图生视频(wan.aivideo.site)拆分为两个独立 ComfyUI 服务,便于分别维护与扩容;
- 超时保护:I2V 超时 300s、轮询间隔 10s,避免长时间阻塞;
- 单分镜容错:单个分镜失败不阻断全局,记录错误后继续处理其余分镜;
- 参数快照:生成时按项目创建时的配置快照构建客户端,不受后续配置修改影响。
效果与性能
- 单段图生视频约 2-5 分钟(与分辨率、时长相关);
- 30 秒短片全流程约 15 分钟;
- 8 种画面风格(写实 / 动画 / 动漫 / 3D / 赛博朋克 / 水墨 / 像素 / 油画)均通过风格提示词映射注入。
完整管线架构见架构总览文档。