tech · aivideo.site 团队
开源模型组合:Qwen 剧本 + IndexTTS 配音集成方案
智能剧本(Qwen LLM)与 AI 配音(IndexTTS)的集成实践
技术QwenIndexTTS开源
开源模型组合:Qwen 剧本 + IndexTTS 配音集成方案
aivideo.site 的剧本创作与配音分别由 Qwen LLM 与 IndexTTS 驱动,两者均为开源 / 免费组件,组合成本可控。
智能剧本(Qwen LLM)
- 推理服务:llama.cpp 推理(OpenAI 兼容 API),模型为 Qwen3.6-35B(gguf 量化版);
- 剧本结构:标题 + 摘要 + 分镜数组(画面描述 / 旁白 / 字幕 / 中英文提示词 / 镜头语言);
- 风格注入:每种画面风格预定义
t2i_tags与i2v_tags,自动注入提示词; - 容错解析:自动剥离 ````json
包裹、合并零散 JSON 对象;从reasoning_content` 提取(适配推理模型); - 字幕策略:字幕强制等于旁白(一字不差),成片烧录字幕与配音完全一致。
# LLMClient 调用示例
client = LLMClient(api_base="http://<host>:8080/v1", api_key="...", model="qwen3.8-27b")
script = client.chat(messages, temperature=0.7, max_tokens=4096)AI 配音(IndexTTS)
- 音色映射:
VoiceStyle→ TTS speaker(男声 / 女声 / 童声),5 种内置音色; - 情感控制:支持
emo_control_method参数; - 时长读取:ffprobe 读取语音真实时长(读取失败兜底使用分镜时长);
- 无配音模式:
voice=none时跳过语音阶段,分镜时长回退。
组合工作流
主题 → ScriptWriter(Qwen 生成剧本)
→ VoiceActor(IndexTTS 逐分镜配音,V2.4 前置到文生图之前)
→ ImageCreator(文生图)→ VideoCreator(图生视频)
→ VideoComposer(逐镜音视频对齐 + 字幕合成)为什么选开源组合
- 0 成本生成:无按量 API 费用,全部基于开源 / 本地组件;
- 可替换:LLM / TTS / ComfyUI 均可自由替换(见配置文档);
- 隐私可控:数据不出本地,支持内网 / 离线环境。