BM 影视梦工厂 V3.0

一次创作,多形态输出。从剧本到漫剧、小说、广播剧、数字人,AI 驱动的全格式智能影音生产线。

漫剧中心 小说中心 广播剧中心 数字人中心
文档版本 v3.0 · 2026-06-16 · 后端 FastAPI + 前端 React/Vanilla JS SPA + AI 双机集群 · 前端 SPA 重构中

一、项目概述

AI漫剧工厂是一套面向内容创作者的智能影音生产线。用户输入一个创意(文本/梗概/脚本),系统通过 LLM 剧本创作、AI 图像生成、视频合成、语音克隆、口型同步等技术链路,自动输出漫剧视频、小说、广播剧、数字人口播视频等多种形态的内容。

1+4
中枢+中心
211
API 端点
43
服务模块
2
GPU 节点
14
模型/工具
39
数据库表
核心特性
  • 四中心一体化:漫剧、小说、广播剧、数字人四大内容形态共享同一底层资源(角色/场景/道具/剧本)
  • 一键全链路:从剧本 → 分镜 → 图像 → 配音 → 视频合成 → 导出,全自动化流水线
  • 跨格式互转:漫剧 ↔ 小说 ↔ 广播剧 ↔ 数字人口播,LLM 驱动的格式无损转换
  • 双机异构计算:本地 RTX 2080 Ti(图像/视频生成)+ NAS RTX 3060(语音/口型同步),并行流水线
  • 智能资源匹配:LLM 驱动的分镜-资源智能匹配,自动绑定角色/场景/道具/参考音
  • 导演案例学习:扫描视频库自动分析镜头语言,积累导演知识库辅助创作

二、硬件配置

主服务器 Windows 11
RTX 2080 Ti · 22.5GB VRAM · 42°C · 127.0.0.1
后端 API (8000) 前端 (5173) Ollama (11434) ComfyUI (8188) SadTalker (9860) LivePortrait (9870)
NAS 算力节点 Ubuntu 24.04
RTX 3060 · 12GB VRAM · 46°C · 192.168.3.140
Worker API (9100) ComfyUI (8188) GPT-SoVITS (9880) MuseTalk (9881)

主服务器 · 计算资源

LLM 推理:Ollama (qwen3:14b, deepseek-r1:14b, qwen3.5:9b)
图像生成:ComfyUI z-image-turbo (AuraFlow) / LTX I2V
视频合成:FFmpeg + 前端 canvas 合成
口型同步(本地):SadTalker (图片驱动) / LivePortrait (视频驱动)

NAS 节点 · 计算资源

语音合成:GPT-SoVITS 语音克隆 + TTS
口型同步(NAS):MuseTalk (实时驱动)
图像生成(备选):ComfyUI(本地繁忙时自动路由)
服务管理:Worker API 统一启停/健康检查

三、大模型清单

Qwen3:14B阿里通义千问 3
项目级 LLM 推理核心。剧本生成、导演拆镜、角色分析、连续性检查、知识提取、翻译等主要智能任务。
ollama主模型 OLLAMA
DeepSeek-R1:14B深度求索 R1
强推理模型,用于连续性检查、逻辑审校、导演案例分析等需要深度推理的任务。与 Qwen3 互为补充。
ollama审校 OLLAMA
Qwen3.5:9B阿里通义千问 3.5
轻量级 LLM,用于资源需求提取、名称分析、关键词分类等低延迟场景。快速响应替代方案。
ollama辅助 OLLAMA
z-image-turboAuraFlow + Qwen 编码器
主图像生成模型。基于 AuraFlow 架构 + Qwen 3.4B 中文文本编码器,8 step 快速推理。原生支持中文 prompt,用于角色参考图、场景关键帧、道具图、分镜图生成。
comfyui图像 ComfyUI
LTX-Video 0.9.1 I2V图像转视频
视频生成模型。将分镜关键帧 + 动作描述转换为 25 帧短视频,支持 854x480 分辨率,8 步推理。
comfyui视频 ComfyUI
GPT-SoVITS语音克隆 TTS
语音合成引擎。支持角色声音克隆(参考音频 + 文本 → 目标语音),用于广播剧配音、数字人口播。
gpt-sovits音频 NAS 9880
MuseTalk实时口型同步
基于音频驱动的实时口型同步模型。输入角色图像 + 语音 → 输出口型同步视频。部署在 NAS 端。
musetalk口型 NAS 9881
SadTalker图像驱动口型
基于单张图像的说话人脸生成。输入角色图片 + 语音 → 输出说话视频。部署在本地。
sadtalker口型 Local 9860
LivePortrait视频驱动口型
基于视频的面部动画迁移。输入角色图片 + 驱动视频 → 输出面部表情匹配视频。部署在本地。
liveportrait口型 Local 9870

四、一中枢 + 四中心

系统顶层架构升级为「一创作中枢 + 四业务中心 + 六大资源库」。创作中枢负责项目调度、世界观记忆、任务编排和质量审查;四中心负责各形态内容生产;六大资源库提供全平台共享数据。

🧠 创作中枢(新增)

项目工作台 — 全平台项目总览,快速切换中心

世界观记忆 (Universe Memory) — 角色长期状态、关系变化、道具归属、时间线、伏笔追踪,多集连续性保障

任务调度 — 统一任务队列,优先级管理,Worker 分配

模型调度 — GenerationExecutor 抽象层,ComfyUI/Direct/Remote/Cloud 可替换执行器

质量审查 — ReviewAgent + ContinuityAgent 审核面板

四大业务中心

4.1 漫剧中心(核心业务 — 优化后主流程)

创意/梗概 读取宇宙状态 剧本生成 分镜拆解 运镜方案 资源锁定 分镜图生成 人工确认 480p 视频 配音/音效 超分到1080p 剪辑合成导出
优化后完整管线(基于架构评审建议)

1. 创意/梗概:输入故事创意、世界观梗概、角色简要

2. 读取宇宙状态:从宇宙系统读取角色当前状态、时间线、未解决伏笔、道具归属,生成本集上下文包

3. 剧本生成:LLM 基于上下文包生成结构化剧本(对白/旁白/动作描述/音效)

4. 分镜拆解:LLM 将剧本段落拆解为结构化分镜(镜头类型/景别/运镜/台词/角色定位)

5. 运镜方案:调用运镜知识库,为每个镜头匹配专业镜头语言(推/拉/摇/移/跟/正反打)

6. 资源锁定:角色/场景/道具资产锁定,确认后派生版本而非覆盖

7. 分镜图生成:ComfyUI z-image-turbo 生成高清静帧,人工确认后锁定

8. 480p 分镜视频:ComfyUI LTX-Video 分镜图+运动提示 → 25帧短视频(854×480, 8 steps)

9. 配音/音效:GPT-SoVITS 角色配音 + FFmpeg 音效/BGM

10. 超分到 1080p:统一插帧、超分、调色、降噪、锐化

11. 剪辑合成导出:FFmpeg 拼接+混音+字幕+转场,输出 1080p 成片

12. 写回宇宙:生成本集记忆更新,人工确认后写回宇宙系统

4.2 小说中心

导入剧本/设定 卷纲生成 章纲生成 LLM 逐章创作 一致性检查 导出 TXT/EPUB

小说中心将漫剧剧本自动转换为小说格式(含环境描写、心理活动、对话润色),支持多卷/多章管理和字数统计。

4.3 广播剧中心

导入剧本 角色分配 引导音轨生成 配音生成 (GPT-SoVITS) BGM/音效添加 混音合成 导出 MP3/WAV

多轨音频编辑(对白轨/旁白轨/音效轨/BGM轨),GPT-SoVITS 角色配音,FFmpeg 多轨混音。

4.4 数字人中心

创建数字人(绑定角色) 编写口播脚本 语音生成 口型同步 视频合成导出

基于角色形象 + 声音克隆的数字人短视频生成,适用于口播、新闻播报、知识科普等场景。

跨中心格式转换

任意中心的内容可通过 ScriptConversionService 无损转换到其他中心:

COMIC ↻ NOVEL COMIC ↻ AUDIO COMIC ↻ HUMAN NOVEL ↻ AUDIO NOVEL ↻ HUMAN AUDIO ↻ HUMAN

转换后自动转换角色/场景/道具引用关系,适配目标格式规范。

五、六大资源库与约束体系

六大资源库是四中心共享的"创作素材池",每个资源在不同中心间保持全局唯一标识,支持跨中心复用和一致性约束。

👤
角色库
漫剧角色↔小说人物↔广播剧声优↔数字人主播,全局复用
🏠
场景库
漫剧场景↔小说环境↔广播剧音景,共享空间资源
📦
道具库
漫剧道具↔小说物品↔广播剧音效,剧情一致性保证
📄
剧本库
统一剧本仓库,四中心可读取和格式转换
🎵
声音库
角色声音克隆模型,跨广播剧/数字人共享
🎬
导演知识库
DirectorCase 镜头分析 + KnowledgeAgent 知识体系,创作参考

5.1 资源库如何发挥约束作用

资源库不仅是素材存储,更是创作约束引擎——每个资源携带的属性信息在管线各环节被主动读取并转化为约束条件:

角色约束
character.name → 分镜对话的角色归属
character.gender+age → 语音克隆参数
character.appearance → 图像生成 prompt 注入
character.clothing → 角色图一致性约束
character.personality+backstory → LLM 剧本行为约束
character.voice_ref → GPT-SoVITS 声线复用
场景约束
scene.scene_type → 分镜背景类型
scene.time_of_day → 图像光照条件
scene.weather → 环境氛围参数
scene.layout → 构图空间约束
scene.image_ref → 关键帧一致性
道具约束
prop.prop_type → 分镜中出现条件
prop.appearance → 图像 prompt 约束
prop.plot_role → 剧本中功能约束
prop.era → 时代一致性约束

5.2 资源提取与匹配流程

ResourceRequirementService 工作流程
① 提取从剧本内容中正则解析 → 检测角色名/场景描述/道具关键词
② 画像LLM 智能分析:角色年龄/性别/角色类型,场景 indoor/outdoor/时间/天气,道具类型/时代/外观
③ 匹配与项目中已有资源对比(名称模糊匹配 + 属性相似度),自动绑定最合适资源
④ 创建未匹配的需求 → 自动创建新资源并生成配套图像
⑤ 分发资源 ID 注入分镜 → 图像/视频/配音管线读取约束生成最终内容

5.3 约束关系详细

约束层来源作用目标作用说明
角色外观 character.appearance ImageAgent · 分镜图像 ComfyUI prompt 中注入角色外貌描述,保证同一角色在多个分镜中外观一致
角色声音 character.voice_ref VoiceAgent · GPT-SoVITS GPT-SoVITS 加载角色参考音频 [角色名]_ref.wav,后续所有对白使用克隆声线
角色行为 character.personality + backstory LLM · 剧本/对白生成 Qwen3 在生成对白时注入角色人格/背景,约束言行一致性
场景背景 scene.image_ref + layout ImageAgent · 分镜图像 同一场景的多个分镜共享背景描述,保证空间环境一致
场景氛围 scene.time_of_day + weather ImageAgent · 光照参数 ComfyUI prompt 注入"黄昏/雨天/室内暖光"等氛围描述
道具出现 prop.plot_role + PropUsage ContinuityAgent · 剧情跟踪 ContinuityAgent 检查道具在剧情中的出现/消失是否符合剧情逻辑
分镜景别 shot.shot_type ImageAgent · 构图 全景/中景/近景/特写 → ComfyUI prompt 注入距离和构图描述
运镜方式 shot.camera_movement VideoAgent · 视频生成 静态/推/拉/摇/移/跟 → ComfyUI LTX 视频 workflow 注入运动描述
连续性检查 ContinuityAgent 所有资源 LLM 检查:角色行为一致性 / 时间线连贯性 / 世界观一致性 / 伏笔追踪 / 场景一致性 / 角色关系一致性
GPU 资源门控 ResourceManager LLM + ComfyUI text_stage() / gpu_stage() 上下文管理器,防止 Ollama 与 ComfyUI 同时争用 GPU VRAM

5.4 跨中心资源复用示例

场景:角色"林晓"的跨中心流转

漫剧中心:创建角色林晓(设定:女/25岁/程序员/蓝白风衣)→ 生成参考图像 → 所有分镜使用该外观约束

小说中心:林晓角色属性(personality/backstory)→ 注入 LLM 小说创作,保证角色性格一致

广播剧中心:林晓声音克隆(voice_ref = 林晓_ref.wav)→ 所有对白用同一声线 → 混音合成

数字人中心:林晓形象 + 声音 → 数字人主播 → 口播脚本 → GPT-SoVITS + SadTalker → 视频导出

整个过程中,角色、场景、道具、剧本资源通过全局 asset_id 串联,任意中心修改资源属性将影响所有关联内容。

5.5 世界观记忆系统 (Universe Memory) — 多集连续性保障

超越单集素材库 — 剧集宇宙一致性层

当前资源库解决了单集内的角色/场景/道具一致性。世界观记忆在此基础上增加时间维度,保障多集连载的长期连续性:

生成前约束读取
上一集摘要 → 角色当前状态 → 未解决伏笔 → 当前时间线 → 已出现道具
生成后状态更新
角色状态更新 → 道具归属变更 → 关系变化 → 伏笔解决/新增 → 下一集约束包
数据结构
CharacterMemory(键值对) + TimelineEvent(事件序列) + CharacterRelation(关系图谱) + PropUsage(道具轨迹)

状态:CharacterMemory / CharacterRelation / TimelineEvent / PropUsage 表已存在,ContinuityAgent 已实现六维检查。完整的生成前→生成后双阶段约束流待集成。

六、知识库

知识库是 AI漫剧工厂的"科学大脑",专为科普漫剧和内容创作中的知识严谨性设计。它通过 LLM 实现从知识提取、结构化、科普化翻译到准确性校验的全链路管理,同时扩展支持导演镜头案例的学习与复用。

6
知识类型
2
子系统
12+
API 端点
2
集成业务点

6.1 核心功能

知识提取extract-knowledge
从剧本/文章中自动提取知识点,LLM 分析输出结构化字段:domain, difficulty, title, description, key_concepts, related_topics
知识结构化generate-structure
将零散知识点组织为学习路径 + 子主题 + 前置知识依赖,形成知识图谱结构
科普化翻译translate-to-popular
将专业/技术内容翻译为科普风格(可选:科普文/故事化/问答式),降低观众理解门槛
准确性校验check-accuracy
LLM 比对科普内容与原始知识点,标记事实性错误和偏差,返回修正建议
联网研究research-concept
DuckDuckGo 联网搜索 + LLM 深度分析,输出维度:科学解释、现实依据、关键原理、常见误解、虚构vs现实
导演案例学习DirectorCase
扫描视频库 → FFmpeg 场景检测 → 关键帧提取 → LLM 分析8个镜头维度 → 存入知识库供检索

6.2 知识类型

类型说明来源
fact事实性知识条目LLM 提取/手动创建
concept概念定义与说明LLM 提取/联网研究
relation概念/人物之间的关系LLM 提取/手动创建
event事件记录LLM 提取/手动创建
timeline时间线自动生成/手动创建
director_case导演镜头案例分析DirectorCaseService (视频分析)

6.3 与其他业务模块的关联

知识库 → 业务模块 数据流
剧本生成
触发点:每次 LLM 生成剧本时
KnowledgeAgent 自动从剧本梗概中提取关键词
联网研究每个关键词 → 存入知识库
取最近 20 条知识注入 LLM prompt:
"请充分利用上述知识库中的科学信息,让剧本中的科技/科学内容更加严谨和符合现实逻辑"
剧集增强
触发点:POST /episodes/{id}/enrich-knowledge
读取剧集所有分镜的文本内容
提取科学关键词 → 逐个联网研究
结果自动存入知识库(upsert 去重)
可用于后续剧集的剧本生成参考
连续性检查
触发点:ContinuityAgent 审校过程
知识库中的世界观条目(category=世界观)
作为 continuity 检查的参考基准
角色/道具的 consistency 校验
前端知识库页面含"引用到连续性检测"按钮
科普漫剧项目
ProjectType 包含 "knowledge" 类型
项目级项目管理知识条目
知识库页面可按 project_id 筛选
剧本生成时自动关联项目知识
导演案例 → 创作管线
扫描与导入
扫描视频目录(支持 mp4/mov/avi/mkv/webm/m4v)
FFmpeg 场景检测 → 关键帧提取(JPG)
LLM 分析 8 个镜头维度 → 存入知识库(type=director_case)
存储结构
knowledge_id 前缀: "DC_"
content 字段: 镜头分析 JSON
tags: 镜头类型/运镜方式/情绪标记
category: "导演整理"
检索复用
POST /director-cases/search-similar
按描述 + 技巧类型关键词匹配
结果供导演拆镜时参考
未来可扩展为 shot matching 参考库

6.4 导演案例分析维度

每个镜头经 LLM 分析后输出以下 8 个维度,支持按技术类型检索相似镜头:

维度可能取值LLM 分析依据
景别特写/近景/中景/全景/远景/大远景画面主体占比
运镜方式固定/推/拉/摇/移/跟/升降/手持/斯坦尼康镜头运动轨迹
构图特点三分法/对称/引导线/框架构图/留白画面布局
光线风格自然光/侧光/背光/顶光/柔光/硬光/伦勃朗光/剪影光照分布
色彩基调暖调/冷调/高饱和/低饱和/单色/对比色色调分布
情绪表达紧张/悲伤/欢快/神秘/庄重/浪漫/悬疑画面氛围
运镜目的自由文本LLM 语义理解
适用场景自由文本LLM 语义理解

6.5 知识库界面

前端入口位于侧边栏"知识库"(图标:Collection),页面功能:

知识列表
表格展示:ID、标题、分类(彩色标签)、内容预览、标签、状态。支持按项目/分类/关键词过滤
知识提取
输入待分析文本 → 指定领域 → LLM 提取 → 结果预览(domain/difficulty/知识要点)→ 一键保存全部
业务引用
每条知识支持"引用到剧本生成"和"引用到连续性检测"操作,直接注入对应业务流程

七、标准生产状态机

每个项目、剧集、分镜、资源都经过统一状态流转,确保生产过程可追踪、可回滚、可审计。状态机是创作中枢的核心编排依据:

创作中 生成中 待审核 已确认 已锁定 已导出
draft 创作中
初始状态。剧本编写、角色设定、场景规划阶段,资源可自由修改和重生成。
generated 生成中
AI 管线执行中。ProducerAgent 编排各 Agent 按 DAG 顺序执行,进度由 TaskQueue 追踪。
reviewed 待审核
生成完成待人工或自动审核。ReviewAgent 合规/质量/敏感/风格四维审核 + ContinuityAgent 连续性检查。
confirmed 已确认
审核通过。内容可被其他中心引用,角色/场景图进入下一集的约束体系。
locked 已锁定
最终版。后续剧集默认不能重生成此资源,只能派生版本。角色图/声音/场景图一旦 locked,多集一致性强制保证。
exported 已导出
成片已导出。ExportAgent 完成 FFmpeg 拼接+混音+字幕叠加,输出最终文件。

八、GenerationExecutor 抽象层(新架构)

将 ComfyUI 从"核心依赖"降级为"可替换执行器",所有生成任务通过抽象接口调用:

ComfyUIExecutor

当前主力。z-image-turbo / LTX I2V 等 ComfyUI 工作流。
本地 :8188 或 NAS :8188,ComfyUIRouter 自动路由。

DirectModelExecutor

直接调用模型 API(Ollama 等),无需 ComfyUI 编排。
用于 LLM 推理、GPT-SoVITS 等非 ComfyUI 任务。

RemoteWorkerExecutor

NAS Worker API 远程执行。GPT-SoVITS / MuseTalk 等。
通过 HTTP 调用,兼容任何远程服务。

CloudAPIExecutor

未来扩展。云端 API 执行(如 FLUX Pro、ElevenLabs 等)。
统一接口,业务层无需修改。

九、API 体系总览

后端 FastAPI 服务分 37 个路由模块,共计 211 端路由。

📋 CRUD 核心
projects/ · episodes/ · characters/ · scenes/ · props/ · assets/
scripts/ · shots/ · tasks/ · workflows/
标准增删改查 + 批量操作 + 软删除
🤖 AI Agent
producer/ · director/ · asset-agent/ · image-agent/ · video-agent/
voice/ · lipsync/ · export/ · knowledge/ · review/
LLM/ComfyUI 驱动的智能生成管线
🏢 v3 业务中心
novels/ · audio-dramas/ · digital-humans/
script-conversion/ · centers/ · resource-requirements/
四中心 CRUD + 格式转换 + 跨中心编排
🔌 辅助系统
auth/ · monitor/ · search/ · events/ · models/
subtitle/ · translation/ · marketing/ · continuity/ · overseas/
认证 · 监控 · 搜索 · SSE · 字幕 · 翻译 · 营销 · 连续性 · 海外导出

详细 API 文档请查看 API 文档 页面或直接访问 /docs(Swagger UI)。

十、部署架构

服务依赖拓扑
Ollama (11434) ──────────┬─→ LLM 推理 (Qwen3/DeepSeek/Qwen3.5) │ ComfyUI (8188) ──────────┼─→ 图像生成 (z-image-turbo AuraFlow) + 视频生成 (LTX I2V) │ FastAPI 后端 (8000) ─────┤──→ 所有 API 路由 │ Vite 前端 (5173) ←───────┘ │ ├──→ NAS: Worker API (9100) → GPT-SoVITS (9880) / MuseTalk (9881) / ComfyUI (8188) │ ├──→ SadTalker (9860) / LivePortrait (9870) —— 本地口型同步 │ └──→ SQLite 数据库 (ai_comic_studio.db)

启动顺序

1. Ollama (LLM 池)
2. ComfyUI (图像引擎)
3. NAS 远程服务(GPT-SoVITS / MuseTalk / ComfyUI)
4. 后端 FastAPI
5. 前端 Vite DevServer

启动器功能

单文件 EXE 一键启动全部服务
端口检测 + 冲突释放(TIME_WAIT 等待)
健康检查轮询(60次/5s间隔)
停止时清理所有子进程
系统托盘驻留(pystray),双击打开前端

双机路由策略

条件路由结果
本地 ComfyUI 健康且 queue_load ≤ 0→ 本地生成(默认)
本地 queue_load > 0(繁忙)→ 检查 NAS ComfyUI
NAS ComfyUI 不健康或 GPU 利用率 > 25%→ 继续使用本地(即使繁忙)
本地不健康→ 自动启动 NAS ComfyUI 接管
视频生成(LTX)→ 始终本地(需本地专用 workflow)
配音生成→ 始终 NAS (GPT-SoVITS)
口型同步→ SadTalker(本地) / MuseTalk(NAS) 可选

资源调度关系

远程服务发现与启停

每个 NAS 节点运行 Worker API(:9100),对外暴露服务管理端点
GET /health — 节点健康 + 已注册服务列表
POST /services/start?name=comfyui — 远程启动指定服务
POST /services/stop?name=comfyui — 远程停止服务
启动器通过 WORKER_NODES 配置发现 NAS,启动时依次调用 /services/start

双机资源调度策略

图像生成:本地 ComfyUI 为主,NAS 为备份(queue_load + GPU 利用率双条件判定)
配音:始终路由到 NAS GPT-SoVITS(GPU 需求高,本地不部署)
口型同步:本地 SadTalker(轻量)与 NAS MuseTalk(高质量)可选
LLM 推理:始终本地 Ollama(NAS 无需部署大模型推理)

网络通信

内网千兆以太网,延迟 < 1ms,带宽 125MB/s
后端通过 HTTP 调用远程服务,异步非阻塞(httpx.AsyncClient)
NAS 共享目录通过 SMB 挂载到主服务器 Z:
资源文件通过共享目录传递(无需 HTTP 传文件)

降级与故障容忍

NAS 离线 → 配音自动降级 Edge-TTS,口型回退 SadTalker 本地
NAS ComfyUI 繁忙 → 本地 ComfyUI 兜底(即使本地也在排队)
主服务器离线 → 所有服务停摆(NAS 只计算不调度)
启动器健康检查超时 600s,失败时标记服务异常但不阻塞启动

十一、项目文件结构

D:\ai影视/ ├── backend/ # FastAPI 后端(Python 3.12.8, venv) │ ├── app/ │ │ ├── api/ # 37 个路由模块 │ │ ├── models/ # 21 个 SQLAlchemy ORM 模型 │ │ ├── schemas/ # 27 个 Pydantic 请求/响应模型 │ │ ├── services/ # 44 个业务服务 │ │ ├── workflows/ # DAG 工作流引擎 + 节点处理器 │ │ ├── clients/ # 外部服务客户端(ComfyUI/GPT-SoVITS/SadTalker/LivePortrait) │ │ ├── repositories/ # 数据访问层 │ │ ├── config.py # Settings(pydantic-settings) │ │ ├── database.py # SQLAlchemy 初始化 │ │ └── main.py # FastAPI 入口 │ ├── static/ # 静态说明页面 │ ├── assets/ # 输出资源(images/videos/audio/exports/lipsync) │ ├── storage/ # 文件存储 │ └── .env # 环境配置 ├── frontend/ # React + Vite 前端(SPA 重构中) │ └── src/ │ ├── api/ # 28 个 API 调用模块 │ ├── views/v3/ # 四中心页面(13+ 页面) │ ├── router/ # 路由定义(27+ 路由) │ ├── layout/ # 侧边栏 + 顶栏布局 │ ├── components/ # 4 个共享组件 │ └── services/ # 业务逻辑(SmartMatch/Batch/LLM) ├── tools/launcher/ # 启动器 ├── scripts/ # 运维脚本 ├── docs-site/ # 文档站(Python 静态服务器 :8080) └── logs/ # 日志

十二、关键配置(.env)

变量说明
COMFYUI_BASE_URLhttp://127.0.0.1:8188本地 ComfyUI 地址
GPT_SOVITS_BASE_URLhttp://192.168.3.140:9880NAS GPT-SoVITS 地址
MUSETALK_BASE_URLhttp://192.168.3.140:9881NAS MuseTalk 地址
OLLAMA_BASE_URLhttp://127.0.0.1:11434Ollama LLM 地址
REMOTE_COMFYUI_ENABLEDTrue启用 NAS ComfyUI 作为备份
REMOTE_COMFYUI_WORKER_URLhttp://192.168.3.140:9100Worker API 地址
WORKER_NODES192.168.3.140:9100|comfyui+gpt-sovits启动时自动远程启动服务
COMFYUI_LOCAL_QUEUE_BUSY_THRESHOLD0本地队列忙阈值(0=立即启用远程备份)
REMOTE_COMFYUI_MAX_GPU_UTILIZATION25NAS GPU 利用率 > 25% 时跳过
IMAGE_WORKFLOW_MODEz_image_turboComfyUI 图像工作流模式 (z_image_turbo / stable_sdxl)

十三、开发路线图

完整路线图 → 查看路线图页面

近期计划
  • ✅ 一中枢+四中心+六库架构定型
  • ✅ 完整管线:剧本→拆镜→图像→视频→配音→口型→导出
  • ✅ 跨中心格式互转 + 海外平台导出
  • ✅ 双机 ComfyUI 路由 + 导演案例学习
  • 🔄 前端 SPA 重构(React → Vanilla JS SPA)
  • 🔄 漫剧中心 E2E 验收 + 科普引擎
  • 📋 世界观记忆系统 + GenerationExecutor 抽象层
  • 📋 监控面板 + 用户系统 + 模型热切换
v3.0 · 一中枢+四中心+六库架构 · 后端 FastAPI + 前端 React/Vanilla JS SPA · Built with ❤️