文章目录
- 一、AI 视频创作缺的不是模型,是流水线
- 二、项目概览:双模块并行的产品架构
- 2.1 两大核心模块
- 2.2 Studio:把漫剧 SOP 内建进平台
- 2.3 Playground:即开即用的生成工具台
- 2.4 版本演进脉络
- 三、系统架构深度解析
- 3.1 整体架构图
- 3.2 目录结构解析
- 3.3 前端技术栈
- 3.4 后端技术栈
- 四、模型目录系统(Model Catalog):全篇最值得学的架构
- 4.1 问题背景
- 4.2 三层架构设计
- 4.3 YAML 定义结构
- 4.4 构建与校验
- 4.5 两种运行模式
- 五、模型适配层设计
- 5.1 工厂 + 适配器模式
- 5.2 支持的 AI 模型全景
- 5.3 Provider 路由机制
- 六、存储架构与媒体管理
- 6.1 Local-first 策略
- 6.2 两种存储模式
- 6.3 核心术语
- 七、Studio 流水线深度解析
- 7.1 全链路时序
- 7.2 资产生成类型
- 7.3 R2V(参考生视频):角色一致性的关键
- 八、Playground 架构解析
- 8.1 设计定位
- 8.2 核心架构
- 8.3 并发任务队列
- 九、配置系统设计
- 9.1 五种配置模式
- 9.2 配置优先级
- 9.3 MuleRun 双模式认证
- 十、环境准备与安装部署
- 10.1 系统要求
- 10.2 安装 Python
- 10.3 安装 Node.js
- 10.4 安装 FFmpeg
- 10.5 获取 DashScope API Key
- 10.6 一键启动(推荐)
- 10.7 分别启动(开发调试用)
- 10.8 Docker Compose 部署
- 10.9 启动验证
- 十一、配置模式实战
- 11.1 模式 1:DashScope-only(推荐起步)
- 11.2 模式 2:DashScope + OSS(可选增强)
- 11.3 模式 3:DashScope + Kling 原厂
- 11.4 模式 4:DashScope + Vidu 原厂
- 11.5 模式 5:全配置 + MuleRun
- 11.6 配置组合说明
- 十二、Playground 使用实战
- 12.1 界面概览
- 12.2 实战一:图像生成
- 12.3 实战二:图生视频(I2V)
- 12.4 实战三:参考生视频(R2V)
- 12.5 使用 Prompt 模板
- 十三、Studio 漫剧生产全流程
- 13.1 创建项目
- 13.2 剧本分析
- 13.3 资产生成
- 13.4 分镜视频生成
- 13.5 配音合成
- 13.6 合成导出
- 十四、模型参数配置详解
- 14.1 通用参数
- 14.2 图像模型参数
- 14.3 视频模型参数
- 14.4 参数调优决策树
- 十五、API 使用指南
- 15.1 API 文档
- 15.2 常用 API 示例
- 15.3 集成到自己的应用
- 十六、常见问题排查(FAQ)
- 16.1 启动问题
- 16.2 生成问题
- 16.3 配置问题
- 16.4 日志查看
- 十七、技术亮点总结
- 17.1 架构亮点
- 17.2 工程亮点
- 17.3 产品亮点
- 十八、总结与学习路径
一、AI 视频创作缺的不是模型,是流水线
从文本到图像、从图像到视频,AI 生成技术的每一次突破都在降低内容创作的门槛。然而对于漫剧、短视频这类需要完整叙事链路的内容形态,单纯的模型调用远远不够——角色要在第 1 集和第 12 集长得一样,场景风格要全片统一,分镜要按剧本节奏切分,对白要配音,素材要合成导出。这些工作不会因为你换了一个更强的视频模型而自动消失。
你需要的是一套从剧本到成片的完整生产系统。
2025 年底,阿里巴巴星莲团队(StarLotus)开源了LumenX——一个 AI 原生的短漫剧 & 视频创作平台。它不是又一个"套壳"的 AI 画图工具,而是真正将创意文本转化为可发布动态视频的全链路生产平台。官方 Slogan“Render Noise into Narrative”(将噪声渲染为叙事),精准地道出了它的定位差异:
- 不是简单的图像/视频生成器,而是叙事内容生产平台;
- 不是零散工具的堆砌,而是端到端的创作流水线;
- 不是仅供技术人员的 API 封装,而是面向创作者的可视化工作台。
截至 v1.2.1 版本,LumenX 已支持10+ AI 模型、6 种生成模式、完整的漫剧生产流水线,以及独立的图像/视频生成工具台。
<