AI视频生成上手指南:Open Generative AI
2026/9/9 17:04:13 网站建设 项目流程

AI视频生成上手指南:Open Generative AI

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

Open Generative AI 是一个可自托管的开源 AI 视频与图像生成工作室,把 Flux、Midjourney、Kling、Sora、Veo 等 400 余个模型接入统一界面,覆盖文生视频、图生视频与唇形同步的完整产出链路。项目采用 MIT 许可证,提供在线版、桌面客户端与本地推理三种启动方式,无需订阅费。

能力与定位速览

功能模块一句话说明关键组件路径
图像生成文生图 / 图生图双模式,单次最多 14 张参考图src/components/ImageStudio.js
视频生成文生视频 40+ 模型、图生视频 60+ 模型,参数随模型自适应src/components/VideoStudio.js
唇形同步肖像+音频或视频+音频生成说话视频,9 个专用模型src/components/LipSyncStudio.js
影视镜头控制机身、镜头、焦段、光圈选择转为提示词修饰src/components/CinemaStudio.js
工作流编排节点编辑器把图像、视频、音频模型连成多步管线src/components/WorkflowStudio.js

Web 版基于 Next.js 的 App Router 构建,入口页面在app/studio/目录;桌面版与共享包packages/studio/复用同一份模型定义,两边能力保持一致。

环境准备与三种启动方式

在线版:免安装,浏览器打开托管地址即可使用全部工作室,模型列表始终跟随最新版本,适合先体验再决定是否自建。

桌面客户端:macOS(DMG)、Windows(NSIS)、Linux(AppImage/DEB)均有预构建安装包;从源码构建则需要 Node 18+:

git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI && npm run setup && npm run electron:dev

注意npm run setup不可省略,它会在装依赖后构建packages/studio等 workspaces 子包,只跑npm install起不来服务。

本地推理:仅桌面客户端支持,内置两条独立引擎。sd.cpp 打包在应用内,在本机跑图像模型,支持 Metal/CUDA/Vulkan/ROCm;Wan2GP 是你在 GPU 机器上自建的 Python+PyTorch 服务,应用通过 HTTP 提交任务,可跑 Flux、Wan 2.2、Hunyuan 等视频与图像模型。硬件上,8GB 内存的机器建议只跑 SD 1.5 级别的小模型,跑 2.5GB 以上的扩散模型推荐 16GB 起,Wan2GP 侧需要 CUDA/ROCm GPU。两者区别:本地推理权重跑在你自己的显卡上、免 API Key;云端模式则把请求发往 API 网关,首次使用需在界面里配置访问密钥。

桌面客户端中的工作室界面:暗色玻璃拟态 UI,顶部为各工作室标签页

从提示词到成片:核心工作流

文生视频

在 Video Studio 输入场景描述,默认展示 40 余个文生视频模型(Kling、Sora、Veo、Seedance、Hailuo 等),主逻辑在 src/components/VideoStudio.js。参数控件会随所选模型自动刷新:宽高比(16:9、9:16、4:3 等)与时长(5/10/15 秒)只列出该模型支持的档位。点击生成后,客户端先提交 prompt 与参数,再轮询任务状态,拿到视频 URL 后写入右侧历史面板,可直接全分辨率下载。

生成工作室界面:顶部输入提示词,切换标签页后选择模型与参数

图生视频

上传一张起始帧图像后,工作室自动切换到 60 余个图生视频模型集(Kling I2V、Veo3 I2V、Runway I2V、Wan I2V、Midjourney I2V),此时提示词变为可选,用来描述期望的运动轨迹。上传过的参考图会进入本地上传历史,下次复用无需再次上传,多参考图模型按你勾选的顺序提交。

唇形同步:音频驱动的说话视频

Lip Sync 提供两种输入模式。「肖像+音频」模式上传人像照片与音频即可得到说话视频,模型含 Infinite Talk、Wan 2.2 Speech to Video、LTX Lipsync 等,分辨率可选 480p 至 1080p;「视频+音频」模式则为现有视频重做口型,模型含 LatentSync、Sync、Veed 等。实现位于 src/components/LipSyncStudio.js,页面刷新后未完成的同步任务会自动恢复轮询。

后期镜头控制

生成素材后,可切到 Cinema Studio 按专业摄影语言微调:机身从 8K 数字机到 70mm 胶片、镜头含变形宽幅与复古定焦、焦段覆盖 8mm 至 85mm、光圈 f/1.4 到 f/11。这些选择会被翻译成镜头语法的提示词修饰项,注入下一次生成,而不是在本地做滤镜处理。

Cinema Studio 的「Classic 16mm Film」机型选项,模拟复古胶片纹理

进阶:批量、API 与模型扩展

Workflow Studio 批量编排

Workflow Studio 用节点编辑器把图像、视频、音频模型连成多步管线,自带模板库与社区工作流,Playground 可以交互式试跑。每条管线同时暴露 API 调用入口,适合把「生成—修图—转视频」这类重复流程批量执行。

提交加轮询的两步 API

src/lib/muapi.js 封装了统一的调用模式:首个请求返回request_id,随后轮询结果端点直至状态完成。自建系统对接时照此写即可:

const res = await muapi.generateVideo({ apiKey, model: 'seedance-2.0', prompt: '霓虹夜街,缓慢推镜', aspect_ratio: '16:9', duration: 5 });

扩展模型列表

全部模型定义集中在 packages/studio/src/models.js,每条含id、参数 schema(分辨率、宽高比、时长支持)与映射到 API 路径的endpoint。新增模型只需在此追加一条定义,Web 端与桌面端随共享包同步生效,不需要改工作室组件。

适用人群、技术栈与资源入口

适合谁:需要统一界面横向比较多模型视频生成效果、或要求数据留在自己机器上的团队;不适合谁:只想零配置开箱即用的用户——云端模式需要访问密钥,本地模式需要自备 GPU。

技术栈:Next.js 15 / React 19 / Tailwind CSS / Electron,npm workspaces 单仓库,共享 UI 库位于packages/studio/

  • 完整安装、本地推理与排错步骤见 README.md
  • 架构与状态管理背景见 project_knowledge.md
  • 问题反馈与社区讨论在仓库的 Issues 区

评估这类自托管 AI 视频生成方案时,最省事的起点是先 clone 仓库,完整跑通一次文生视频链路,再决定是否接本地推理。

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询