Open Generative AI:开源、可自托管的 AI 视频生成工作室(内置 400+ 模型)
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
Open Generative AI 是一个开源(MIT 协议)的 AI 视频与图像生成工作室,支持自托管,跑在自己的机器上。它内置 400 多个模型,包括 Flux、Midjourney、Kling、Sora、Veo,没有内容过滤器,提供桌面应用和 Web 版。适合想免费制作短视频、口播视频和概念图的创作者。
从场景说起:这套工具能给你什么
做短视频时,你直接拿到的是一条能用的动态素材。输入文字描述走文生视频,生成 5 秒、10 秒或 15 秒的片段;上传一张静态图则自动转成图生视频,片段的第一帧就是这张图。模型池里有 Kling、Sora、Veo、Wan、Seedance 2.0、Hailuo、Runway 等,文生视频和图生视频各几十个可选,对某次结果不满意就换个模型再跑一遍。
做配音和本地化时,目标是得到一条口型与音频对齐的说话视频。Lip Sync 工作室提供 9 个专用模型:手里只有一张人像就上传人像加音频,输出说话的动态视频;已有素材就切到视频模式,上传视频加音频,返回口型替换后的版本,这是本地化流程里最省事的一步。
做影视预演时,你可以快速出一批概念图和场景定帧,再用 Cinema Studio 的虚拟相机调整镜头感,比如焦距、光圈和镜头光效,让静帧更接近真实拍摄出来的镜头。开拍前核对场景方向、给团队看分镜参考,都用得上。
安装与部署:三步跑起桌面应用 🖥️
最常见的路径是下载桌面安装包,全程不用碰终端:
- 从发布页下载对应系统的安装包。macOS 是 DMG(Apple Silicon 和 Intel 分开),Windows 是 NSIS 安装程序,Linux 提供 AppImage 或 DEB。
- 安装并启动。因为应用没有做签名,macOS 和 Windows 首次打开时会弹安全警告,点"仍要打开"或"仍要运行"即可通过,macOS 用户也可以在终端执行 xattr 命令清除隔离属性。
- 在应用里填入 Muapi API key,开始生成。如果只打算走本地推理,这一步可以跳过。
另外两条路径各说两句。浏览器托管版开箱即用,不用装任何东西,页面里直接进各个工作室,模型列表跟得上最新版本。
本地推理只有桌面版支持,分两个引擎:sd.cpp 随应用自带,负责图像模型(SD 1.5、SDXL、Z-Image),在你自己电脑上运行;Wan2GP 需要在一台带 CUDA 或 ROCm 显卡的机器上自己跑一个服务,桌面应用指向它的地址,就能用上视频模型(Wan 2.2、Hunyuan、LTX)。想从源码构建也很短:先git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI,然后npm run setup装依赖并构建工作区子包,npm run dev起 Web 版,npm run electron:dev起桌面版。
两个值得讲透的功能:视频生成与镜头控制
视频生成的入口是 Video Studio(src/components/VideoStudio.js),它的逻辑是跟着输入自动切换模式:默认是文生视频,一旦你上传了图片就变成图生视频,背后的模型集合也随之替换。画幅、分辨率、时长这些选项不是写死的,界面只显示当前模型真正支持的值,比如 Seedance 2.0 给出 16:9、9:16、4:3、3:4 和 5、10、15 秒的选项。生成完成后可以一键下载全分辨率结果,历史记录存在本地,随时回去翻旧作。
Cinema Studio(src/components/CinemaStudio.js)解决的是"让画面像电影"的问题。摄影参数在这里变成可勾选项:6 种机身从 16mm 胶片到 8K 模块化数字,焦距从 8mm 广角到 85mm 人像,光圈 f/1.4、f/4、f/11 三档,另有十几种镜头效果(倾斜、变形宽银幕、halation 等),每种都带预览图,存放在public/assets/cinema/下。选中后应用把这些参数翻译成提示词修饰符交给模型,你不需要自己会写英文摄影术语,也能拿到"大光圈浅景深特写"这类镜头质感。
其余功能合并成一句:音频生成与编辑、AI Clipping 长视频自动提亮点、Vibe Motion 动效、Recast 主体替换、Marketing 广告变体,以及可以可视化串联图像、视频、音频模型的工作流编辑器,模板也都能直接跑。
让生成质量更稳的几条实用建议 💡
- 提示词按"主体 + 动作 + 环境与光线"三层来写,比如"银色跑车,雨夜城市,霓虹在湿路面反光",比只写"酷炫跑车"稳定得多。
- 先用低分辨率、低质量档验证方向,挑 LTX 这类快模型看构图和运镜对不对,再换高配模型出成片,省时间最多。
- 图生视频时参考图选主体清晰、背景别太挤的;需要多个画面里人物长相一致,就用支持最多 14 张参考图的多图模型(如 Nano Banana 2 Edit)。
- 同一个提示词并行跑两三个模型挑最好的,模型池大,同题下的差距明显。
- 本地推理从小的模型起步:Mac 上先跑 SD 1.5 档(约 2GB,Dreamshaper 8 等),Z-Image 需要 16GB 内存,8GB 机器上可能卡死系统。
它适合谁,不适合谁
适合三类人:想免费做短视频和口播视频、又不想在多个平台分别注册的个人创作者;想把生成能力嵌进自己产品、做自托管或白牌的开发者,MIT 协议加相对干净的 API 客户端让这条路走得通;在意数据隐私、希望推理跑在自己机器上的人。
不太适合两类情况:如果你不接受"需要填一个 API key",云模型路线依赖 Muapi 服务,生成调用会经过云端;如果你的团队需要带 SLA、有审核环节的正式生产线,这套工具的定位还是偏个人工作台,流程上没有企业级的约束。
如果你的主要诉求就是"快速、免费、无过滤地出图和出视频",不妨先把桌面版装起来跑一遍,再决定走云模型还是本地推理。
附注
- 技术栈:Next.js(App Router)+ React + Tailwind CSS v3,npm workspaces 单仓库,共享 UI 库在
packages/studio,桌面壳为 Electron - 模型目录的唯一数据源:packages/studio/src/models.js
- API 客户端:src/lib/muapi.js,提交任务加轮询结果的二段式调用
- 许可证:MIT
- 社区:项目 README 中提供 Discord 社区入口,可提问和跟进更新
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考