Open Generative AI 完整指南:用 420+ 个模型免费生成 AI 图像与视频
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
Open Generative AI 是一个 MIT 协议的免费开源 AI 图像与视频生成工作室,把 Flux、Midjourney、Kling、Sora、Veo 等 420 多个主流模型收进 14 个独立工作室。没有订阅费、没有内容过滤,整套系统可以自托管。下面按"先跑起来、再做东西、最后调优"的顺序,把它的用法完整讲一遍。
十分钟上手:三种启动方式按需求挑
在线版——官方托管站点提供完整的 14 个工作室(图像、视频、音频、口型同步、电影、工作流、Agent 等),注册免费账号就能在浏览器里用,零配置。
桌面版——macOS(Apple Silicon 和 Intel 都有 DMG)、Windows(NSIS 安装器)、Linux(AppImage / deb)提供一键安装包,不需要装 Node.js。
源码部署——想改代码或接入自己的模型清单,走这条路(需要 Node.js 18+):
git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI npm run setup npm run devnpm run dev启动 Web 版(Next.js,端口 3000);想要桌面形态就把最后一步换成npm run electron:dev。注意--recurse-submodules不能省,工作流和 Agent 包都在子模块里,漏掉会报"找不到 pages 目录"。首次启动会让你填 Muapi API key;如果只想用本地模型,可以先跳过。
做图:只输文字和上传参考图,走两套完全不同的模型
图像工作室(Image Studio)的切换逻辑很直接:
- 不传图:默认文生图模式,50+ 个 t2i 模型可选——Flux、Nano Banana 2(支持 1K/2K/4K 分辨率)、Seedream 5.0、Ideogram、GPT-4o、Midjourney v7
- 传了参考图:自动切到 55+ 个 i2i 模型——Flux Kontext、Nano Banana 2 Edit、Seedream 5.0 Edit、Seededit、超分辨率、背景移除
真正拉开差距的是多参考图能力。Nano Banana 2 Edit 一次最多吃14 张参考图;Flux Kontext Dev、Kling O1 Edit、GPT-4o Edit 支持 10 张;Vidu Q2 支持 7 张。选中多图模型后,上传按钮变成多选模式,每张图带顺序编号,模型按你选定的顺序处理;批量勾选、"Use Selected" 确认,一套流程走完。
所有上传过的参考图会存进本地上传历史(localStorage 持久化),下次直接点缩略图复用,同一张图不用反复传。
做视频:40+ 文生视频、60+ 图生视频、9 个口型同步模型
视频工作室和图像工作室是同一套"双模式"设计:
- 文生视频(40+ 模型):Kling、Sora 2、Veo 3、Wan、Seedance 2.0(5/10/15 秒三档时长)、Hailuo、Runway,输入场景描述直接出片
- 图生视频(60+ 模型):上传一张起始帧动画化,Kling I2V、Veo3 I2V、Runway I2V、Midjourney I2V 都在池子里
口型同步:让照片开口说话
Lip Sync 工作室是差异化最大的模块之一,9 个模型分两条路径:
| 输入 | 输出 | 代表模型 |
|---|---|---|
| 肖像图 + 音频 | 说话视频 | Infinite Talk、Wan 2.2 Speech to Video、LTX 2.3 Lipsync(最高 1080p) |
| 现有视频 + 音频 | 对口型视频 | LatentSync、Sync、Veed、Creatify、Infinite Talk V2V |
第二条路径就是做视频配音、多语种换声的常规打法:原片不动,只重绘嘴部。生成记录单独存,页面刷新后未完成的任务会自动恢复轮询。
电影工作室:把相机参数搬进提示词
Cinema Studio 把虚拟摄影棚做成了参数面板,每个选择最终都会翻译成优化的提示词修饰符:
- 机身:Modular 8K 数字、全画幅电影机、70mm 大画幅胶片、Studio S35、经典 16mm 胶片等
- 镜头:70s Cinema Prime(复古质感)、Swirl Bokeh Portrait(旋流散景)、Halation Diffusion(辉光)、Clinical Sharp Prime(锐利临床风)等 11 款
- 焦距:8mm 超广角 → 14 / 24 / 35mm(人眼视角)/ 50mm(人像)/ 85mm 特写
- 光圈:f/1.4 浅景深突出主体、f/4 均衡、f/11 深焦前后都实
对应组件在 src/components/CinemaStudio.js,配套的镜头/光圈样张资源在public/assets/cinema/下。
不烧云端额度:两套本地推理引擎
桌面应用内置两个互相独立的本地引擎,都在Settings → Local Models里配置,生成时点模型选择器旁边的 ⚡ Local 开关即可,不需要 API key。
sd.cpp(捆绑下载):来自 stable-diffusion.cpp 的 C++ 引擎,Apple Silicon 走 Metal,Linux/Windows 走 CUDA/Vulkan/ROCm。可选模型:Z-Image Turbo(8 步出图)、Z-Image Base(50 步高质量)、Dreamshaper 8 / Realistic Vision v5.1 / Anything v5(SD 1.5,各约 2.1 GB)、SDXL Base(6.9 GB)。
Wan2GP(自带服务器):应用本身只是 HTTP 客户端,你在有 CUDA/ROCm GPU 的机器上跑 Wan2GP 的 Gradio 服务,桌面端填 URL 后测连通性。好处是 Mac 用户也能把推理甩给局域网里的游戏本或租来的 GPU 实例。可用模型:Flux.1 Dev、Qwen Image、Wan 2.2(T2V/I2V)、Hunyuan Video、LTX Video。
硬件与存储的三个坑
- 8GB 内存的 M 系列 Mac 别碰 Z-Image——官方明确说会卡死系统,用 SD 1.5 系(约 2GB)就够;Z-Image 建议 16GB 起步
- 模型权重默认存在 Electron 应用数据目录,想挪到别的磁盘就启动前设环境变量:
export OPEN_GENERATIVE_AI_LOCAL_AI_DIR=/path/to/local-ai- 本地推理只有桌面版支持,托管 Web 版永远走云端 API
搭流水线:Workflow Studio 把模型串起来
工作流工作室解决"单模型不够用"的问题——把图像、视频、音频模型串成自动化管道:
- 模板库:预置图像链、视频管道等起点模板
- 节点编辑器:拖拽连线,决定上一步输出喂给哪个模型
- 社区区:跑别人发布的管道
- Playground:表单式交互式运行,结果内联渲染
- API 调用:每条工作流都能通过 Muapi API 执行,方便接进自己的系统
底层引擎是独立的开源包 packages/Vibe-Workflow/,可以单独抽出来嵌进其他项目。
开发者视角:三个文件读懂整个架构
这是个 Next.js monorepo,共享的组件库在packages/studio。改东西之前先看这三个入口:
- packages/studio/src/models.js——全部 400+ 模型定义的唯一事实源,t2i / i2i / t2v / i2v / v2v / 口型同步 / 重绘 / 音频按数组分开导出,加新模型就在这里登记,桌面版和托管版同时生效
- packages/studio/src/muapi.js——统一 API 客户端,调用模式是"提交
POST /api/v1/{endpoint}→ 轮询 predictions 结果直到 completed",认证走x-api-key头 - packages/studio/src/components/——ImageStudio、VideoStudio、CinemaStudio、WorkflowStudio 等各工作室 UI,StandaloneShell.js 负责顶部 Tab 导航和 API key 管理
克隆仓库跑一遍npm run setup,14 个工作室就能在本地转起来;先用在线版或桌面版找到你常用的三个工作室,再决定要不要碰源码。从 Cinema 工作室的参数面板开始玩,它是理解"提示词工程 + 参数控制"这套思路最快的地方。
【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考