news 2026/9/4 12:19:43

Open Generative AI 完整指南:用 420+ 个模型免费生成 AI 图像与视频

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Open Generative AI 完整指南:用 420+ 个模型免费生成 AI 图像与视频

Open Generative AI 完整指南:用 420+ 个模型免费生成 AI 图像与视频

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

Open Generative AI 是一个 MIT 协议的免费开源 AI 图像与视频生成工作室,把 Flux、Midjourney、Kling、Sora、Veo 等 420 多个主流模型收进 14 个独立工作室。没有订阅费、没有内容过滤,整套系统可以自托管。下面按"先跑起来、再做东西、最后调优"的顺序,把它的用法完整讲一遍。

十分钟上手:三种启动方式按需求挑

在线版——官方托管站点提供完整的 14 个工作室(图像、视频、音频、口型同步、电影、工作流、Agent 等),注册免费账号就能在浏览器里用,零配置。

桌面版——macOS(Apple Silicon 和 Intel 都有 DMG)、Windows(NSIS 安装器)、Linux(AppImage / deb)提供一键安装包,不需要装 Node.js。

源码部署——想改代码或接入自己的模型清单,走这条路(需要 Node.js 18+):

git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI npm run setup npm run dev

npm run dev启动 Web 版(Next.js,端口 3000);想要桌面形态就把最后一步换成npm run electron:dev。注意--recurse-submodules不能省,工作流和 Agent 包都在子模块里,漏掉会报"找不到 pages 目录"。首次启动会让你填 Muapi API key;如果只想用本地模型,可以先跳过。

做图:只输文字和上传参考图,走两套完全不同的模型

图像工作室(Image Studio)的切换逻辑很直接:

  • 不传图:默认文生图模式,50+ 个 t2i 模型可选——Flux、Nano Banana 2(支持 1K/2K/4K 分辨率)、Seedream 5.0、Ideogram、GPT-4o、Midjourney v7
  • 传了参考图:自动切到 55+ 个 i2i 模型——Flux Kontext、Nano Banana 2 Edit、Seedream 5.0 Edit、Seededit、超分辨率、背景移除

真正拉开差距的是多参考图能力。Nano Banana 2 Edit 一次最多吃14 张参考图;Flux Kontext Dev、Kling O1 Edit、GPT-4o Edit 支持 10 张;Vidu Q2 支持 7 张。选中多图模型后,上传按钮变成多选模式,每张图带顺序编号,模型按你选定的顺序处理;批量勾选、"Use Selected" 确认,一套流程走完。

所有上传过的参考图会存进本地上传历史(localStorage 持久化),下次直接点缩略图复用,同一张图不用反复传。

做视频:40+ 文生视频、60+ 图生视频、9 个口型同步模型

视频工作室和图像工作室是同一套"双模式"设计:

  • 文生视频(40+ 模型):Kling、Sora 2、Veo 3、Wan、Seedance 2.0(5/10/15 秒三档时长)、Hailuo、Runway,输入场景描述直接出片
  • 图生视频(60+ 模型):上传一张起始帧动画化,Kling I2V、Veo3 I2V、Runway I2V、Midjourney I2V 都在池子里

口型同步:让照片开口说话

Lip Sync 工作室是差异化最大的模块之一,9 个模型分两条路径:

输入输出代表模型
肖像图 + 音频说话视频Infinite Talk、Wan 2.2 Speech to Video、LTX 2.3 Lipsync(最高 1080p)
现有视频 + 音频对口型视频LatentSync、Sync、Veed、Creatify、Infinite Talk V2V

第二条路径就是做视频配音、多语种换声的常规打法:原片不动,只重绘嘴部。生成记录单独存,页面刷新后未完成的任务会自动恢复轮询。

电影工作室:把相机参数搬进提示词

Cinema Studio 把虚拟摄影棚做成了参数面板,每个选择最终都会翻译成优化的提示词修饰符:

  • 机身:Modular 8K 数字、全画幅电影机、70mm 大画幅胶片、Studio S35、经典 16mm 胶片等
  • 镜头:70s Cinema Prime(复古质感)、Swirl Bokeh Portrait(旋流散景)、Halation Diffusion(辉光)、Clinical Sharp Prime(锐利临床风)等 11 款
  • 焦距:8mm 超广角 → 14 / 24 / 35mm(人眼视角)/ 50mm(人像)/ 85mm 特写
  • 光圈:f/1.4 浅景深突出主体、f/4 均衡、f/11 深焦前后都实

对应组件在 src/components/CinemaStudio.js,配套的镜头/光圈样张资源在public/assets/cinema/下。

不烧云端额度:两套本地推理引擎

桌面应用内置两个互相独立的本地引擎,都在Settings → Local Models里配置,生成时点模型选择器旁边的 ⚡ Local 开关即可,不需要 API key。

sd.cpp(捆绑下载):来自 stable-diffusion.cpp 的 C++ 引擎,Apple Silicon 走 Metal,Linux/Windows 走 CUDA/Vulkan/ROCm。可选模型:Z-Image Turbo(8 步出图)、Z-Image Base(50 步高质量)、Dreamshaper 8 / Realistic Vision v5.1 / Anything v5(SD 1.5,各约 2.1 GB)、SDXL Base(6.9 GB)。

Wan2GP(自带服务器):应用本身只是 HTTP 客户端,你在有 CUDA/ROCm GPU 的机器上跑 Wan2GP 的 Gradio 服务,桌面端填 URL 后测连通性。好处是 Mac 用户也能把推理甩给局域网里的游戏本或租来的 GPU 实例。可用模型:Flux.1 Dev、Qwen Image、Wan 2.2(T2V/I2V)、Hunyuan Video、LTX Video。

硬件与存储的三个坑

  • 8GB 内存的 M 系列 Mac 别碰 Z-Image——官方明确说会卡死系统,用 SD 1.5 系(约 2GB)就够;Z-Image 建议 16GB 起步
  • 模型权重默认存在 Electron 应用数据目录,想挪到别的磁盘就启动前设环境变量:
export OPEN_GENERATIVE_AI_LOCAL_AI_DIR=/path/to/local-ai
  • 本地推理只有桌面版支持,托管 Web 版永远走云端 API

搭流水线:Workflow Studio 把模型串起来

工作流工作室解决"单模型不够用"的问题——把图像、视频、音频模型串成自动化管道:

  • 模板库:预置图像链、视频管道等起点模板
  • 节点编辑器:拖拽连线,决定上一步输出喂给哪个模型
  • 社区区:跑别人发布的管道
  • Playground:表单式交互式运行,结果内联渲染
  • API 调用:每条工作流都能通过 Muapi API 执行,方便接进自己的系统

底层引擎是独立的开源包 packages/Vibe-Workflow/,可以单独抽出来嵌进其他项目。

开发者视角:三个文件读懂整个架构

这是个 Next.js monorepo,共享的组件库在packages/studio。改东西之前先看这三个入口:

  1. packages/studio/src/models.js——全部 400+ 模型定义的唯一事实源,t2i / i2i / t2v / i2v / v2v / 口型同步 / 重绘 / 音频按数组分开导出,加新模型就在这里登记,桌面版和托管版同时生效
  2. packages/studio/src/muapi.js——统一 API 客户端,调用模式是"提交POST /api/v1/{endpoint}→ 轮询 predictions 结果直到 completed",认证走x-api-key
  3. packages/studio/src/components/——ImageStudio、VideoStudio、CinemaStudio、WorkflowStudio 等各工作室 UI,StandaloneShell.js 负责顶部 Tab 导航和 API key 管理

克隆仓库跑一遍npm run setup,14 个工作室就能在本地转起来;先用在线版或桌面版找到你常用的三个工作室,再决定要不要碰源码。从 Cinema 工作室的参数面板开始玩,它是理解"提示词工程 + 参数控制"这套思路最快的地方。

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/4 12:19:27

从零设计智能洗碗机:基于STM32/51单片机的嵌入式系统实战

简介:本资源是一套完整的基于单片机的智能洗碗机课程设计与毕业设计实践方案,面向电子类、自动化及物联网相关专业的本科生与高职学生,解决嵌入式控制系统从理论到仿真实现的综合能力训练需求。压缩包共28个文件(774KB&#xff09…

作者头像 李华
网站建设 2026/9/4 12:11:35

车辆重识别实战:结构化解析模块(Parser)如何解决工业落地断层

简介:本资源是一套面向计算机视觉开发者与智能交通领域研究者的车辆重识别(Vehicle ReID)实战项目,聚焦于跨摄像头视角下同一车辆的精准匹配问题,适用于城市监控、车流分析、违章追踪等实际场景。项目基于Parser解析架…

作者头像 李华
网站建设 2026/9/4 12:09:36

工业级轮椅检测数据集:VOC+YOLO双格式13826张真实场景样本

简介:本资源是面向计算机视觉初学者与算法工程师的轮椅目标检测专用数据集,适用于智能无障碍设备研发、老年辅助系统训练及YOLO/VOC双格式模型迁移学习等实际场景。数据集共2000个文件,包含1999个Pascal VOC标准XML标注文件与1个说明文档&…

作者头像 李华
网站建设 2026/9/4 12:08:24

《无畏契约》霓虹町A点包位选择与4+1守包阵容实战解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华