news 2026/9/9 16:33:04

Open Generative AI:开源、可自托管的 AI 视频生成工作室(内置 400+ 模型)

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Open Generative AI:开源、可自托管的 AI 视频生成工作室(内置 400+ 模型)

Open Generative AI:开源、可自托管的 AI 视频生成工作室(内置 400+ 模型)

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

Open Generative AI 是一个开源(MIT 协议)的 AI 视频与图像生成工作室,支持自托管,跑在自己的机器上。它内置 400 多个模型,包括 Flux、Midjourney、Kling、Sora、Veo,没有内容过滤器,提供桌面应用和 Web 版。适合想免费制作短视频、口播视频和概念图的创作者。

从场景说起:这套工具能给你什么

做短视频时,你直接拿到的是一条能用的动态素材。输入文字描述走文生视频,生成 5 秒、10 秒或 15 秒的片段;上传一张静态图则自动转成图生视频,片段的第一帧就是这张图。模型池里有 Kling、Sora、Veo、Wan、Seedance 2.0、Hailuo、Runway 等,文生视频和图生视频各几十个可选,对某次结果不满意就换个模型再跑一遍。

做配音和本地化时,目标是得到一条口型与音频对齐的说话视频。Lip Sync 工作室提供 9 个专用模型:手里只有一张人像就上传人像加音频,输出说话的动态视频;已有素材就切到视频模式,上传视频加音频,返回口型替换后的版本,这是本地化流程里最省事的一步。

做影视预演时,你可以快速出一批概念图和场景定帧,再用 Cinema Studio 的虚拟相机调整镜头感,比如焦距、光圈和镜头光效,让静帧更接近真实拍摄出来的镜头。开拍前核对场景方向、给团队看分镜参考,都用得上。

安装与部署:三步跑起桌面应用 🖥️

最常见的路径是下载桌面安装包,全程不用碰终端:

  1. 从发布页下载对应系统的安装包。macOS 是 DMG(Apple Silicon 和 Intel 分开),Windows 是 NSIS 安装程序,Linux 提供 AppImage 或 DEB。
  2. 安装并启动。因为应用没有做签名,macOS 和 Windows 首次打开时会弹安全警告,点"仍要打开"或"仍要运行"即可通过,macOS 用户也可以在终端执行 xattr 命令清除隔离属性。
  3. 在应用里填入 Muapi API key,开始生成。如果只打算走本地推理,这一步可以跳过。

另外两条路径各说两句。浏览器托管版开箱即用,不用装任何东西,页面里直接进各个工作室,模型列表跟得上最新版本。

本地推理只有桌面版支持,分两个引擎:sd.cpp 随应用自带,负责图像模型(SD 1.5、SDXL、Z-Image),在你自己电脑上运行;Wan2GP 需要在一台带 CUDA 或 ROCm 显卡的机器上自己跑一个服务,桌面应用指向它的地址,就能用上视频模型(Wan 2.2、Hunyuan、LTX)。想从源码构建也很短:先git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI,然后npm run setup装依赖并构建工作区子包,npm run dev起 Web 版,npm run electron:dev起桌面版。

两个值得讲透的功能:视频生成与镜头控制

视频生成的入口是 Video Studio(src/components/VideoStudio.js),它的逻辑是跟着输入自动切换模式:默认是文生视频,一旦你上传了图片就变成图生视频,背后的模型集合也随之替换。画幅、分辨率、时长这些选项不是写死的,界面只显示当前模型真正支持的值,比如 Seedance 2.0 给出 16:9、9:16、4:3、3:4 和 5、10、15 秒的选项。生成完成后可以一键下载全分辨率结果,历史记录存在本地,随时回去翻旧作。

Cinema Studio(src/components/CinemaStudio.js)解决的是"让画面像电影"的问题。摄影参数在这里变成可勾选项:6 种机身从 16mm 胶片到 8K 模块化数字,焦距从 8mm 广角到 85mm 人像,光圈 f/1.4、f/4、f/11 三档,另有十几种镜头效果(倾斜、变形宽银幕、halation 等),每种都带预览图,存放在public/assets/cinema/下。选中后应用把这些参数翻译成提示词修饰符交给模型,你不需要自己会写英文摄影术语,也能拿到"大光圈浅景深特写"这类镜头质感。

其余功能合并成一句:音频生成与编辑、AI Clipping 长视频自动提亮点、Vibe Motion 动效、Recast 主体替换、Marketing 广告变体,以及可以可视化串联图像、视频、音频模型的工作流编辑器,模板也都能直接跑。

让生成质量更稳的几条实用建议 💡

  • 提示词按"主体 + 动作 + 环境与光线"三层来写,比如"银色跑车,雨夜城市,霓虹在湿路面反光",比只写"酷炫跑车"稳定得多。
  • 先用低分辨率、低质量档验证方向,挑 LTX 这类快模型看构图和运镜对不对,再换高配模型出成片,省时间最多。
  • 图生视频时参考图选主体清晰、背景别太挤的;需要多个画面里人物长相一致,就用支持最多 14 张参考图的多图模型(如 Nano Banana 2 Edit)。
  • 同一个提示词并行跑两三个模型挑最好的,模型池大,同题下的差距明显。
  • 本地推理从小的模型起步:Mac 上先跑 SD 1.5 档(约 2GB,Dreamshaper 8 等),Z-Image 需要 16GB 内存,8GB 机器上可能卡死系统。

它适合谁,不适合谁

适合三类人:想免费做短视频和口播视频、又不想在多个平台分别注册的个人创作者;想把生成能力嵌进自己产品、做自托管或白牌的开发者,MIT 协议加相对干净的 API 客户端让这条路走得通;在意数据隐私、希望推理跑在自己机器上的人。

不太适合两类情况:如果你不接受"需要填一个 API key",云模型路线依赖 Muapi 服务,生成调用会经过云端;如果你的团队需要带 SLA、有审核环节的正式生产线,这套工具的定位还是偏个人工作台,流程上没有企业级的约束。

如果你的主要诉求就是"快速、免费、无过滤地出图和出视频",不妨先把桌面版装起来跑一遍,再决定走云模型还是本地推理。

附注

  • 技术栈:Next.js(App Router)+ React + Tailwind CSS v3,npm workspaces 单仓库,共享 UI 库在packages/studio,桌面壳为 Electron
  • 模型目录的唯一数据源:packages/studio/src/models.js
  • API 客户端:src/lib/muapi.js,提交任务加轮询结果的二段式调用
  • 许可证:MIT
  • 社区:项目 README 中提供 Discord 社区入口,可提问和跟进更新

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/9 16:31:04

COMSOL激光烧蚀、熔覆与选区激光熔化仿真建模实战与避坑指南

做激光仿真的朋友应该都有同感:COMSOL 里面“激光烧蚀、激光熔覆、选区激光熔化”这三个方向,名字像三兄弟,网上案例包也不少,但真自己动手复现的时候,每一步都在踩坑。我最早从激光烧蚀开始,后来把手伸到熔…

作者头像 李华
网站建设 2026/9/9 16:30:56

三端柔性直流输电VSC-HVDC的MATLAB/Simulink建模与仿真

做柔性直流输电仿真这几年,说实话,能完整跑通一套三端VSC-HVDC模型并不容易。网上能下到的MATLAB模型大多是两端背靠背的,真正把三端分布式接入、各换流站控制策略都搭出来的资料,掰着手指头都能数过来。我最近正好用MATLAB/Simul…

作者头像 李华
网站建设 2026/9/9 16:29:46

Python多线程:从GIL原理到IO密集任务的高效处理

在 Python 生态里聊多线程,几乎每次都会被人拿 GIL 怼一遍。这话没毛病,CPU 密集任务拿多线程去跑,确实可能越跑越慢;但如果你是写爬虫、报表生成、批量接口调用、文件处理这类脚本,多线程在大部分情况下就是性价比最高…

作者头像 李华
网站建设 2026/9/9 16:27:58

测试工程师SQL实战指南:从聚合统计到索引优化

测试工作干到一定阶段,你会发现SQL已经不只是“会用”的程度,而是你每天都要靠它去定位数据问题、校验业务逻辑、准备一堆测试数据,甚至帮开发同事验证某个修复到底有没有生效。上篇讲了SELECT的基础查询、条件过滤、排序和LIMIT分页&#xf…

作者头像 李华
网站建设 2026/9/9 16:27:10

手写RISC-V处理器核:AXI接口与五级流水线设计详解

简介:包含完整RTL源码的RISC-V与AXI4总线接口工程,源自SiFive U54MC多核处理器设计。它面向希望深入处理器微架构和片上系统互连的硬件开发者、FPGA工程师以及计算机体系结构方向学生,尤其适合作为从零搭建处理器数据通路与访存接口的设计参考…

作者头像 李华
网站建设 2026/9/9 16:26:14

LangChain.js 智能代理入门:从一次安装到跑通第一个 Agent 的路径

LangChain.js 智能代理入门:从一次安装到跑通第一个 Agent 的路径 【免费下载链接】langchainjs The agent engineering platform 项目地址: https://gitcode.com/GitHub_Trending/la/langchainjs 做一个能回答问题的 AI 应用,往往不是接一个大模…

作者头像 李华