输入一个主题,2–5 分钟出片:Pixelle-Video 批量生成 AI 短视频
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
如果你要一次性产出多支带配音、配图的短视频,又不想自己写脚本和剪素材,Pixelle-Video 能把一个主题转成完整成片:LLM 写文案、AI 生配图、TTS 配音、自动合成,支持一行一个主题的批量生成。
一条命令跑起来
跑这个项目只需要两个前置依赖:uv(Python 包管理器)和ffmpeg(视频合成用)。macOS 上先执行brew install ffmpeg,Ubuntu/Debian 用sudo apt install ffmpeg,装完可以用ffmpeg -version验证。然后执行:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.pyWindows 用户不需要这一步,下载 release 里的整合包解压后双击start.bat即可,start.bat和start_web.sh都指向同一个 Web 界面。浏览器自动打开http://localhost:8501,跑通后你应看到三栏界面:左侧内容输入、中间语音与视觉配置、右侧「生成视频」按钮。首次使用点开「⚙️ 系统配置」,填 LLM 的 API Key 和图像生成服务(二选一:本地 ComfyUI 地址或 RunningHub Key),点「保存配置」,配置会落到config.yaml,字段结构可参考config.example.yaml。
从主题到成片的闭环
整条主线只有三步:输入主题、确认默认参数、点生成。你在左侧选「AI 生成内容」,输入「为什么要养成阅读习惯」,分镜数量默认 5;中间栏的 TTS 默认 Edge-TTS、模板默认templates/1080x1920/image_default.html(竖屏 1080x1920),一般不用动;右侧点「生成视频」后,界面按「生成文案 → 逐分镜配图 → 合成语音 → 合成视频」四段推进,右侧进度条走到头就自动播放成片,同时显示时长、文件大小和分镜数,视频文件保存在output/目录。5 分镜的视频通常 2–5 分钟出片,耗时大头在配图生成。
如果你已经有现成文案,把模式切成「固定文案内容」直接粘贴,分割方式可选段落、行或句子——用「按句子」切分会得到更多分镜、节奏更碎,用「按段落」则每段镜头更长。想批量做系列视频时,同一个文本框里一行写一个主题,系统会为每行独立生成一支,还能统一设置标题前缀。
岔路口:模型、配图、模板怎么选
LLM 选哪个。默认答案是通义千问:文案质量稳、费用低,预设会自动填好 base_url 和 model 名。什么时候改:要零成本跑量就切 Ollama(本地模型,config.example.yaml里给了llama3.2示例);要文案更有网感再考虑 GPT-4o。换模型只影响文案,不影响后续流程。
配图走哪条路。默认答案是runninghub/image_flux.json(云端,只需一个 API Key,无需显卡)。什么时候改:本地有显卡且想零成本,改selfhost/image_flux.json并填 ComfyUI 地址(默认http://127.0.0.1:8188,界面上有「测试连接」按钮);不想碰 ComfyUI 工作流,则选api/...开头的直连工作流,在系统配置里填 DashScope、OpenAI 或 Kling 的密钥。三条路的产出物相同——每个分镜一张 1024x1024 的配图(尺寸默认值,可调)。
模板和尺寸怎么选。命名即分类:static_*.html纯文字排版,不消耗任何生图调用,速度最快;image_*.html用 AI 图当背景,是默认档位;video_*.html用 AI 视频做动态背景,最慢最贵。平台定尺寸:抖音/快手用竖屏 1080x1920,B 站/YouTube 用横屏 1920x1080,Instagram 用 1080x1080,全部模板在templates/目录按尺寸分组,选之前点「预览模板」先看效果。
语音要不要换。默认 Edge-TTS 免费且够用。什么时候改:做品牌号需要统一音色时,换 Index-TTS 工作流并上传一段参考音频(MP3/WAV/FLAC),界面支持上传后先试听再进正式生成。
质量清单与常见死路
| 症状 | 动作 |
|---|---|
| 生成卡在「生成文案」不动 | 回系统配置核对 LLM 的 API Key 和 base_url,换一个预设重试 |
| 各分镜配图风格不统一 | 在「提示词前缀」里固定一段英文描述(如Minimalist black-and-white matchstick figure style illustration, clean lines),所有分镜共用 |
| 出片节奏快于语音、字幕抢跑 | 调低 TTS 语速(默认 1.0x,可调 0.9x),或减少分镜数 |
| 背景音乐压过人声 | 先切「无 BGM」确认是人声问题,再回bgm/换一首更轻的 MP3 |
| 视频生成步骤报错、进度条中断 | 看终端日志定位是哪条工作流失败,确认 RunningHub Key 或 ComfyUI 连接可用 |
生成前值得检查的三件事:提示词前缀是英文(中文描述会被直译进生图模型,效果不稳);模板尺寸和投放平台匹配;分镜数不超过 5,因为每个分镜都要单独生图,数量直接线性拉长等待时间。
下一步
跑通单支之后,把主题列表换成一行一个批量跑,是效率上最便宜的一步升级;要进自己的系统,则直接调 Python API,核心就一个方法:
from pixelle_video.service import PixelleVideoCore p = PixelleVideoCore() # await p.initialize() 后调用 # r = await p.generate_video(text="主题", mode="generate", n_scenes=5)参数细节见 API 使用文档,合成逻辑的源码在pixelle_video/services/video.py。现在把你的五个选题各写一行贴进左侧文本框,点一次生成。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考