Pixelle-Video 完整上手指南:从一句话到多语言成片,AI 短视频生成一次讲清
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
周五下午,运营群里丢来一句需求:下周新品上线,中文、英文、日文三条短视频都要有。按老办法,你要写三版脚本、找三批素材、录三遍音、剪三个工程,起码三天。而用 Pixelle-Video 这类 AI 全自动短视频引擎,整个流程被压缩成:输入一个主题 → 选语言和模板 → 点击生成。它会自动完成文案撰写、AI 配图、语音解说、背景音乐,最后直接输出一条可发布的视频,也就是常说的"短视频一键生成"。
下面按时间线带你走一遍:先跑起来,再出第一条片,然后聊进阶玩法和新手容易踩的坑。
10 分钟把 Pixelle-Video 跑起来 🚀
先看你的系统,两条路任选:
Windows 整合包(最省事):从发行版下载整合包,解压后双击start.bat,浏览器会自动打开http://localhost:8501。包里已带全依赖,无需装 Python 和 ffmpeg。
macOS / Linux 或想自定义:从源码启动即可,依赖管理用的是uv:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video && uv sync uv run streamlit run web/app.py看到三栏式 Web 界面就算成功:左边输入内容,中间调语音和视觉,右边出片预览。首次使用先在侧边栏「⚙️ 系统配置」里填 LLM 的 API Key(通义千问、GPT、DeepSeek、Ollama 任选其一,配置文件 config.example.yaml 里有各家 base_url 的注释示例),然后点「保存配置」——这一步最容易忘,后面生成失败多半就是它。更多细节可看 docs/zh/getting-started/configuration.md。
三步做出你的第一个视频 🎬
- 输入主题:在「📝 内容输入」选「AI 生成内容」,写一句话主题,比如"为什么要养成阅读习惯"。也可以切到固定文案模式,直接贴现成脚本,还能选按段落、按行或按句子拆分镜。
- 选语言和风格:中间栏选 TTS 工作流(默认 Edge-TTS 就够用)、图像工作流和视频模板。竖屏 1080×1920 适配抖音/TikTok,模板最多。
- 点「生成视频」:右侧会滚动显示进度——写文案、逐分镜生图、合成语音、拼视频。5 个分镜的片子大约 2~5 分钟,成品自动播放,文件落在
output/目录。
进阶玩法:从一条视频到一批视频
跑通第一条之后,这几个能力最值得试,统一按"功能 → 实际效果 → 适合谁"说:
- 多语言视频制作:同一份主题或脚本,切换语言批量生成各语种版本。文案会按目标语言的表达习惯重写,而不是机翻——做矩阵账号和出海发布的团队收益最大。
- 素材驱动创作:上传自己的照片或视频,AI 先分析内容再反向生成脚本,缺失画面自动补齐。手里有实拍素材、但不想自己写分镜的人很合适。
- 数字人口播 / 图生视频 / 动作迁移:三条独立流水线,分别对应虚拟主播出镜、静图转动态画面、参考视频动作"搬到"另一张图上。前两者做课程和产品展示,后者偏创意玩法。
- 声音克隆:上传一段参考音频,让解说用近似的声音朗读,做个人 IP 口播频道时用得上。
这些流水线在 Web 界面左侧可切换,背后的工作流定义都在 workflows/ 目录里,想换模型、换参数时知道去哪儿找。
模板、尺寸与音色怎么选
分辨率先按发布平台定,模板数量差异挺大:
| 分辨率 | 适配平台 | 模板规模 |
|---|---|---|
| 1080×1920 竖屏 | 抖音、TikTok | 20+ |
| 1920×1080 横屏 | YouTube、B站 | 5+ |
| 1080×1080 方形 | 小红书、Instagram | 1 |
模板分三类命名:static_*是纯排版不需要 AI 配图,image_*需要 AI 生图,video_*会调用 AI 视频模型,全部在 templates/ 目录下,界面里有预览画廊可以边看边选。比如书籍风格适合知识分享,霓虹、卡通风格则更抓眼球:
音色方面,Edge-TTS 内置中、英、日、韩等多语言语音,中文里晓晓偏柔和、云健偏叙述,英文 Aria 和 Jenny 都是女声、Guy 是男声。系统会按界面语言给出推荐音色,不确定时直接选推荐项即可。
新手常踩的四个坑
- 配置没保存:改了 API Key 但没点「保存配置」,生成时才发现 LLM 不通。改完配置先点保存,再点生成。
- 把 config.yaml 提交进 Git:示例文件
config.example.yaml顶部明确警告不要提交真实密钥,复制一份填自己的。 - 生成时以为卡死了:5 分镜 2~5 分钟属正常,生图阶段网络慢会更久,先等完整个进度条再下结论。
- 文案语言与音色不匹配:用中文解说配英文文案(或反过来)是最常见的翻车点,多语言版本一定要一一对应,这也正是"AI 自动配音"环节要留意的地方。
下一步清单
- 用默认配置跑一条 5 分镜的竖屏视频,确认整条链路通
- 换 2~3 个不同模板对比效果,固定一个适合自己账号的风格
- 翻一遍 docs/zh/user-guide/web-ui.md,熟悉固定文案、BGM 和音色设置
- 需要接入自己的系统时,再看 API 文档做集成
一个立刻能做的小任务:挑你已发布的任意一条中文内容,把文案原样贴进固定文案模式,语言切到英文再生成一次,中英两条片放一起看——这就是你第一次体验"多语言视频制作"从一天到五分钟的全过程。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考