Pixelle-Video 教程:从输入主题到一键出片的AI视频生成完整指南
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
做一条口播类短视频,写稿、找配图、录配音、再剪合成,四件事下来往往要耗掉半天。Pixelle-Video 是一个 AI视频生成工具:输入一个主题后,它自动完成文案创作、AI 配图、语音解说、背景音乐添加和视频合成,直接输出一条可发布的成片。本文按实际部署顺序,走通从克隆仓库到产出第一条视频的最短路径,并给出模板定制与成本控制的判断依据。
一条命令启动 Web 界面
环境依赖只有两个:Python 包管理器uv和视频处理工具ffmpeg(macOS 用 Homebrew 安装,Ubuntu/Debian 用 apt 安装,Windows 需手动加入 PATH)。装好后:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video ./start_web.shstart_web.sh内部执行uv run streamlit run web/app.py,首次运行会自动拉取依赖,随后浏览器自动打开http://localhost:8501。Windows 用户也可以用仓库里的start_web.bat,配合 Windows 整合包可跳过手动装环境。
界面跑起来之后,还差两件事:填配置、定模板。
首次配置:两组密钥决定能否出片
左侧展开「⚙️ 系统配置」面板,必填的是 LLM 配置,可选的是图像/视频生成配置:
- LLM(必填):下拉选择预设模型(通义千问、GPT-4o、DeepSeek、Ollama),base_url 和 model 会自动填充,再填入 API Key。文案质量基本由这一步决定,Ollama 选本地模型则完全免费。
- 图像/视频生成(三选一):本地 ComfyUI 填服务地址(默认
http://127.0.0.1:8188)并点「测试连接」;无显卡则填 RunningHub 的 API Key 走云端;也可以直连 DashScope、OpenAI、Kling 等厂商 API。 - TTS(基本免配):默认走免费的 Edge-TTS 工作流,无需额外配置。
不想在界面上逐项填的话,可以直接编辑配置文件,示例见 config.example.yaml:
llm: api_key: "你的密钥" base_url: "https://dashscope.aliyuncs.com/compatible-mode/v1" model: "qwen-max"更完整的字段说明在 docs/zh/getting-started/configuration.md。配置保存后,进入出片环节。
生成第一条视频的最小操作
配置就绪后,界面按左中右三栏工作:
- 左栏「📝 内容输入」:选「AI 生成内容」模式,输入主题(例如"健康饮食的重要性"),分镜数量默认 5 个;BGM 可选内置音乐或关闭。
- 中栏:TTS 工作流和图像工作流保持默认,视频模板选竖屏
1080x1920/image_default.html。 - 右栏:点「🎬 生成视频」,进度条会按 文案 → 逐分镜配图 → 语音合成 → 视频合成 实时推进。
按官方文档口径,5 分镜视频大约需要 2~5 分钟,具体取决于 LLM 响应速度和图像生成速度。成片会自动在右栏播放,文件落在output/目录。第一次跑建议先用默认参数完整走一遍,确认链路通了再回头调参数。
跑通后最常用的两个能力
第一次生成之后,真正高频的操作集中在模板切换和文案模式切换上。
模板与分辨率切换
全部 HTML 模板放在 templates/ 目录,按分辨率分三组管理:竖屏 1080x1920(适合抖音、快手)、横屏 1920x1080(适合 B 站、YouTube)、方形 1080x1080(适合 Instagram)。命名即分类:static_*是纯文字静态模板,不需要 AI 生成媒体;image_*以 AI 图片为背景;video_*以 AI 视频片段为背景,成本更高。
选模板时可以点「预览模板」填入测试文案看效果,不用真的跑一次完整生成。
固定文案与批量主题
已有现成脚本时,左栏切到「固定文案内容」模式,粘贴全文即可跳过 AI 写稿环节,系统只负责配图、配音和合成。需要准备一周内容时,用批量模式每行输入一个主题,所有主题共用同一套配置,系统依次生成独立视频,实现逻辑在 web/utils/batch_manager.py。另外两个低成本加分项:上传一段参考音频可走 Index-TTS 做声音克隆;把自己的 MP3 放进bgm/目录即可作为自定义背景音乐。
进阶调优与适用边界
模板文件修改路径
想要品牌化外观,直接改 templates/ 下对应分辨率目录中的 HTML 文件:CSS 控制文字颜色、字号和位置,背景图可替换为自己的素材,布局结构可针对内容类型重排。改完在 Web 界面用「预览模板」验证效果,无需重启服务。从零写模板的字段规范见 docs/zh/user-guide/templates.md。
成本与能力边界
费用方面可以给出一套对照:本地有显卡时,Ollama 本地 LLM + 本地 ComfyUI + Edge-TTS 组合零 API 成本;无显卡时图像生成走 RunningHub 或直连厂商 API,按量计费。能力边界上,video_*模板会调用视频生成模型(如 Wan 2.1),单条成本和耗时明显高于image_*模板,试错期建议先用图片模板跑顺,再换视频模板。配图风格不稳定时,优先调整配置里的prompt_prefix(英文风格描述词),比换模型见效更快。
下一步往哪深入
跑通首条视频后,按这个顺序读文档收益最高:
- docs/zh/getting-started/quick-start.md:完整的首次生成流程,含各步骤的默认值说明
- docs/zh/tutorials/custom-style.md:视觉风格与提示词前缀的调优方法
- docs/zh/tutorials/voice-cloning.md:参考音频克隆音色的操作细节
- docs/zh/user-guide/api.md:跳过 Web 界面直接调 API 的方式,适合批量接入
现在就动手的最低成本动作:保持默认配置不变,只换一个你熟悉主题,用竖屏image_default.html模板再生成一条 5 分镜视频,对比两次的文案结构和配图风格差异——这一步能帮你判断当前 LLM 和图像工作流的组合是否够用,决定后续往哪个方向调优。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考