news 2026/9/5 17:42:58

Pixelle-Video 教程:从输入主题到一键出片的AI视频生成完整指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Pixelle-Video 教程:从输入主题到一键出片的AI视频生成完整指南

Pixelle-Video 教程:从输入主题到一键出片的AI视频生成完整指南

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

做一条口播类短视频,写稿、找配图、录配音、再剪合成,四件事下来往往要耗掉半天。Pixelle-Video 是一个 AI视频生成工具:输入一个主题后,它自动完成文案创作、AI 配图、语音解说、背景音乐添加和视频合成,直接输出一条可发布的成片。本文按实际部署顺序,走通从克隆仓库到产出第一条视频的最短路径,并给出模板定制与成本控制的判断依据。

一条命令启动 Web 界面

环境依赖只有两个:Python 包管理器uv和视频处理工具ffmpeg(macOS 用 Homebrew 安装,Ubuntu/Debian 用 apt 安装,Windows 需手动加入 PATH)。装好后:

git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video ./start_web.sh

start_web.sh内部执行uv run streamlit run web/app.py,首次运行会自动拉取依赖,随后浏览器自动打开http://localhost:8501。Windows 用户也可以用仓库里的start_web.bat,配合 Windows 整合包可跳过手动装环境。

界面跑起来之后,还差两件事:填配置、定模板。

首次配置:两组密钥决定能否出片

左侧展开「⚙️ 系统配置」面板,必填的是 LLM 配置,可选的是图像/视频生成配置:

  1. LLM(必填):下拉选择预设模型(通义千问、GPT-4o、DeepSeek、Ollama),base_url 和 model 会自动填充,再填入 API Key。文案质量基本由这一步决定,Ollama 选本地模型则完全免费。
  2. 图像/视频生成(三选一):本地 ComfyUI 填服务地址(默认http://127.0.0.1:8188)并点「测试连接」;无显卡则填 RunningHub 的 API Key 走云端;也可以直连 DashScope、OpenAI、Kling 等厂商 API。
  3. TTS(基本免配):默认走免费的 Edge-TTS 工作流,无需额外配置。

不想在界面上逐项填的话,可以直接编辑配置文件,示例见 config.example.yaml:

llm: api_key: "你的密钥" base_url: "https://dashscope.aliyuncs.com/compatible-mode/v1" model: "qwen-max"

更完整的字段说明在 docs/zh/getting-started/configuration.md。配置保存后,进入出片环节。

生成第一条视频的最小操作

配置就绪后,界面按左中右三栏工作:

  • 左栏「📝 内容输入」:选「AI 生成内容」模式,输入主题(例如"健康饮食的重要性"),分镜数量默认 5 个;BGM 可选内置音乐或关闭。
  • 中栏:TTS 工作流和图像工作流保持默认,视频模板选竖屏1080x1920/image_default.html
  • 右栏:点「🎬 生成视频」,进度条会按 文案 → 逐分镜配图 → 语音合成 → 视频合成 实时推进。

按官方文档口径,5 分镜视频大约需要 2~5 分钟,具体取决于 LLM 响应速度和图像生成速度。成片会自动在右栏播放,文件落在output/目录。第一次跑建议先用默认参数完整走一遍,确认链路通了再回头调参数。

跑通后最常用的两个能力

第一次生成之后,真正高频的操作集中在模板切换和文案模式切换上。

模板与分辨率切换

全部 HTML 模板放在 templates/ 目录,按分辨率分三组管理:竖屏 1080x1920(适合抖音、快手)、横屏 1920x1080(适合 B 站、YouTube)、方形 1080x1080(适合 Instagram)。命名即分类:static_*是纯文字静态模板,不需要 AI 生成媒体;image_*以 AI 图片为背景;video_*以 AI 视频片段为背景,成本更高。

选模板时可以点「预览模板」填入测试文案看效果,不用真的跑一次完整生成。

固定文案与批量主题

已有现成脚本时,左栏切到「固定文案内容」模式,粘贴全文即可跳过 AI 写稿环节,系统只负责配图、配音和合成。需要准备一周内容时,用批量模式每行输入一个主题,所有主题共用同一套配置,系统依次生成独立视频,实现逻辑在 web/utils/batch_manager.py。另外两个低成本加分项:上传一段参考音频可走 Index-TTS 做声音克隆;把自己的 MP3 放进bgm/目录即可作为自定义背景音乐。

进阶调优与适用边界

模板文件修改路径

想要品牌化外观,直接改 templates/ 下对应分辨率目录中的 HTML 文件:CSS 控制文字颜色、字号和位置,背景图可替换为自己的素材,布局结构可针对内容类型重排。改完在 Web 界面用「预览模板」验证效果,无需重启服务。从零写模板的字段规范见 docs/zh/user-guide/templates.md。

成本与能力边界

费用方面可以给出一套对照:本地有显卡时,Ollama 本地 LLM + 本地 ComfyUI + Edge-TTS 组合零 API 成本;无显卡时图像生成走 RunningHub 或直连厂商 API,按量计费。能力边界上,video_*模板会调用视频生成模型(如 Wan 2.1),单条成本和耗时明显高于image_*模板,试错期建议先用图片模板跑顺,再换视频模板。配图风格不稳定时,优先调整配置里的prompt_prefix(英文风格描述词),比换模型见效更快。

下一步往哪深入

跑通首条视频后,按这个顺序读文档收益最高:

  • docs/zh/getting-started/quick-start.md:完整的首次生成流程,含各步骤的默认值说明
  • docs/zh/tutorials/custom-style.md:视觉风格与提示词前缀的调优方法
  • docs/zh/tutorials/voice-cloning.md:参考音频克隆音色的操作细节
  • docs/zh/user-guide/api.md:跳过 Web 界面直接调 API 的方式,适合批量接入

现在就动手的最低成本动作:保持默认配置不变,只换一个你熟悉主题,用竖屏image_default.html模板再生成一条 5 分镜视频,对比两次的文案结构和配图风格差异——这一步能帮你判断当前 LLM 和图像工作流的组合是否够用,决定后续往哪个方向调优。

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/5 17:42:01

校园旧书漂流系统实战:SpringBoot3+Vue3+MySQL全栈开发指南

说实话,看到“校园旧书漂流交易系统 JAVASpringBoot3Vue.js3MySQL”这个课题,我的第一反应不是急着去搜“旧书交易功能怎么做”,而是想先提醒你:这个题目真正考验你的,不是你有没有能力设计出一个漂亮的二手书商城&…

作者头像 李华
网站建设 2026/9/5 17:40:08

Unity C#热更实践:HybridCLR接入全流程与常见坑

大约两年前我第一次给项目接 HybridCLR 时,心里其实没底。当时团队的需求很直接:换包审核周期太长,运营活动想按天更新,美术资源已经能热更了,但是 C# 业务逻辑一直卡在“只能整包”这一步。市面上能选的方案无非 Lua …

作者头像 李华
网站建设 2026/9/5 17:35:21

自托管ROM管理:用RomM将NAS打造为私人游戏库

我有段时间在 NAS 上最不想打开的目录就是“游戏备份”。里面塞了 N 个平台的文件,命名混乱到只能靠内存认游戏。直到我把这些老游戏统一交给 RomM 管理以后,NAS 才真正变成一个能让我舒服翻看的私人游戏库。虽然项目本身和 Steam 没有任何关系&#xff…

作者头像 李华
网站建设 2026/9/5 17:33:59

三个站点,一次构建:拆解 authentik 的 Docusaurus 文档系统

三个站点,一次构建:拆解 authentik 的 Docusaurus 文档系统 【免费下载链接】authentik The authentication glue you need. 项目地址: https://gitcode.com/GitHub_Trending/au/authentik authentik 是一个开源身份提供商(IdP&#x…

作者头像 李华
网站建设 2026/9/5 17:32:55

Unity黑洞扭曲效果Shader实现:屏幕空间后处理与GrabPass详解

1. 效果拆解与实现方案选型 1.1 黑洞扭曲效果的核心视觉构成 先说结论:Unity里做黑洞扭曲效果,本质上不是“真的造一个黑洞”,而是在屏幕空间做一次 有方向的UV偏移 ——模拟光线经过强引力场时被弯曲的视觉效果。这个方案不需要物理模拟&…

作者头像 李华