news 2026/9/8 15:38:42

从克隆仓库到打开聊天窗口:Text Generation Web UI 本地部署与调参笔记

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
从克隆仓库到打开聊天窗口:Text Generation Web UI 本地部署与调参笔记

从克隆仓库到打开聊天窗口:Text Generation Web UI 本地部署与调参笔记

【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen

Text Generation Web UI(下文简称 TGW)是一个基于 Gradio 的文本生成界面:克隆仓库、把模型文件放进指定目录,就能在浏览器里和本地大模型对话。模型加载、提示词模板拼装、采样参数配置全部发生在服务端,浏览器只负责显示和输入,不上传任何内容。本文按"部署 → 页面操作流 → 后端选型 → 参数数值"的顺序写清每一步做了什么、为什么这么做,适合会用终端但不熟 LLM 工具链的工程师,以及想零配置跑起大模型网页版的普通用户。

🧭 如何完成 TGW 本地启动:克隆、装环境、开端口

启动路径很短。先拉代码:

git clone https://gitcode.com/GitHub_Trending/te/text-generation-webui cd text-generation-webui

仓库根目录按平台各放了一个入口脚本(start_linux.shstart_windows.batstart_macos.sh),以 Linux 为例:

./start_linux.sh

首次运行会自动下载 Miniforge,在installer_files/下建好 Conda 环境并装好依赖,然后拉起server.py——这一步要等几分钟,之后每次启动都会很快。启动完成后浏览器访问http://127.0.0.1:7860即进入文本生成界面。如果你已手动装好 Conda 环境,也可以直接python server.py。想让某些参数每次启动都生效(比如自动加载某个模型),把它们一行一个写进user_data/CMD_FLAGS.txt即可,例如加一行--model my-model.gguf

模型来源:把 GGUF 单文件模型放进 user_data/models/ 就能被自动识别;多文件 safetensors 模型则放在该目录下的子文件夹中。

💬 打开页面之后:从输入框到切换后端的操作流

默认落在 Chat 标签页。在底部输入框打字、点 Send,模型回复会流式打出来;把鼠标悬停在对话区上会出现 ☰ 菜单,里面是 Regenerate(重新生成最后一条)、Continue(续写当前回复)、Impersonate(让模型替你生成用户发言)、分支和历史对话管理。

真正决定"怎么和模型说话"的是侧栏的 Mode 下拉框(按 Ctrl+S 可展开侧栏),共三档:

  • instruct:面向指令微调模型,提示词按训练时的模板拼装,可以理解为离线版对话框;
  • chat:面向基座模型或角色扮演场景,提示词是简单的"角色名: 发言"交替格式;
  • chat-instruct:两者混合——用指令模型的模板去驱动一个自定义角色,适合拿指令模型跑角色对话。

在 Model 标签页加载模型时,界面会尝试从 GGUF 元数据或tokenizer_config.json自动检测指令模板并填好参数,一般不用手动改模板。角色加载则在 Character 下拉框完成,可选项来自 user_data/characters/,内置的 Assistant 和 Example 可直接体验:

换后端和换模型都在 Model 标签页完成:loader 一栏默认自动检测(按模型格式猜),也可以手动指定 Transformers、llama.cpp、ExLlamav3、TensorRT-LLM 之一,切换后无需重启服务。

🔌 后端与硬件适配:如何为当前显卡选对 loader

后端CUDA(NVIDIA)ROCm(AMD)CPUApple Silicon
Transformers✅ 多文件 safetensors 模型首选,支持 bf16/8bit/4bit 量化✅ 装requirements_amd.txt✅ 加--cpu,速度慢✅ 走 MPS
llama.cpp✅ GGUF 模型默认后端✅ CPU 场景默认,mmap 省内存
ExLlamaV3✅ 仅支持 EXL3 量化模型
TensorRT-LLM✅ 仅 NVIDIA 高性能推理

依赖文件按硬件分好:requirements/full/下有requirements.txt(NVIDIA)、requirements_amd.txtrequirements_cpu_only.txtrequirements_apple_silicon.txt,选错文件装出来的 PyTorch 跑不对硬件。实践上的默认选择是:GGUF 模型走 llama.cpp,多文件全精度模型走 Transformers,手上有 EXL3 模型且只有 NVIDIA 卡才上 ExLlamaV3。

⚙️ 温度与重复惩罚怎么调:三组可感知的数值

采样参数在 Parameters 标签页,下面是三组可以直接套用的组合:

  1. 创意续写:温度 0.8 + top-p 0.95。词表选择更发散,偶尔蹦出意料之外的句式,代价是长文本容易跑题。
  2. 角色对话:温度 0.7 + 重复惩罚 1.2。惩罚值大于 1 时对已出现过的 token 降权,能明显压住"同一句式反复说"的现象;调到 1.3 以上句子开始生硬断句,不建议再加。
  3. 代码与可复现输出:关掉 do_sample(或 top_k=1)+ 温度任意,同样输入逐字复现同样输出,方便对比改动前后的差异。

仓库在 user_data/presets/ 里放好了现成预设,其中 Deterministic 就是第 3 组(do_sample: false, top_k: 1),Creative 则用 min-p 0.02 配 XTC 采样器。不确定时先跑预设,再用单参数微调。

🧩 扩展生态:LoRA 微调、OpenAI 兼容 API 与语音绘图扩展何时开

  • LoRA(低秩适配,一种只训练少量附加权重的轻量微调方法):Training 标签页支持在对话或多轮文本数据集上训练,可断点续训。只有当通用模型在你业务场景下的语气或格式持续不合要求、且手里有几百条以上整理好的样本时,才值得开。
  • OpenAI 兼容 API:启动时加--api,即暴露兼容 OpenAI Chat/Completions 和 Anthropic Messages 的端点,支持工具调用。已有脚本依赖 OpenAI SDK、只想把请求指到本机时再开;只用网页的话它占着端口没别的收益。
  • 语音与绘图扩展:extensions/ 内置 silero_tts、coqui_tts(文字转语音)、whisper_stt(语音输入)、sd_api_pictures(调外部 Stable Diffusion 出图)等,按需勾选启用即可。
  • 工具调用user_data/tools/下每个.py文件是一个可被模型调用的函数(计算器、网页搜索、掷骰子),让模型在对话中执行动作时才需要。

先按默认组合跑:llama.cpp 加载一个 GGUF 模型,采样用默认值。等遇到显存装不下或响应慢,再对照上表换后端;效果不满意时,只动温度和重复惩罚两个参数,其余保持默认。

【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 1:13:10

DBeaver 数据比较实战:库对不上、库变慢,三步定位差异

DBeaver 数据比较实战:库对不上、库变慢,三步定位差异 【免费下载链接】dbeaver Free universal database tool and SQL client 项目地址: https://gitcode.com/GitHub_Trending/db/dbeaver 生产库和测试库对账,差了 37 行&#xff1b…

作者头像 李华
网站建设 2026/9/8 15:37:17

DBeaver XLSX 导出实战指南

DBeaver XLSX 导出实战指南 【免费下载链接】dbeaver Free universal database tool and SQL client 项目地址: https://gitcode.com/GitHub_Trending/db/dbeaver DBeaver 是一款免费开源的通用数据库工具,它的 XLSX 导出功能可以把任意查询结果直接落成能打…

作者头像 李华
网站建设 2026/9/6 3:03:58

北斗B1I扩频码Matlab生成原理与完整实现

简介:本资源是一份面向卫星导航信号处理初学者与MATLAB仿真实践者的北斗B1I路扩频码生成与基础接收链路仿真代码包,聚焦北斗系统核心调制技术,解决扩频码构造、BPSK调制、AWGN信道建模及粗同步(捕获)等关键环节的动手实…

作者头像 李华
网站建设 2026/9/7 0:02:25

Mage 工作流编排快速上手:10 分钟跑通第一条数据管道

Mage 工作流编排快速上手:10 分钟跑通第一条数据管道 【免费下载链接】data-engineer-handbook This is a repo with links to everything youd ever want to learn about data engineering 项目地址: https://gitcode.com/GitHub_Trending/da/data-engineer-handbook 还…

作者头像 李华
网站建设 2026/9/7 1:15:19

用FastAPI构建API包装SaaS:鉴权、限流与计量计费实战

如果你是一名后端开发者,大概率有过这样的想法:自己对接了不少第三方 API,翻译、OCR、内容审核、PDF 处理……如果把这些能力封装成一个统一接口,再卖给别人用,是不是就能“睡后收入”?这个想法方向没错&am…

作者头像 李华
网站建设 2026/9/7 1:10:56

网约车一口价订单等待超时怎么办?司机无责取消操作指南

前几天跑车时碰到一个场景,让人印象很深:一位女司机接了一口价订单,4个男乘客拼车出行,到了上车点之后迟迟不出现。司机在App上点了“到达”,等了整整一个免费等待周期,乘客依然没有露面。她没有犹豫&#…

作者头像 李华