news 2026/9/4 11:33:08

Qwen3 快速上手:一文讲清 0.6B 到 235B 的 MoE 大模型如何本地运行

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Qwen3 快速上手:一文讲清 0.6B 到 235B 的 MoE 大模型如何本地运行

Qwen3 快速上手:一文讲清 0.6B 到 235B 的 MoE 大模型如何本地运行

【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5

Qwen3 是阿里云 Qwen 团队开源的大语言模型系列,同时提供 Dense(密集型)与 MoE(混合专家)两种架构、0.6B 到 235B 共 8 种规格,并支持思考模式与非思考模式。本文带你在一篇文章内搞懂:Qwen3 该选哪个版本、如何在本地跑起来、部署时如何避坑。

为什么「选哪个模型、跑哪个版本」常常劝退新手

搜一圈「Qwen3 本地部署」,你会被一串名字砸晕:Qwen3-8B、Qwen3-30B-A3B、Qwen3-235B-A22B-Instruct-2507……同一个系列既有 Dense 也有 MoE,还有 Instruct 与 Thinking 两种分支,参数版本还跟着日期滚动更新(2504、2507)。对初学者来说,第一步往往不是「怎么跑」,而是「这些名字到底什么关系」。

先看懂 Qwen3 的两种「人格」:思考与非思考

可以把 Qwen3-2507 系列理解为同一位专家的两种工作模式:Thinking 版像「先打草稿再交卷」,会先输出一段推理链再给出答案,适合数学、代码和复杂逻辑题;Instruct 版像「接到任务直接干」,不生成think块,响应更快,适合日常对话和工具调用。

早期 Qwen3(2504)是一个模型兼两种模式,靠参数切换;2507 版本干脆拆成两个型号,行为更清晰:

版本模式关键行为
Qwen3-Instruct-2507仅非思考直接出答案,不再需要传enable_thinking=False
Qwen3-Thinking-2507仅思考自动先推理后回答,思考长度增加
Qwen3(2504 原版)双模式enable_thinking参数或/think/no_think指令切换

4 步快速上手:在本地跑起 Qwen3

  1. 选规格:0.6B / 1.7B / 4B 适合低端设备体验;名字里的「A3B」「A22B」表示 MoE 模型每次前向仅激活约 3B / 22B 参数,显存消耗远低于同规模的 Dense 模型,30B-A3B 和 235B-A22B 是主力 MoE 型号。
  2. 装运行环境:最省事的是 Ollama(v0.9.0 及以上)或 llama.cpp(b5401 及以上);Apple Silicon 用户可选 mlx-lm(0.24.0 及以上)。
  3. 一条命令拉取并运行
ollama run qwen3:8b
  1. 需要对外提供服务时,用 vLLM 一行启动兼容 OpenAI 的 API 服务(vllm>=0.9.0),接口在http://localhost:8000/v1
vllm serve Qwen/Qwen3-8B --port 8000 --max-model-len 131072

服务起来后,任何走 OpenAI 协议的对话前端都能直接接上,下图就是接上 Qwen3 后的本地聊天界面效果:

关键数据一览:框架版本要求

运行环境最低版本适用场景
transformers>=4.51.0官方示例,建议 Python 3.10+ / PyTorch 2.6+
vLLM>=0.9.0高吞吐在线服务
SGLang>=0.4.6.post1快速 Serving
TensorRT-LLM>=0.20.0rc3NVIDIA 深度优化
llama.cpp>=b5401本地 / 边缘设备
Ollamav0.9.0 及以上本地一键运行
mlx-lm>=0.24.0Apple Silicon 设备

模型谱系:Dense 有 0.6B、1.7B、4B、8B、14B、32B,MoE 有 30B-A3B、235B-A22B;2507 版本支持 256K 上下文,官方已提供扩展到 100 万 token 的模型卡。全部模型采用 Apache 2.0 协议。

跑 Qwen3 的 3 个高频坑

  • Ollama 默认上下文太短:默认num_ctx只有 2048 且默认「无限生成」,对 Qwen3 容易出错。启动后手动执行/set parameter num_ctx 40960/set parameter num_predict 32768
  • 推理内容会被中间层丢弃:SGLang 与 vLLM 在预处理 API 请求时会丢掉reasoning_content字段,可能拖累思考模型的多步工具调用质量。官方建议把完整内容原样传回,不要手动截取出思考部分。
  • 思考版别给太小的生成长度:Thinking 版思考长度明显增加,max_new_tokens设小了会「想一半被打断」。官方示例中 Thinking 版用 32768,Instruct 版建议 16384。

延伸阅读(仓库内文档)

  • 快速上手示例:Transformers、ModelScope、vLLM、SGLang 的完整推理代码与推荐采样参数(temperature=0.7, top_p=0.8, top_k=20)。
  • 思考预算示例:用两次调用限制思考长度,适合对时延敏感的在线服务。
  • 速度基准:各规格模型在不同上下文长度下的显存占用与 tokens/s 吞吐数据,选规格前先看这张表。

一句话总结:Qwen3 的价值在于从笔记本能跑的 0.6B 到 235B 旗舰 MoE 共用同一套 API 与部署方案,而该让模型「先想后答」还是「直接干活」,由你按场景选对型号即可。

【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/4 11:32:17

内部工具半天就能上线,Budibase 这个开源低代码平台凭什么

内部工具半天就能上线,Budibase 这个开源低代码平台凭什么 【免费下载链接】budibase AI agents, automations and apps that run your operations. Model agnostic. 项目地址: https://gitcode.com/GitHub_Trending/bu/budibase Budibase 是一个开源低代码平…

作者头像 李华
网站建设 2026/9/4 11:30:17

电阻、电容、三极管选型决策链:从电路角色到可靠设计

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 11:29:42

10分钟跑通凭证检测:TruffleHog 从安装到 CI 防泄露实战

10分钟跑通凭证检测:TruffleHog 从安装到 CI 防泄露实战 【免费下载链接】trufflehog Find, verify, and analyze leaked credentials 项目地址: https://gitcode.com/GitHub_Trending/tr/trufflehog 上周一个同事把带 API key 的 .env 提交进了仓库&#xf…

作者头像 李华
网站建设 2026/9/4 11:26:14

Vue3 Nuxt4 SSR项目从零到生产:Ubuntu服务器部署全流程详解

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 11:26:00

SQLiteSpy高效管理SQLite数据库:从数据浏览到加密处理全解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 11:24:06

Ice:macOS 菜单栏管理工具,图标隐藏、拖拽排序与刘海屏适配

Ice:macOS 菜单栏管理工具,图标隐藏、拖拽排序与刘海屏适配 【免费下载链接】Ice Powerful menu bar manager for macOS 项目地址: https://gitcode.com/GitHub_Trending/ice/Ice 在带刘海的 MacBook 上,每装一个应用,时钟…

作者头像 李华