📌 项目地址:QwenLM/Qwen3 | ⭐ 27,269 颗星 | 🔧 Python | 📜 未标注
打开 QwenLM/Qwen3,你会发现它不是一个传统意义的开源项目仓库。README 不教你安装,不贴 API 示例,也不直接放权重文件。它做的是指路:权重在 Hugging Face 和 ModelScope,文档在 readthedocs,在线 Demo 在 Qwen Chat。
这个仓库有 27,269 颗星,是 Qwen 系列的官方入口。如果你想用 Qwen3,这里是唯一正确的起点。我把 README 和官方文档完整过了一遍,下面几条判断能帮你少走弯路。
先搞清楚两个模型:Instruct 和 Thinking
2025年7月发布的 Qwen3-2507 分两条产品线,名字很容易混淆,但理解决策很简单:你需要的是一个直接回答问题的模型,还是一个先推理再回答的模型。
Qwen3-Instruct-2507 是原版 Qwen3 非思考模式的升级版。README 列了几个关键改进:
- 通用能力显著提升,包括指令跟随、逻辑推理、文本理解、数学、科学、编码和工具使用
- 多语言长尾知识覆盖大幅增强
- 在主观和开放式任务上更贴合用户偏好,生成文本质量更高
- 256K token 长上下文理解增强,可扩展至 100 万 token
Qwen3-Thinking-2507 是原版思考模型的延续。它的重点在推理质量和深度:
- 在逻辑推理、数学、科学、编码等推理任务上显著提升
- 在需要人类专业知识的学术基准上,达到开源权重推理模型中的最优水平
- README 用了一个很具体的词:state-of-the-art results among open-weight thinking models
三个尺寸,按需取用
官方提供三个尺寸:235B-A22B、30B-A3B、4B。这个命名方式值得解释一下:A 前面的数字是总参数量,A 后面是激活参数量。
- 235B-A22B 是 MoE 架构旗舰,每 token 只激活 22B 参数。适合追求极致性能、有足够推理资源的场景。
- 30B-A3B 也是 MoE,激活参数仅 3B。在性能与推理成本之间取了一个平衡点。
- 4B 是稠密小模型。如果你要在本地或者边缘设备跑,这个是唯一现实的选择。
我个人判断:对大多数开发者和企业用户,30B-A3B 是性价比最高的起步点。资源受限或者做實驗验证用 4B,追求上限用 235B。
怎么找到模型和代码
官方给了两种找模型的方式:
一是直接访问 Hugging Face 或 ModelScope 组织主页,搜索前缀为 Qwen3- 的 checkpoint 文件。
二是访问 Qwen3 collection 页面,所有模型都在一个合集里,方便横向比较。
如果你在国内,ModelScope 的下载速度通常优于 Hugging Face,建议优先走这条线。
官方文档的五个模块
Qwen 的文档站点分五个部分,对应不同使用阶段:
- Quickstart —— 基础用法和演示,适合第一次跑通
- Inference —— Transformers 推理指南,涵盖批量推理、流式输出等
- Run Locally —— 在 CPU 和 GPU 上本地运行,涉及 llama.cpp、Ollama、LM Studio
- Deployment —— 大规模推理部署,用 SGLang、vLLM、TGI 等框架
- Quantization —— GPTQ、AWQ 量化实践,以及如何制作高质量的 GGUF 文件
- Training —— 后训练指导,包含 SFT 和 RLHF,用 Axolotl、LLaMA-Factory 等框架
- Framework —— 与 RAG、Agent 等应用框架集成
英文文档在 qwen.readthedocs.io/en/latest,中文在 qwen.readthedocs.io/zh-cn/latest。
这七个模块覆盖了一条完整的使用链:跑通 → 优化推理 → 本地部署 → 大规模部署 → 量化 → 微调 → 集成应用。
我的判断
Qwen3-2507 这批更新,重点是两个方向:Instruct 版本在巩固通用能力,Thinking 版本在冲击推理上限。
如果你在做 Agent 应用、工具调用或者 RAG 管线,Instruct-2507 是更稳妥的选择。它的指令跟随和工具使用能力有明确提升。
如果你处理的是数学推理、复杂逻辑或需要深度分析的任务,Thinking-2507 更值得尝试。它在推理基准上的表现是它存在的理由。
仓库本身不需要 star,但它的 README 值得细读。模型的差异、能力的边界、部署的路径,都写在里面了。剩下的就是跑一次试一下。