📌 项目地址jingyaogong/minimind | ⭐ 55,933 颗星 | 🔧 Python | 📜 未标注

先说这个数字游戏

55,933 Star,Python,Apache 2.0 协议。jingyaogong/minimind 是目前星标数最高的中文 LLM 教学项目之一。

README 里最抓眼球的两个数字——3 块钱、2 小时——都有明确注脚:“2 小时”指 SFT 阶段在单张 NVIDIA 3090 上跑完 1 epoch 的实测耗时,“3 块钱”是对应时段的 GPU 租用成本。不是营销话术,口径可查。

训出来的模型约 64M 参数,体积是 GPT-3 的 1/2700。所以这个项目的目标用户不是要拿模型干活的人,是想搞清楚模型内部到底在发生什么的人。

它针对的痛点很具体

作者在 README 里点名了两个问题,我读下来觉得判断准确。

第一个:大多数人学 LLM 的路径是下载一个开源模型,用 LoRA 微调一下,教会它几个新指令。作者的原话是,这像“教牛顿如何使用 21 世纪的智能手机”——事情本身有趣,但和物理学没关系。你在调参,不在理解模型。

第二个:transformerstrlpeft 这些库把全流程封装到十几行代码就能跑完“加载模型 + 数据集 + 推理 + 强化学习”。封装是好事,但副作用是你和底层实现之间隔了一整层。loss 怎么算的、采样策略怎么生效的,黑盒依旧。

MiniMind 的回答是把这层封装拿掉:所有核心算法用 PyTorch 原生从 0 实现,不依赖第三方库的高层抽象接口。训练,不是推理——这是它和多数“LLM 入门”资源的分界线。

64M 的模型,全尺寸的训练链路

这个项目最超出我预期的不是模型,是链路覆盖范围。一个个人 GPU 能跑的小模型,训练流程却对齐了工业界:

  • 结构:Dense 和 MoE 两种,主线结构对齐 Qwen3 / Qwen3-MoE 生态
  • 数据:从收集、蒸馏、清洗到去重的全阶段开源数据集,附带 Tokenizer 训练代码
  • 训练阶段:Pretrain、SFT、LoRA、RLHF(DPO)、RLAIF(PPO / GRPO / CISPO)
  • 进阶能力:Tool Use、Agentic RL、自适应思考、模型蒸馏
  • 评测:C-Eval、C-MMLU、OpenBookQA 等第三方测评集,支持 YaRN 做 RoPE 长文本外推

工程侧也不缩水。单机单卡和单机多卡(DDP、DeepSpeed)都支持,有 wandb / swanlab 可视化,训练可以动态启停。推理兼容 llama.cpp、vllm、ollama,也兼容 transformerstrlpeft 和 Llama-Factory——也就是说,学完从 0 的实现后,你可以无缝切回主流工具链。

部署这块还有个细节:项目提供兼容 OpenAI API 协议的极简服务端,支持 reasoning_contenttool_callsopen_thinking,可以直接接 FastGPT、Open-WebUI。另外有 Streamlit 写的聊天 WebUI,支持思考过程展示和多轮 Tool Call。

几个实验性分支

主线之外,项目维护着一批拓展方向:视觉模型 MiniMind-V、多模态 Omni 模型 MiniMind-O、离散扩散语言模型(dLM)、线性注意力模型(Linear Attention)。dLM 和 Linear Attention 放在仓库 Discussions 里(#618 和 #704),都可以基于主线 AR 模型续训,不用从头开始。这些分支紧跟当前研究热点,拿来做论文复现的起点也够用。

上手路径

两个零成本入口:ModelScope 上的在线体验页,和 B 站视频介绍(BV12dHPeqE72)。建议先在线玩一下,对 64M 模型的对话能力有个现实预期,再决定要不要租卡自己训。

具体训练命令和数据准备流程在仓库 README 各阶段文档里。我没把命令抄进这篇文章——项目迭代很快,文档以 master 分支为准。

我的判断

64M 就是 64M,对话质量不可能接近商用模型,这是物理事实。但我认为这个项目的价值恰恰在于:当你亲手写过一遍 attention、RoPE、DPO、GRPO 之后,再回头用 trl 那十几行代码,你清楚每一行背后发生了什么。

3 块钱换一次拆开 LLM 黑盒的机会,对学习者来说这笔账不难算。

这篇文章对你有帮助吗?

发表回复