📌 项目地址antirez/ds4 | ⭐ 19,922 颗星 |
🔧 C | 📜 未标注

antirez又发新东西了。这次不是数据库,是本地推理引擎,仓库叫ds4,项目代号DwarfStar。

我把它从头到尾读了一遍,有几个地方值得聊聊。

它是什么,不是什么

DwarfStar是一个自包含的本地推理引擎,核心优化目标是DeepSeek V4
Flash。它也支持GLM 5.2,在内存足够大的机器上可以跑DeepSeek V4 PRO。

它不是一个通用的GGUF运行器。README里说得很清楚:“self-contained and
deliberately
narrow”。模型加载、提示词渲染、工具调用、KV状态、HTTP服务器、编码代理,这一整套东西是围绕那几个模型协同设计和测试的。

通用框架为了兼容成百上千个模型,必须在抽象层上做大量妥协。DwarfStar反过来,只服务少数几个模型,要求硬件和内存尽量匹配,把每条路径都做到最窄、最快。

模型支持策略也很直接。README原话是:“A model may be removed when a
better replacement arrives.” 哪个权重更好就换哪个,没有长期承诺。

后端的划分逻辑

三个后端,分得很清楚:

  • Metal是主目标,要求Mac内存96GB起步。内存不够有SSD流式方案兜底。
  • NVIDIA CUDA支持多GPU系统和DGX Spark。
  • ROCm支持Strix Halo平台,比如Framework Desktop。

这里有一段测试数据值得展开。README提到,用CUDA多GPU支持加ds4-server的微批处理,可以把8张L40S这种Ada
Lovelace架构的老卡变成多用户LLM服务器。vLLM已经不再为这套架构支持新模型了,DwarfStar还在干这活。测试结果是:聚合生成速度120
t/s,prefill速度2000 t/s,多会话并发效果良好。

另一个场景是两台MacBook M5 Max或M3
Ultra通过RDMA互联,用张量并行跑4-bit的DeepSeek Flash或GLM
5.2。想要更大的模型,用流水线并行把多台机器的内存加总,突破单机限制。

这两个场景,一个解决老卡再利用,一个解决单机内存不够。都不是什么新鲜想法,但把它们做成产品的项目不多。

和llama.cpp的关系,README这次写得很坦率

有一个细节值得注意。README专门写了一节致谢,说ds4.c不链接GGML,但这个项目“存在是因为llama.cpp和GGML开辟的道路”——内核、量化格式、GGUF生态、工程经验,都来自那里。还特别感谢了Georgi
Gerganov和所有贡献者。

这不算fork,更像是一种站在巨人肩膀上的独立实现。它用了llama.cpp验证过的思路,但没有直接去链接那些库。对antirez这种级别的系统程序员来说,更可能是他想完全掌控推理管线的每一层。这种做法的代价和收益,用过的心里都清楚。

绕不开的开发方式

README里有一节叫“AI full disclosure”,写得很直接。这代码是GPT
5.5、5.6和Claude
Fable辅助写的,人类主导想法、测试和调试。作者说得很明白,如果你不能接受AI大量参与的代码,这个项目不适合你。

我没有资格评判这种开发方式的工程质量,但有一点可以肯定:项目对代码的所有权和责任划分是清晰的。AI负责生成,人类负责把关。和那些用AI生成代码然后不承认的项目比,这个态度算有担当。

当前状态和实际用法

README目前没有给出安装和启动命令。这个仓库还在快速迭代,具体怎么编译、怎么跑,需要直接去仓库看最新的README和源码。我能告诉你的只有:它是自包含的,不依赖GGML链接,支持GGUF、imatrix、质量和速度相关的工具和数据都放在仓库里。

如果你想亲自上手,最靠谱的路子是fork一份,然后盯住仓库动态。

我的判断

DwarfStar是典型的antirez式项目:赌性很强,思路激进,文档写得坦诚。它押注的是“少数几个顶尖开源权重就能覆盖多数本地推理需求”这个判断——在DeepSeek
V4 Flash和GLM 5.2这个时间点,这个判断有它的道理。

如果你需要的是通用推理工具,每天换不同模型玩,千万别选它。如果你想在高端个人硬件上把DeepSeek
V4 Flash或GLM
5.2跑到极限,或者让老CUDA卡重新产出价值,这个项目值得放下手头的事研究一下。

antirez用Redis证明过系统设计能力,这次在AI推理领域的选择,我会继续跟。等文档补全了,我会写一篇实操。

这篇文章对你有帮助吗?

发表回复