📌 项目地址:garrytan/gbrain | ⭐ 19,673 颗星 | 🔧 TypeScript | 📜 MIT
一个 CEO 的生产系统,不是 side project
仓库是 garrytan/gbrain,TypeScript,19,673 星,作者 Garry Tan——Y Combinator 现任总裁兼 CEO。
先看数字,这些不是宣传话术,是他自己部署的实际负载:155,795 页资料、24,589 个人物档案、5,340 家公司实体,66 个 cron 任务自主运行。数据源包括会议记录、邮件、推文、语音通话和他随手记的想法。系统夜间自动运行:修复引用错误、整合重复记忆、对遇到的人物和公司做信息补全。
README 里那句定位语值得原样引用:”Search gives you raw pages. GBrain gives you the answer.” 搜索给你页面,GBrain 给你答案。
和普通 RAG 的差别在哪
大多数个人知识系统本质上是关键词匹配 + 向量检索:你问一句,它扔回十个相关片段,拼接和判断归你自己。
GBrain 返回的是合成后的完整回答,跨人物、公司、交易、想法整合,每个事实带引用。这部分市面上有别的产品在做,不稀奇。
稀奇的是 gap analysis(缺口分析)。系统会在回答末尾明确告诉你“大脑里还缺什么信息”。原文说得很重:”The gap analysis is the part that changes how you use the brain.”
我的理解:做决策时最危险的不是信息不够,而是不知道哪些信息缺。系统能说“Acme AI 的融资记录完整,但创始团队背景没有记录”,这比多推十个片段有用得多——你至少知道下一步该去补什么。
零 LLM 调用建知识图谱,这是最值得琢磨的工程决策
每次写入一页,系统自动抽取实体引用,创建带类型的边:
attended(参加过)works_at(就职于)invested_in(投资了)founded(创立了)- `advises(担任顾问)
整个过程零 LLM 调用。
为什么这个设计值得注意。知识图谱的常规做法是调 LLM 抽三元组,费用和延迟随数据量线性涨。Garry 走了规则路线。代价明显:只能处理模式化的高频关系,复杂语义关系抽不出来。但对 works_at、invested_in 这类结构化关系,规则方案在成本上是碾压性的——而且可预测、可调试。
有了图,就能回答向量检索够不到的问题:”谁在 Acme AI 工作?”、“Bob 这个季度投了什么?”。这类问题需要的是精确的关系遍历,不是语义相似度。
Benchmark:数字说了什么,没说什么
评测语料是 240 页 Opus 生成的富文本,结果:
- P@5 49.1%,R@5 97.9%
- 比关闭图谱的版本 P@5 高 31.4 个百分点
- 对 ripgrep-BM25 + 纯向量 RAG 的领先幅度相近
完整评分卡在姊妹仓库 gbrain-evals,可以自己核对。
两点解读。召回率 97.9%、精确率 49.1%,意味着它会多给但基本不漏。对“大脑”类工具,这个取舍方向是对的——漏掉关键事实的代价远大于多看几条结果。
但也要留个心眼:240 页语料上的领先,放到 15 万页的真实部署上是否保持,README 没给数据。这是需要自己验证的部分。
多人版:权限隔离 + fuzz 测试
GBrain 现在能当公司级共享记忆用。每个成员按登录身份拿到数据切片,查询时只能看到自己有权的内容——别人的笔记、其他团队的数据一律不可见。
README 说他们对所有读取路径(search、list、lookup、多源读取)做了 fuzz 测试,结果是零泄漏。
这个方向正好对上 YC 刚发布的 Request for Startups 里的 company-brain。想在这个方向做产品的人,可以直接在 GBrain 上构建。官方教程在 docs/tutorials/company-brain.md。
两种接入方式
- 在 GBrain 上跑一个完整的自主 agent(Garry 自己的 OpenClaw 和 Hermes 部署就是这么跑的)
- 一条命令接入 Claude Code 或 Codex,作为增强检索层
数据全部跑在你自己的硬件、你自己的数据库上。
我的判断
值得花时间看的理由:它是真实生产负载跑出来的系统,不是论文复现;零 LLM 调用的图谱抽取是个可以搬到自己项目里的工程决策;gap analysis 指出了 RAG 工具普遍缺失的一环。
保留意见:benchmark 语料偏小,权限模型只过了 fuzz 测试、没经过真实恶意攻击的检验。但对一个开源项目来说,这个完成度已经少见——尤其考虑到作者每天真的在用它。