📌 项目地址:semantica-agi/semantica | ⭐ 2,254 颗星 | 🔧 Python | 📜 未标注
问题的起点
README里有一句话我印象很深:“They store embeddings, not meaning。”这句话说得很狠,但对受监管行业来说是实情。
信贷审批被拒,监管会问:这个决定基于什么数据、什么规则、哪条路径?Lending场景里,AI Agent的批准决定要在几个月后经得起监管的“为什么”。医疗诊断、政务审批、法律判断同理。
大部分AI系统给不出这个答案。向量相似度能告诉你两段文本“相近”,说不清因果关系。LLM的推理本身就是概率过程,温度不为零时,同一条输入不保证同一个输出。日志记录了“调用了哪个API”,记不住决策依赖的数据和规则。
Semantica解决的是这个工程问题:从原始数据到最终决策,有没有一层基础设施能把完整依赖链记录下来?
什么是Semantica
项目自我定位是“AI Agent的开源版Palantir”,目标用户是金融、医疗、法律、政务这类不能装黑箱的行业。安装只需一条命令:
pip install semantica
它不是LLM,不替代向量库,不编排Agent。它垫在LLM、向量库和Agent框架底下,做一件事:确定性基础设施。图构建、推理、溯源,全程不需要LLM参与。
这层设计解决了两个问题。第一,需要被审计的部分彻底脱离概率性系统。第二,解释决策这个动作从“事后编故事”变成“沿图遍历”。
四段管道
README给出了完整链路:
Ingest your enterprise data, extract what matters, build a Context Graph and knowledge graph, and run graph analytics and causal reasoning over all of it, with full decision provenance baked in.
拆开来看:
接入。 企业数据从现有系统直接拿,不用先导出给第三方。README明确提到了Databricks和Snowflake场景:数据已经在Unity Catalog或Snowflake仓库里,表可以直接变成图,不给第三方SaaS过一道手。这一点对合规团队有实际意义——数据出境本身就是合规成本。
抽取建图。 从原始数据中抽出实体和关系,构建Context Graph和知识图谱。这个抽取过程走确定性逻辑,不是LLM从文本里猜。同一条数据进去,永远得到同一个图。规则是写死的,不是采样的。
图分析与因果推理。 在图结构上做分析,推理走规则引擎,不走概率采样。这是与LLM推理最本质的分界。
决策溯源。 “Provenance baked in”,溯源不是事后附加的日志,是图结构的一部分。决策节点连向触发它的数据节点,数据节点连向来源,规则节点标明依据哪条策略。审计顺着图走,看到的是完整链条,不是断点式的记录。
为什么确定性是审计的前提
监管要的不只是“能解释”,还有“能复现”。同一条数据、同一组规则,必须每次得到同一个结论。一个模型再可解释,如果每次跑出来结果都不一样,审计同样做不了。
“deterministic”在README里反复出现,指的就是图构建确定性、推理确定性、决策路径确定性。整条链路没有概率采样步骤。
这解决了一个隐蔽的问题:事后解释和事前决策不一致怎么办?LLM时代经常发生这种脱节——模型做出决定,事后解释者讲一个说得通的叙事,但叙事和实际决策依赖未必是同一回事。Semantica的路径和图结构是决策时直接生成的,解释不是事后构建,而是结构里本来就有。
溯源图不是审计日志
一个容易混淆的点:Semantica的溯源是图,不是日志。
日志记录时间点快照——某时刻调用了某模型,输出了某结果。图记录关系——某个结论依赖了哪些实体、哪些关系、哪些规则。
区别在查询方式。“这条数据从哪里来”是数据血缘查询,“为什么影响了这个决定”是决策路径查询。日志系统处理这两种查询非常吃力,图结构上就是一次遍历。
数据不动,图建在数据所在处
我读README时最关注的一点:Semantica可以直接在Databricks和Snowflake上建图,不需要先把数据迁移到另一个系统。
对基础设施选型来说,这个取舍很实际。企业数据平台已经沉淀了大量规范的表结构,数据复制到外部系统有成本和风险。在表所在的位置直接构建知识图谱,意味着知识图谱只是叠加在数据之上的一层结构,不要求底层数据搬家。
这可能是“开源版Palantir”这个定位的真正含义——Palantir的核心能力之一就是从分散数据中建立关系网络,再基于关系网络做决策推理。Semantica把这条路开源了,并且不强制数据集中到它自己那里。
图存储双轨制
语义层支持两种图模型:
- RDF,W3C标准的语义网模型,适合表达本体、类别和推理规则
- LPG,属性图模型,适合表达实体之间带属性的复杂关系
同时支持两者,README里标着“Polyglot Graph Storage”。面向W3C标准意味着数据模型和查询方式不是私有格式,审计要标准化访问时不会被某个厂商绑死。
什么不是Semantica
它不是向量数据库。向量相似度解决“找相近内容”,它解决“证明因果路径”。
它不是LLM应用框架。LangChain编排模型调用,它不碰模型调用,只做确定性存储与推理层。
它不是BI工具。BI展示聚合指标,它展示实体间的关系网络和决策依据链。
这些边界和它做了什么一样重要。定位清晰的好处是,选择它的人不会期待错的东西。
值得关注的原因
我不评价这个项目当前是否成熟,但它的技术选择值得关注:
第一,它把“可解释AI”从算法层的问题变成了基础设施层的问题。模型可以黑箱,但记录决策依赖链的层必须确定性。这个思路和监管需求是吻合的。
第二,它不需要LLM参与图构建和推理。这个边界很克制,很明确。让需要被审计的部分脱离概率性系统,这既是技术选择,也是产品立场。
第三,它给出了一个自托管的开源方案。数据不出企业边界就能构建可溯源的知识图谱。对高合规行业来说,这是先决条件。
判断这个方法是否适合你的业务,有一个快速标准:你的AI系统需要回答“为什么是这个决定”吗?如果需要,考虑在Agent栈下面加一层确定性的记录层。Semantica提供了这种方案的一个开源实现,值得花半小时跑一遍。