GitHub 趋势 · 第 29 期

17,942 star 的本地知识库:它想把 RAG 的「每次从头再问一遍」干掉

#本地优先#知识库#GPL-3.0

我的判断:llm_wiki 攻击的不是「检索不准」,而是「每次都重新推导」这件事本身。它把 RAG 那条链子反过来——不让 LLM 在你每次提问时才去临时拼凑答案,而是先把你的文档一次性编译成一本互相链接的 wiki,之后只是维护它。这是理念级的差异,不是又一个套壳向量库。但要注意:它的许可证是 GPL-3.0,不是这一系列常见的 MIT。

痛点场景:你攒了 300 篇 PDF、一堆网页剪藏和会议记录,然后接了个 RAG。结果每次问同一个问题,系统都要重新切块、重新召回、重新组织语言——你昨天已经让它总结过的那部分,今天它一点印象都没有。更糟的是,答案散落在一次性的对话里,不会沉淀成任何你下次能直接翻的东西。知识库用了一年,本质还是一堆等待被检索的原始文件。

项目是什么

nashsu/llm_wiki 的自我定位只有一句:「A personal knowledge base that builds itself.」——一个自己会长出来的个人知识库。展开说是:LLM 读你的文档,建出一本结构化的 wiki,并且持续把它保持在最新状态。README 里对「与 RAG 的区别」说得很直白:传统 RAG 是每次都从零检索再回答(retrieve-and-answer from scratch every time),而它是一次性编译知识、之后只做维护——原话是「Knowledge is compiled once and kept current, not re-derived on every query.」

技术形态上它是个跨平台桌面应用(Tauri v2 + React 19,Rust 后端),不是让你 import 的 Python 库。这一点决定了它的用法:下载安装包、打开、配好模型 key、把文档丢进去,然后用图形界面浏览那本被养出来的 wiki 和一个知识图谱。最新版本 v0.6.11(2026-08-25),仓库累计 856 次提交,处于活跃维护状态。

核心能力

下面这些能力名与说明都直接取自 README 的 Features 清单,我按「你用得上」的顺序重排了一下:

能力README 原文要点
两步思维链入库Two-Step Chain-of-Thought Ingest:先分析、再生成 wiki 页面,带来源可追溯与增量缓存
多格式解析PDF、Office 文档、EPUB/MOBI、Org mode、图片、媒体、网页剪藏,支持批量 URL;PDF 可走内置/云端/本地 MinerU
四信号知识图谱4-Signal Knowledge Graph:直接链接、来源重叠、Adamic-Adar、类型亲和度
社区发现Louvain Community Detection:自动发现知识聚类并给出内聚度评分(低于 0.15 会告警)
图谱洞察Graph Insights:给出「意外的关联」与「知识缺口」,可一键 Deep Research
向量语义检索可选,基于 LanceDB,支持任意 OpenAI 兼容端点;默认关闭
多模型配置按项目配模型,Chat 与 Ingest 可独立路由;支持 OpenAI / Anthropic / Google / Ollama / Custom
只看原文回答Read Sources Only 模式:只用导入的原始材料作答,抑制模型自由发挥
本地 API + MCP内置 127.0.0.1:19828 的 JSON API 与 MCP server,支持混合检索、读文件、图谱遍历
Chrome 剪藏Chrome Web Clipper 扩展,一键抓当前页面并自动入库(Manifest V3)
入库队列Persistent Ingest Queue:串行处理,崩溃可恢复,支持取消、重试与进度可视化

上手

最省事的是直接下预编译包,README 给的平台清单是:macOS 用 .dmg(Apple Silicon + Intel)、Windows 用 .msi、Linux 用 .deb / .AppImage,都在 Releases 页。

要自己构建的话,README 原文(前置条件:Node.js 20+、Rust 1.88+、protoc):

git clone https://github.com/nashsu/llm_wiki.git
cd llm_wiki
npm install
npm --prefix mcp-server ci && npm run mcp:build   # mcp-server/dist is bundled as a Tauri resource
npm run tauri dev      # Development
npm run tauri build    # Production build

它还给了一条「让你的 Agent 直接会用这个知识库」的路径,README 原文就是一句 npx(注意它指向的是配套的 skill 仓库,不是主仓库):

npx skills add https://github.com/nashsu/llm_wiki_skill.git --skill llm-wiki

装完技能后,你在 Claude Code / Codex 里说「在我的 wiki 里找一下 X」,Agent 就会走它内置的本地 API 去查。README 特别注明了一条克制的设计:这个技能不会在你泛泛说「搜一下我的笔记」时乱触发,只有你明确提到 LLM Wiki / my wiki / 知识库 才会激活。

我的判断

适合谁:文档量大、且长期反复查同一批材料的人——研究者、写作者、要维护内部知识库的小团队。你的痛点是「知识没有沉淀」而不是「搜不到」,那这本会长大的 wiki 正好对症。另外它支持 Ollama,本地模型党可以完全离线跑,这一点对在意数据不出本机的人很关键。

不适合谁:只是偶尔问一次文档的人——传统 RAG 甚至直接把文档粘给模型就够了,养 wiki 的入库成本反而是负担;以及要把它嵌进自有产品做二次分发的人,见下面第一条坑。

几个坑(均来自 README 或仓库原文):

  • 许可证是 GPL-3.0,不是 MIT。这是本期最需要提请读者注意的一点,也是我把它列为选题风险点的原因。GPL-3.0 是强 copyleft:你可以免费用、可以商用,但一旦对外分发(含打包进你的产品、做成商业服务),衍生作品必须同样以 GPL-3.0 开源,且不能并入闭源软件。这跟本系列前几期写过的 MIT / Apache 2.0 项目性质完全不同。个人自用、公司内部用没问题;想拿它当商业产品的底座,先找法务。
  • 「开源免费」不等于「零成本」。它本身不收费,但每次入库和每次问答都要调 LLM。README 要求你在 Settings 里配 API key 和 model(OpenAI / Anthropic / Google / Ollama / Custom 之一)。用云端模型就是按 token 付费,而且入库是「两步思维链」——先分析再生成,等于同一份材料要过两遍模型。文档量大时,这笔账要先算。
  • 向量检索默认是关的,而它明显影响效果。Vector Search 在 README 里写明「fully optional, disabled by default」,要自己去 Settings 开、并且单独配端点、API key 和模型。而 README 同时给了一个基准数字:开启向量检索后,整体召回率从 58.2% 提升到 71.4%。也就是说你什么都不改直接开箱用,拿到的是相对偏弱的那一档检索质量。
  • 复杂 PDF 的处理是分层的:内置解析器是兜底,效果最好的一档要接 MinerU(云端、官方本地 API 或本地 pipeline 三种模式)。README 也承认 MinerU 失败时会回退到内置解析器。扫描件多的用户,先把这条链路跑通再批量导入。
  • Deep Research 不是白送的:它靠 Tavily、SerpApi 或 SearXNG 做多查询网络搜索,前两个要各自的 API key(SearXNG 用实例地址)。这是第三个可能要额外掏钱的地方。另外可选 Firecrawl key。
  • 它是桌面 GUI 应用,自动化能力靠本地 HTTP API:README 写的是 http://127.0.0.1:19828(token 保护、仅限 127.0.0.1),Chrome 扩展通信另走 19827。想集成进脚本化流程,得围绕这两个本地端口做。想从头构建的门槛也不低:Node 20+、Rust 1.88+,外加 protoc。
  • Rust 后端里带了一个会用工具的 Chat Agent,能生成文件、也能执行 shell——README 说明它对外部 shell 命令仍要求显式批准(项目工作区内的命令则可顺畅执行)。这是个合理的默认值,但意味着你在用它跑任务时,批准弹窗得看清楚。

仓库:github.com/nashsu/llm_wiki

总 star:17,942(截至 2026-09-11,今日 +94)

许可证:GNU General Public License v3.0(强 copyleft)

技术栈:Tauri v2 + React 19,Rust 后端;v0.6.11(2026-08-25),856 commits

抓取时间:2026-09-11 02:31(GMT+8)

你现在的知识库,是「每次问都重新检索」的,还是已经沉淀成了能直接翻的东西?如果你已经试过把 RAG 换成养 wiki 的思路,评论区说说实际体感——尤其是文档量上去之后它还稳不稳。

下期预告:armory3d/armorpaint(4,317 star,C 写的开源 3D 贴图绘制工具,今日榜 +87)——本地创作工具这条线我们写得不多,值得补一期。

#本地优先#知识库#GPL-3.0