相信大家都可能遇到过这种情况:为了让 AI 帮你写一篇文章,先上传旧稿,再解释账号定位,接着补充资料和语气要求。好不容易聊出满意结果,几天后换个对话,一切又要重来。

问题不一定是 AI 不够聪明,而是你的资料没有形成一套能被持续读取、整理和更新的系统。

AI 知识库,重点不在“库”

很多人提到知识库,会先想到购买软件、导入几千篇收藏,或者研究 RAG 和向量数据库。对普通人来说,这些都可以晚一点。

第一版只要解决一件事:让 AI 知道资料在哪里、哪些内容可信、什么可以修改,以及有价值的结果要保存到哪里。

Karpathy 分享的 LLM Wiki 将这套结构分成三层:原始资料保持不动;AI 根据资料维护 Markdown 知识页;规则文件告诉 Agent 如何读取、引用和更新。这样留下来的不只是一次回答,而是一套会逐渐变得更完整的知识体系。

小白只需要准备四样东西

第一,一个普通文件夹。资料优先保存为 Markdown,也可以保留 TXT。Markdown 只是更方便分标题、列清单和建立链接,并不需要学习编程。Obsidian 可以用来阅读这些文件,但底层资料仍是普通文本,换软件也能打开。

第二,一项真实任务。写公众号、备考、整理项目,先选一个。不要一开始把整个网盘塞进去,否则分类会越来越复杂,实际问题却一个都没解决。

第三,一个能读取指定文件夹的 Agent,例如 Codex。第一次只开放知识库目录,不要直接授权整个电脑。

第四,一份规则文件。它要明确:原始资料只能读;新内容写入指定目录;回答必须保留来源;资料不足就直接说明;删除、覆盖和移动文件前先征求确认。

用 30 分钟跑通第一版

先新建一个文件夹,放入下面三层结构:

AI-Knowledge-Base/
├─ raw/          # 原始资料,只读
├─ wiki/         # AI整理后的知识页面
│  └─ index.md   # 页面索引
└─ AGENTS.md     # 工作规则

接着只挑 3—5 份非敏感资料。例如做写作知识库,可以放入两篇旧文章、一份选题笔记和一份账号定位说明。

然后把这段任务交给 Agent:

请先读取当前知识库目录,不要修改任何原始文件。

围绕“我已经反复表达过哪些观点”整理一份主题清单:
1. 每个观点标明来源文件;
2. 相似观点合并,冲突内容单独标注;
3. 给出3个可以继续写的新角度;
4. 将结果保存为 wiki/写作观点地图.md;
5. 更新 wiki/index.md;
6. 涉及覆盖、移动或删除时先停止并询问。

最后,用 Obsidian、编辑器或文件管理器打开结果,检查来源是否准确、有没有过度推断。确认有价值后再保留。到这里,“读取—整理—引用—写回”的最小闭环就已经跑通。

三个最容易踩的坑

一是把收藏当知识。存了几千篇文章但从不解决真实问题,只会得到更整齐的信息仓库。

二是让 AI 随意改原文。原始资料应该是事实依据,默认只读;AI 的总结另存为新文件,才方便追溯和纠错。

三是过早追求“全自动”。第一版先人工检查每次更新。等文件明显变多、普通搜索经常漏找,再考虑统一命名、索引、查重、RAG 或向量检索。

我的观察

AI 知识库最大的价值,并不是让搜索快几秒,而是把一次次对话变成可以继续利用的个人资产。

工具会换,模型也会更新。只要资料仍是自己能打开的文件,规则写得清楚,来源能够追溯,这套系统就不会被某个软件锁住。

如果今天只做一步,不妨先建一个文件夹,放入三份真正会用到的资料。你最想先搭写作、学习,还是项目知识库?

行动清单

  1. 只选择一个近期任务,不做“万能知识库”。
  2. 建立 raw/wiki/AGENTS.md 三层结构。
  3. 首批只导入 3—5 份非敏感资料。
  4. 原始资料设置为只读,AI 结果另存新文件。
  5. 要求每条结论保留来源,冲突和缺失单独标注。
  6. 第一次只授权知识库目录,删除和覆盖必须人工确认。
  7. 完成一次问答后,把有价值的结果写回 wiki/ 并更新索引。