跳到正文
远在天边,好东西在眼前.
返回

一篇文章讲清楚,小白如何从0到1搭建自己的AI知识库(内附提示词)

文章封面

朋友们大家好啊,我是金尘马。

相信很多人都已经开始用 AI 工具了。豆包、DeepSeek、ChatGPT,手机里至少装了一个。

但好多人可能体感上还是觉得 AI 不够好用。

自己资料散落在不同地方:文章在收藏夹里,文件在网盘里,想法留在聊天记录里,笔记又放在不同的软件里。

每次需要 AI 帮忙,都要重新上传资料、重新解释背景。好不容易聊出一个不错的结果,它又只能留在对话框里。下次遇到相似的问题,还是要从头开始。

这时候,就需要搭一个数据掌握在自己手里的 AI 知识库了。

那这个知识库到底要怎么搭呢?需要用哪些 AI 工具,资料该怎么整理,需不需要懂技术呢?

过去几个月,我一直在搭建和使用自己的 AI 知识库。这个过程并不难,我今天就来给大家分享一下我的搭建思路。

一个存放文本文件的开放文件夹,一个可以操控这些文件的 Agent 工具,一份清楚的工作规则,再加上一个真实任务场景,就可以启动自己的 AI 知识库了。

AI 知识库,搭的到底是什么?

大家多少都会用到各种软件来管理自己的信息。

有人用 Obsidian,有人用其他笔记软件,也有人直接把文档上传到聊天窗口。

这些方式其实不分好坏,但它们都只是整套工作方式中的一部分。

更准确地说,AI 知识库是一套由文本文件、阅读软件、Agent、规则和真实任务组成的工作方式。

文本文件负责保存资料和知识。Obsidian 或其他支持 Markdown 的软件,方便人去阅读、检查和修改。WorkBuddy、Codex 这一类 Agent 工具,在获得文件权限以后,可以读取、整理、查询和更新这些内容。

规则相当于给 Agent 的工作说明。它要知道去哪里找资料,哪些文件只能读,整理后的内容放在哪里,回答问题时怎样标明来源。

最后还需要一个真实任务来验证知识库是否好用。

这个任务可以是写文章,可以是整理某个学习主题,也可以是复盘一个项目。没有实际用途,文件夹整理得再漂亮,也只是换了一个地方存资料。

这套思路可以参考 Andrej Karpathy 分享的 LLM Wiki。 链接:https://gist.github.com/karpathy/442a6bf555914893e9891c11519de94f

他把个人知识库分成了三类内容。第一类是保留不动的原始资料,第二类是 AI 整理和维护的知识页面,第三类是告诉 Agent 怎样工作的规则文件。

这个思路最值得参考的地方在于,每次加入资料、提出问题和得到答案,都可以继续更新知识库。长期留下来的不只是一次聊天结果,而是一套能够继续使用的知识体系。

原文配图

搭建个人知识库,只需要准备四样东西

第一,一个开放的文本文件夹

开放,指资料以普通文件的形式存放。人可以直接打开,获得权限的工具也可以读取,内容不依赖某一款软件。

文本格式可以用 TXT,也可以用 Markdown。

如果手上已经有很多 TXT 文件,不必为了搭知识库先全部转换。

不过我更推荐 Markdown。

Markdown 本身也是普通文本,但它可以用标题区分层级,用列表整理要点,用链接连接不同页面。人阅读的时候更清楚,Agent 处理时也更容易识别文章结构。

更重要的是,Markdown 不依赖某一款笔记软件。今天可以用 Obsidian 打开,以后换成其他支持 Markdown 的软件,底层文件还在。

它不会自动把资料变成知识,但它是一个足够稳定、足够开放的载体。

第二,一个真实任务和一小批相关资料

知识库要先服务一个明确的任务,再放入与它直接相关的资料。一开始,不需要把全部的资料都无脑灌进来。

如果准备做写作知识库,可以先放自己的旧文章、选题笔记和研究材料。如果准备整理一个项目,就先放项目文档、会议记录和复盘。

资料先从非敏感内容开始。身份证件、私人聊天、客户机密和其他高风险材料,先不需要导入。

第三,一个能够操控文件的 Agent 工具

有了文件,还要让 AI 真正进入这个文件夹工作。

可以从 WorkBuddy、Codex 等 Agent 工具里选择,这类工具的特点,就是看它能不能读取指定文件夹,能不能按照规则整理和更新文件,修改之前能不能让人检查和确认。

Obsidian 在这里承担的是阅读和检查。Agent 工具负责干活,阅读软件负责让人看见结果。

第四,一份清楚的工作规则

Agent 能看到文件,不代表它自然就知道应该怎样维护知识库。

第一版先把必要边界写进一个 Markdown 文件,至少说清楚下面几件事。

  1. 原始资料只读取,不覆盖。 2. 整理出的知识页面保存到指定位置。 3. 回答问题时标明使用了哪些来源。 4. 找不到或者资料不足时明确说明,不自行补全。 5. 遇到删除、覆盖和拿不准的内容,先询问再处理。

规则的作用,是把一个通用的 AI 工具变成知道边界的知识库助手。

以后出现新的问题,再把对应规则补进去。完整的分类和规则体系可以根据实际使用逐步完善。

从0到1,用五个动作跑通

第一步,选择一个真实任务

先回答一个问题,这套知识库最近准备拿来做什么?

写作、学习和项目复盘,选一个就够了。

真实任务会反过来决定资料应该放什么、Agent 需要怎样整理、最后要输出什么。没有任务,分类很容易越做越多,最后却不知道怎么用。

原文配图

第二步,建立最小文件结构

在知识库文件夹里,先分出原始资料和知识页面,再放入一份规则文件。

原始资料保存事实依据。知识页面保存 AI 整理后的摘要、主题、比较和阶段性结论。规则文件负责告诉 Agent 怎样读取和更新它们。

名字不需要照搬别人的模板,只要自己和 Agent 都能看懂就行。

一段可以直接复制的知识库架构提示词

如果不想自己从头设计目录和规则,可以把下面这段提示词交给 WorkBuddy、Codex 或其他能够读取文件的 Agent 工具。先把方括号里的内容换成自己的实际情况。

```
我想搭建一个个人 AI 知识库,请根据下面的信息,帮我设计第一版的知识库架构规范。

使用场景:[写作 / 学习 / 项目复盘 / 其他]
现有资料:[简单说明资料类型和大致数量]
常见任务:[希望 AI 帮我完成的事情]

请按下面的要求设计:

1. 架构只保留第一版真正需要的内容,至少区分原始资料、知识页面和规则文件,不要一开始加入复杂分类。
2. 说明每个目录和文件分别放什么、由谁维护,以及 Agent 是否可以修改。
3. 原始资料默认只读,不删除、不覆盖。AI 整理出的内容保存为新的 Markdown 文件。
4. 知识页面需要保留来源。资料不足或存在冲突时,明确标注,不自行补全。
5. 修改、移动或删除文件以前,先列出计划,等我确认以后再执行。

最后请输出:

1. 推荐的最小目录结构。
2. 每个目录和文件的用途。
3. 一份可以直接保存为规则文件的内容。
4. 第一个适合用来测试知识库的任务。

先只输出方案,不要直接创建或修改文件。
```

拿到方案以后,先看看目录是否符合自己的使用习惯,再让 Agent 创建文件。第一版不需要设计得很完整,只要自己知道资料放在哪里,Agent 也知道哪些内容能读、哪些内容能改,就可以继续往下走。

第三步,使用 Agent 工具读取知识库

把这个文件夹交给 WorkBuddy、Codex 或自己正在使用的 Agent 工具。

刚开始只开放当前知识库目录,不要直接给整个电脑的权限。第一次先让它查看目录和文件,说明现在有哪些资料、可能分成哪些主题、哪些内容存在权限或来源风险。

这一步的目标只是确认 Agent 能正确读取,不急着改文件。

读取失败时,先检查文件夹位置和授权范围,不需要马上研究更复杂的知识库技术。

第四步,给它第一项具体工作

不要只说「帮我整理一下」。

把任务说具体一点。先让 Agent 读取指定资料,不修改原文件。

围绕一个明确问题整理内容,在结论旁保留来源,并把结果保存成新的 Markdown 页面。涉及删除和覆盖时,先征求确认。

比如做写作知识库,可以让它从现有文章中整理某个主题下已经表达过的观点,再找出可以继续写的角度。

这样得到的不只是一次回答,而是一份以后还能继续更新的知识页面。

第五步,把有价值的结果写回去

很多人使用 AI 的结果没有积累下来,就是因为聊完即止。

一份有长期价值的回答,应该保存回知识库。下次再提出相关问题时,Agent 先查已有页面,再结合新资料更新,而不是重新生成一份彼此无关的答案。

做到这里,第一版就算初步跑通了。

Agent 能根据已有资料回答一个真实问题,并返回来源。结果可以在 Obsidian 或其他软件里重新打开,下次还能继续使用。

如果每次依然从头回答,就检查规则里有没有要求先读取旧页面、再把结果写回。如果担心误改,就把原始资料设为只读,缩小授权范围,修改前先预览。

原文配图

第一版搭完以后,知识库怎么慢慢迭代

接下来最有价值的动作,是让它持续参与真实工作。资料进来以后让 Agent 整理,遇到问题时先查知识库,有价值的结论再写回去。

用得多了,问题自然会出现。

文件变多以后不好找,可以统一文件名,增加目录和索引页。需要在不同主题之间来回查找时,再给页面增加链接。

如果 Agent 反复创建相似内容,就把查重写进规则。重要结论经常找不到原始出处,就要求每次整理都保留来源。

我目前的知识库也是在实际使用中一步步完善的。

随着场景增加,我又慢慢补上人物、项目等页面分类,以及来源和派生关系。资料变多以后,又增加了权限、查重和写后检查。

这些结构解决的是知识库扩展以后出现的具体问题,第一版不必完整复制。

当目录、文件名、索引和链接已经不够用,持续出现漏找、误找,或者需要从大量资料里寻找语义相关内容时,可以继续了解 RAG、向量检索等方案。

这些是更进阶的检索方案。第一版先把目录和规则理清,再用 Agent 跑一个真实任务。以后遇到具体问题,再增加对应的规则和能力。

写在最后

回过头看,个人 AI 知识库的第一版,重点是把最小流程跑通。

选一个真实场景,挑一小批非敏感资料,建立一个开放的文本文件夹,优先使用 Markdown,再用 Agent 工具完成一次读取、整理、查询和写回。

工具以后可能会换。

但那些能够直接打开的文件、逐步完善的规则,以及不断积累下来的知识,仍然属于自己。

如果准备开始搭自己的第一版,可以在评论区告诉我,最想先做写作、学习,还是项目知识库?


金尘马|大厂程序员|30天X破万粉变现过万|持续分享 AI 搞钱、程序员转型、OPC 心得|联系方式见主页介绍:https://x.com/jinchenma_ai

本文是对公开笔记的知识化整理;原帖中的收入、流量、效果等数据属于原帖陈述,未作独立验证。

来源:https://x.com/jinchenma_ai/status/2082495802640080899


分享文章:

上一篇
飞书多维表自己的AI搭建,我体感一般…
下一篇
发现一个流量爆炸的账号:全是几万阅读,小白可直接抄