我用Andrej Karpathy的LLM wiki思路实现了“活”的个人知识库(附模板)
公众号名称:sudden的AI日常
作者名称:是sudden哦
发布时间:2026-04-23 20:02
原文链接:https://gist.github.com/karpathy/442a6bf555914893e9891c11519de94f
“知识只需要整理一次,之后一直维护更新,不用每次提问都重新推导。这个wiki是个能不断生长的知识库。”

4步带你复刻大神思路,构建属于自己的“活”知识库。
OpenAI联合创始人,Andrej Karpathy在4月初发了个推特,非常火爆,内容是用LLM管理个人知识库的方法论 (llm-wiki),目前已经有2000万的浏览量。

我去A神的Github上找到了他给的方法论详细说明,或者说,提示词
(但不要直接用哦,效果不好,得针对性改造,我们下面说)

仔细研究了A神思路,我的结论是,这套方法,

适合
-
垂直领域科研(攒你读过的好论文、专利、会议等)
-
单个项目研发(攒项目规范、设计文档、用户手册、需求文档等)
-
个人内容创作(攒素材、自己的作品、喜欢的作品等)
总之,需要攒知识的场景(文档<500篇)

不适合
-
企业级海量知识库管理(还是乖乖搞RAG吧)
-
简单的问答(直接问AI就行了)
当然,不试试怎么知道适不适合自己呢
下面跟着我开始实战吧,万一对你有启发呢 ~ ❥(^_-)
适用于个人知识库wiki的工作手册、行动规范(二次改造或直接喂给你的智能体都行),
关注公众号【AI Power Lab】,回复暗号「个人知识库」,免费领取,马上拥有你自己的成长型知识库!
01
Karpathy思路拆解
我们先把Karpathy发的LLM-wiki原文拿出来仔细研究一下
(篇幅较长,我们挑重点说,A神原文点击文末“阅读原文”就可以看啦)
本节以下内容是原文翻译后我整理的。

核心思路
现在大家用大模型处理文档,基本都是RAG那套:传一堆文件上去,提问的时候模型去捞相关片段,攒个答案出来。能用是能用,但每次提问模型都得从零开始扒资料,根本没积累。
这套方法论不是等提问的时候才去翻原始资料,而是让大模型一点点攒一个能一直用的wiki库——就是一堆互相链接起来的Markdown文件。
存入新资料的时候,大模型不只是建个索引等着以后搜,它会先读一遍,把关键信息抽出来,再揉到已经有的wiki里:
-
该更新实体页面的更新
-
该改主题摘要的改
-
发现新资料和以前的说法矛盾就标出来,之前的结论对就加固,不对就推翻重来
知识只需要整理一次,之后一直维护更新,不用每次提问都重新推导。
这个wiki是个能不断生长的知识库:交叉引用已经做好了,矛盾的地方也标出来了,里面的结论已经是你所有看过的资料的总和,你每加一份资料,每提一个问题,这个维基就更完善一点。
你基本不用自己写wiki的内容——全是大模型写,全是它维护。你就负责找资料、定方向、提对问题就行。
剩下那些苦活累活:总结内容、做交叉引用、归档、维护记录,全丢给模型,这些活才是知识库能用得久的关键。

整体架构
总共分三层:
1. raw,原始资料层
- 你自己收集的所有源文件,文章、论文、图片、数据都算。
2. wiki,维基层
-
大模型生成的一堆Markdown文件,包括摘要、实体页面、概念页面、对比内容、总览、综合结论。
-
这一层全归大模型管,它自己建页面,有新资料了就更新,维护交叉引用,保证所有内容前后一致。你读,它写。
3. schema,规则层
-
是一份文档(比如我们将要构建的METADATA.md,Claude Code用的CLAUDE.md,或者其他智能体用的AGENTS.md),告诉大模型这个维基的结构是什么,有啥命名规范,收新资料、回答问题、维护维基的时候要按什么流程走。
-
这是最核心的配置文件——有了它大模型才是个靠谱的维基管理员,不然就是个普通的聊天机器人。
-
你和大模型可以慢慢迭代这份文档,找到最适合你用的规则。

过程
- 收新资料(Ingest)
把新资料丢到原始资料文件夹(raw)里,告诉大模型处理就行。
常规流程是这样:模型先读资料,和你过一遍重点,在wiki里写个摘要页,更新索引,把整个wiki里相关的实体和概念页面都更新一遍,最后在日志里加条记录。
一份资料可能会改10到15个维基页面。
2. 提问(Query)
提问题,大模型会去wiki里搜索相关页面,读完之后给你整合成带引用的答案。
有个很重要的点:好的答案可以直接当成新页面存回维基里。
比如你要求做的对比、分析、发现的新关联——这些都是有用的东西,别让它们消失在聊天记录里。
这样你每次探索的内容,就和新收的资料一样,能一直攒在知识库里。
3. 定期检查(Lint)
隔段时间就让模型给维基做个体检,查查这些问题:
页面之间有没有矛盾,有没有已经被新资料推翻的过时说法,有没有没人链接的孤立页面,有没有提到过但没单独建页面的重要概念,有没有漏了的交叉引用,有没有能靠搜网页补上的信息缺口。(在做研究时,可能发现连你自己都没注意到的知识缺口)

索引和日志
有两个特殊文件,能帮你和模型在维基变大了之后快速找东西,作用不一样:
- index.md
是按内容分类的,相当于整个维基的目录:每个页面都有链接、一句话简介,还可以加日期、引用了多少份来源之类的元数据。
按类别分好,比如实体、概念、来源之类的,模型每次收新资料都会更新它。
回答问题的时候,模型先读索引找相关页面,再去细看具体内容。
维基不大的时候(大概100份来源、几百个页面),这么用比搞嵌入RAG那套基础设施好用多了。
(你看,学术研究、项目开发、个人内容创作这些方面,几百份文档足够装下了)
2. log.md
是按时间排序的,只加内容不改以前的,记录什么时间干了什么:收了什么新资料、回答了什么问题、做了什么检查。

为啥这套玩法有用?
维护知识库最烦的不是读资料或者想问题,而是那些杂活:更新交叉引用、保持摘要最新、标出来新资料和旧内容的矛盾、保证几十页内容前后一致。
为啥大家建维基都坚持不下来?因为维护的成本涨得比价值快。
大模型不会嫌烦,不会忘了更新交叉引用,一次改15个文件都不是事。维护成本几乎为零,维基当然就能一直更新下去。
人就干人该干的活:挑资料、定分析方向、提好问题、想这些内容到底有啥意义,剩下的全丢给大模型。
02
成果:个人知识库wiki实战
看到这里的你一定是个有耐心能干成事儿的人,也请点个赞鼓励一下我吧~❥(^_-)

下面我们按照Andrej Karpathy的思路,一步步搭建个人知识库。
我搭的这个知识库,适用于个人内容创作,如果想应用在学术研究、项目研发等场景,过程是一样的!

整体效果
搭好之后长这样,圈出来的就是上文提到的三层架构:raw, wiki, schema(就是llm-wiki-blogs.md)


wiki工作手册
llm-wiki-blogs.md就是我和大模型讨论出来的wiki工作手册,内容长这样,


行动规范
另外,为了这个wiki更好用,我还额外补充了行动规范——METADATA.md,长这样


关系图谱
在Obsidian里,看看wiki关联,长这样,很直观,
对AI来说,更直观,它能够非常高效甚至出你不意的给出亮眼回答(它能注意的你看不到的关联)

适用于个人知识库wiki的工作手册、行动规范(二次改造或直接喂给你的智能体都行),
关注公众号【AI Power Lab】,回复暗号「个人知识库」,免费领取,马上拥有你自己的成长型知识库!
03
过程:个人知识库wiki实战
在开始前,先把你自己收集原始文档(如你自己的写的东西、你喜欢的作品等)放到raw文件夹下/Document/llm-wiki-blogs/raw/
然后进入这个知识库的根目录(比如,我的是/Document/llm-wiki-blogs/),claude启动Claude Code(或你的智能体框架)
- 讨论
和你的智能体讨论着来(我用的Claude Code),一起制定规范
我的提示词如下:
阅读这个文档/Document/llm-wiki-blogs/llm-wiki.md,我准备让你按照文档思路,给/Document/llm-wiki-blogs/raw/路径下的文档建立wiki,供我积累相关知识。你先阅读,然后我们商量一下做一份适合我目标的llm-wiki-blogs.md的说明文档,用于指导你干活,你可以多问我问题。

仔细描述你的需求,讨论完成后,cc会构建相应的路径、文档和规范

- 大模型处理(Ingest)
接着,让大模型按照规范开始建立wiki
第一次建wiki比较费token,但这是一次性成本,后续增加了内容做增量更新就好。

处理好了,不要着急,要有耐心,值得等待

这是建好wiki后,你可以通过obsidian打开这个路径,就可以看到比较直观的知识库了,

当然,不用obsidian也可以,直接在文件夹打开就能看到(但还是建议用Obsidian,方便直观还有很多插件)

- 使用(Query)
提问题,大模型会去wiki里搜索相关页面,读完之后给你整合成带引用的答案。
有个很重要的点:好的答案可以直接当成新页面存回维基里。
比如你要求做的对比、分析、发现的新关联——这些都是有用的东西,别让它们消失在聊天记录里。
这样你每次探索的内容,就和新收的资料一样,能一直攒在知识库里。
提问
我的提问
我想写一篇博客,主题为:openclaw避坑指南。请你给出相关素材和建议
部分输出


好内容增加到wiki
我认为大模型根据我的知识库整理的内容不错,有价值,就让大模型自己去按照它梳理的架构写出来,存到wiki下面,作为知识。

可以在Obsidian里看到这篇内容

- 检查(Lint)
隔段时间就让模型给维基做个体检,查查这些问题:
页面之间有没有矛盾,有没有已经被新资料推翻的过时说法,有没有没人链接的孤立页面,有没有提到过但没单独建页面的重要概念,有没有漏了的交叉引用,有没有能靠搜网页补上的信息缺口。(在做研究时,可能发现连你自己都没注意到的知识缺口)
模型很擅长给你提新的值得研究的问题,还有该找什么新资料,这样维基越做越大也不会乱。
制定的巡检规则

让大模型去巡检
巡检结论

我的感受
非常好用,给的信息都是我知识库的内容,比RAG那套思路快准狠。(RAG更适合企业级海量数据的情况)
04
总结
最后再提一下,LLM-wiki这套知识库构建思路,适合哪些场景。
适合:
-
垂直领域科研(攒你读过的好论文、专利、会议等)
-
单个项目研发(攒项目规范、设计文档、用户手册、需求文档等)
-
个人内容创作(攒素材、自己的作品、喜欢的作品等)
总之,需要攒知识的场景(文档<500篇)
不适合:
-
企业级海量知识库管理(还是乖乖搞RAG吧)
-
简单的问答(直接问AI就行了)
不要光收藏不点赞哦 ~❥(^_-)

适用于个人知识库wiki的工作手册、行动规范(二次改造或直接喂给你的智能体都行),
关注公众号【AI Power Lab】,回复暗号「个人知识库」,免费领取,马上拥有你自己的成长型知识库!
往期推荐
智能体搭建| 如何用OpenClaw搭建你的“一人公司”(附完整配置模板)
OpenClaw技能玩法,7个必装神级技能推荐,让你的小龙虾成为工作利器
内容效果不满意?点此反馈