读完书三个月就忘,不是你的问题——这个开源工具把整本书编译进了AI的大脑
读完书三个月就忘,不是你的问题——这个开源工具把整本书编译进了AI的大脑 你有没有过这种经历? 花一百多块买了本技术书,第一篇读得热血沸腾,画了满篇的重点。三个月后有人问你这本书讲了什么,你努力回忆了半天,憋出一句"好像讲的是……数据库那方面的,挺厉害的"。 这不是你记忆力差。 一本 400
💡 你将学到
读完书三个月就忘,不是你的问题——这个开源工具把整本书编译进了AI的大脑 你有没有过这种经历? 花一百多块买了本技术书,第一篇读得热血沸腾,画了满篇的重点。三个月后有人问你这本书讲了什么,你努力回忆了半天,憋出一句"好像讲的是……数据库那方面的,挺厉害的"。 这不是你记忆力差。 一本 400
读完书三个月就忘,不是你的问题——这个开源工具把整本书编译进了AI的大脑
你有没有过这种经历?
花一百多块买了本技术书,第一篇读得热血沸腾,画了满篇的重点。三个月后有人问你这本书讲了什么,你努力回忆了半天,憋出一句"好像讲的是……数据库那方面的,挺厉害的"。
这不是你记忆力差。
一本 400 页的技术书,20 万个字,从头读到尾已经不容易,指望三个月后还能记住每个章节讲了什么,本来就不现实。
那有没有一种办法,让书里的知识随时能用,不用背,不会忘?
还真有。
传统路子,走不通
先说说大多数人是怎么"用 AI 读书"的。
方案一:直接把整本 PDF 丢给 AI。
结果是什么?AI 的上下文窗口瞬间被几百页内容填满,你问一个问题,它翻到第 50 页开始答,答到第 300 页就忘了前面说过什么。而且每次提问都在烧 Token,一两个问题还行,问多了成本直接起飞。
方案二:搭 RAG 检索系统。
听起来很专业,本质上就是关键词匹配。AI 把你书里提到"复制"的地方全摘出来,拼在一起当成答案。逻辑通不通?看运气。上下文连不连贯?不存在的。
这两个方案有个共同的硬伤——每次提问都要重新处理一遍全文,临时抱佛脚,佛都懒得理你。
换个思路:编译一次,永久复用
GitHub 上有个叫 book-to-skill 的开源项目,思路完全反过来了。
它不做临时检索,不做文本拼接。它的做法是——提前把整本书吃透、拆解、结构化,编译成一个 AI 可以直接调用的 Skill 文件。 编译一次,以后随便问,按需加载,绝不浪费 Token。
你可以理解为:你不是在让 AI 翻书,而是把书装进了 AI 的大脑里。
一本书被拆成什么?
跑一次 /book-to-skill ./你的书.pdf,它会生成一套完整的 Skill 包:
| 文件 | 干嘛用的 | 占多少 |
|---|---|---|
| ✅ SKILL.md | 全书核心框架、章节索引、心智模型 | ~4000 tokens |
| ✅ chapters/ | 每章拆成独立文件,不问不加载 | ~1000 tokens/章 |
| ✅ glossary.md | 术语表,按字母排序,标注章节位置 | ~1500 tokens |
| ✅ patterns.md | 技术模式、算法、实战方案合集 | ~2000 tokens |
| ✅ cheatsheet.md | 决策速查表、核心规则、常见反模式 | ~1000 tokens |
一本 400 页的技术书,全文约 20 万 tokens。但日常使用时,AI 只会加载最核心的 4000 tokens 框架,加上你问的那一章节。
官方实测数据:回答一个问题,比直接丢全书进去省 24 到 51 倍的 Token。
怎么用?一分钟上手
安装走的是 AI 原生路线,在 Claude Code 或 Copilot CLI 里输入一行指令:
Install book-to-skill:https://raw.githubusercontent.com/virgiliojr94/book-to-skill/master/SKILL.md
然后对着你的电子书开跑:
/book-to-skill ./DDIA.pdf
编完以后,想查什么直接问:
/DDIA 复制一致性
AI 会自己定位到对应章节,从真实内容里给你答案。不会瞎编,不会说"在第 X 页",不会罗列页码。
支持什么格式?
9 种文档格式通吃:
- 电子书:PDF、EPUB、MOBI / AZW(Kindle 格式)
- 办公文档:DOCX、TXT
- 标记语言:Markdown、HTML、RTF
注意:扫描版 PDF 和加密文档不支持,需要先做 OCR 或解密。
技术类书籍会调用 Docling 引擎,完整保留表格、代码块和排版结构。纯叙事类书籍用 pdftotext 极速提取,速度拉满。
这个项目什么来头?
MIT 开源协议,作者 virgiliojr94。目前 83 次提交、14 位贡献者,曾登上 Trendshift Python 日榜第 10 名和全站总榜第 25 名。
代码很轻:核心只有两个文件——SKILL.md(约 530 行)和 extract.py(约 830 行),8G 内存的笔记本就能跑。
谁最需要它?
高频翻书党——DDIA、Clean Code、SICP 这种经典,编程时随时调取,比翻书快 10 倍
公司内部文档用户——架构手册、运维规范、入职文档,AI 训练数据里不可能有,全靠它来补
新书尝鲜族——AI 还没训练到的新内容,用它直接把知识注入工作流
笔记整理控——Markdown 笔记、零散文档整合成统一 Skill,一劳永逸
一句话总结
直接传 PDF,AI 是翻书员,告诉你"在第几页";RAG,AI 是摘抄员,随机拼凑;book-to-skill,AI 是学习者,提前吃透全书结构,问什么答什么。
一个是临时抱佛脚,一个是永久长脑子。
你选哪个? 如果觉得内容对你有帮助,点赞、关注是对我最大的支持。
来源:GitHub / 博客园
你觉得这种"把书编译进 AI"的方式,会成为未来读技术书的标配吗?评论区聊聊。
