RAG 你可以先记住一句最简单的话:
RAG = 让 AI 在回答你之前,先去“翻资料”。
它之所以像“图书馆”,是因为它的核心能力不是让模型记住更多东西,而是:
把大量外部资料整理好,在你提问时,先找到最相关的那几页,再拿给大模型阅读并回答。
RAG 全称是:
Retrieval-Augmented Generation
中文一般叫:检索增强生成。
拆开来看:
- Retrieval = 检索、查资料
- Augmented = 增强
- Generation = 生成答案
所以本质就是:
先检索,再生成。
一、为什么我把 RAG 比作“图书馆”?
假设你面前有一个非常聪明的人,但他没有看过你的资料。
你问他:
“罗斯《公司理财》第 12 章里对资本结构是怎么解释的?”
普通大模型可能会:
靠自己训练时学到的知识回答。
这相当于:
一个聪明人靠脑子里的记忆回答你。
但是 RAG 会做:
你的问题
↓
进入资料库
↓
找到《公司理财》第12章相关内容
↓
把最相关的几段拿出来
↓
交给大模型阅读
↓
大模型结合这些资料回答
所以它更像:
一个会自己去图书馆查书的研究员。
这就是为什么我说:
RAG = 图书馆。
不过更准确一点:
RAG 不是图书馆本身,而是“图书管理员 + 检索系统 + 阅读回答系统”。
二、没有 RAG 的 AI 和有 RAG 的 AI,有什么区别?
假设你有 5000 篇自己的 Obsidian 笔记。
你问:
“我之前学 ROIC 时是怎么理解的?”
没有 RAG
AI:
我不知道你以前写了什么。
或者:
根据一般知识,ROIC 是……
它只能回答通用知识。
有 RAG
AI先查你的笔记:
搜索:
ROIC
资本回报率
投入资本回报
找到你过去写的:
“ROIC 可以理解为公司拿股东和债权人的钱去做生意后,到底赚了多少经营利润。”
然后 AI 再回答:
“你之前把 ROIC 理解成……”
这时候 AI 就开始拥有:
使用你自己知识库的能力。
这就是 RAG 很强的地方。
三、RAG 到底是怎么工作的?
整个过程其实可以理解成 6 步。
我先给你一个总图:
你的资料
↓
切成很多小段
↓
转换成“向量”
↓
存进向量数据库
↓
你提出问题
↓
找出最相关的几段
↓
交给大模型
↓
生成答案
下面一个一个拆。
四、第一步:准备知识库
比如你的知识库里可以放:
Ross 公司理财
经济学教材
AI for Everyone
课堂笔记
Obsidian笔记
PDF论文
公司财报
研报
网页
自己的日记
项目文档
这些就是:
RAG 的原材料。
相当于往图书馆里面放书。
五、第二步:Chunking —— 把资料切成小块
这是 RAG 非常关键的一步。
假设你直接把一本 800 页的《公司理财》丢进去。
AI不可能每次提问都把 800 页全部读一遍。
所以系统会切成很多小块。
例如:
《公司理财》
Chunk 001
资本预算定义……
Chunk 002
NPV的计算……
Chunk 003
IRR的定义……
Chunk 004
资本结构……
Chunk 005
财务杠杆……
这些小块叫:
Chunk
也就是:
文本片段。
可以理解成:
一本书被拆成很多张“知识卡片”。
六、第三步:Embedding —— 给每张知识卡片建立“语义坐标”
这一部分是很多初学者最难理解的。
Embedding 中文叫:
嵌入 / 向量化
但你不要先管数学。
你可以把它理解成:
AI 给每段文字标记它“在讲什么”。
比如:
“ROIC 衡量企业投入资本产生经营利润的效率。”
经过 Embedding 后,会变成一串数字:
[0.12, -0.83, 0.44, 0.91, ...]
这些数字代表:
这段话在“语义空间”里的位置。
你可以想象一个巨大的地图:
投资
↑
ROE ROIC
\ /
\ /
公司金融
|
资本结构
|
财务杠杆
含义接近的东西:
在地图上离得近。
例如:
ROIC 和 投入资本回报率
文字不完全一样。
但 AI 会认为:
它们意思非常接近。
所以它们的向量距离会很近。
七、第四步:Vector Database —— 把这些知识坐标存起来
有了这些向量以后,就需要地方存。
这就是:
向量数据库 Vector Database
你可以把它理解成:
图书馆的智能索引系统。
传统数据库搜索:
找包含“ROIC”三个字的文本。
向量数据库搜索:
找“意思和 ROIC 最接近”的内容。
这个区别特别重要。
例如你问:
“一家公司拿到资本以后,赚钱效率高不高?”
你的问题里根本没有出现:
ROIC。
但是向量数据库可能会找到:
“ROIC 衡量投入资本产生经营利润的效率。”
因为:
意思相似。
这就是所谓:
语义搜索。
八、第五步:Retrieval —— 你提问以后,开始“找书”
假设你问:
“为什么高 ROIC 的公司通常更优秀?”
系统会先把你的问题也变成向量。
然后去向量数据库里找:
和这个问题最接近的知识块。
可能找到:
Chunk 122:
ROIC定义……
Chunk 341:
竞争优势与ROIC……
Chunk 875:
ROIC和资本成本的关系……
Chunk 1243:
巴菲特关于高资本回报公司的观点……
然后选最相关的,比如前 5 个。
这一步就是:
Retrieval 检索。
相当于图书管理员帮你找到:
“这 5 页最相关。”
九、第六步:Generation —— 大模型开始回答
这时候系统会把:
你的问题 + 检索到的资料
一起发给大模型。
相当于 Prompt 变成:
用户问题:
为什么高 ROIC 的公司通常更优秀?
参考资料:
[资料1]
……
[资料2]
……
[资料3]
……
请根据以上资料回答。
然后大模型才开始生成答案。
这就是:
Retrieval-Augmented Generation
也就是:
检索增强生成。
十、所以一个完整 RAG 可以画成这样
你的资料
↓
文本清洗
↓
Chunking
切成小块
↓
Embedding
向量化
↓
Vector Database
向量数据库
↓
────────────────────────
↑
用户问题
↓
Embedding
↓
相似度检索
↓
Top 5资料
↓
+
用户问题
↓
LLM
↓
最终回答
这个图你如果真正理解了,RAG 基本就理解 70% 了。
十一、为什么不能直接把所有资料一次性塞给 AI?
因为会有几个问题。
1. 太长
假设你的 Obsidian 有:
100 万字。
每次问一个问题都把 100 万字塞进去:
非常浪费。
而 RAG 可能只拿:
最相关的 3000~10000 字。
2. 成本高
模型读得越多:
token 越多 → 成本越高。
RAG 可以大幅减少上下文。
3. 噪声太大
假设你问:
“ROIC是什么?”
结果你给 AI 1000 篇笔记。
里面还有:
- 英语
- AI
- 线性代数
- 创业
- 日记
反而影响回答。
RAG做的是:
只把最相关的资料挑出来。
4. 知识可以更新
这是 RAG 最大优势之一。
如果公司今天发布了新财报。
你不需要:
重新训练模型。
只需要:
把新财报放进 RAG 知识库。
马上就能用。
十二、RAG 和“训练模型”完全不是一回事
这个一定要区分。
Fine-tuning / 训练
相当于:
把知识学进大脑。
RAG
相当于:
需要的时候翻书。
例如一个学生:
Fine-tuning
把《公司理财》背进脑子。
RAG
考试允许带:
一本可以瞬间搜索的《公司理财》。
所以很多企业不会自己训练一个大模型。
而是:
GPT / Claude / Gemini
+
RAG
↓
企业自己的AI
因为这样便宜很多。
十三、RAG 和 Memory 又有什么区别?
你前面刚刚学到 Memory,这两个特别容易混。
最简单区分:
RAG = 查资料。
Memory = 记住你。
例如:
RAG
里面放:
《罗斯公司理财》
然后你问:
“资本结构理论是什么?”
AI去查书。
Memory
里面记录:
“用户已经理解 ROE,但是对 WACC 还比较陌生。”
下一次解释:
AI会少讲 ROE,多解释 WACC。
所以:
RAG
=
外部知识
Memory
=
过去经历 / 用户状态
十四、一个成熟 Agent 通常两个都有
例如你的私人金融老师:
AI老师
|
┌───────────┴───────────┐
↓ ↓
RAG Memory
↓ ↓
公司理财教材 你的学习记录
金融学教材 你的薄弱知识
课堂笔记 你的学习进度
财报 你的目标
然后你问:
“继续学资本结构。”
AI:
第一步通过 Memory:
知道你之前学到哪里。
第二步通过 RAG:
找教材里相关内容。
第三步 LLM:
按你的水平解释。
这就已经非常接近:
真正的私人老师。
十五、那你自己怎么构建一个 RAG?
如果是你现在开始,我不建议你直接写复杂代码。
可以分成三档。
第一档:最简单
直接用:
支持知识库上传的 AI 软件。
流程:
上传PDF / Markdown
↓
软件自动切块
↓
自动Embedding
↓
自动建立向量数据库
↓
开始问答
你几乎不用懂代码。
这其实背后就是 RAG。
十六、第二档:你特别适合的 —— Obsidian + RAG
你现在本身就在使用 Obsidian。
以后可以形成:
Obsidian
│
├── AI
├── 金融
├── 英语
├── 数学
├── 商业
└── 日精进
然后建立 RAG:
Obsidian Markdown
↓
读取所有md
↓
Chunk
↓
Embedding
↓
Vector DB
↓
Agent
以后你问:
“我之前对于财务杠杆有什么理解?”
AI直接搜索你的 Obsidian。
或者:
“把我过去学过的 ROE、ROA、ROIC 串起来讲一遍。”
Agent 可以自动从你的知识库找到所有笔记。
这就是你所谓:
个人知识库真正开始“活起来”。
否则 Obsidian 只是:
储存笔记。
有 RAG 以后:
AI 可以主动读取和使用这些笔记。
十七、第三档:自己编程搭 RAG
如果以后你学开发,大概是这样的技术栈:
文档
↓
Loader
↓
Chunker
↓
Embedding Model
↓
Vector Database
↓
Retriever
↓
LLM
↓
Answer
实际技术可能是:
PDF / Markdown
↓
Python
↓
LangChain / LlamaIndex
↓
Embedding Model
↓
FAISS / Chroma / Qdrant
↓
GPT / Claude / Gemini
不用现在把这些名字背下来。
你先理解架构。
十八、比如你以后自己做一个“金融 RAG”
你可以放进去:
知识库
│
├── Ross Corporate Finance
├── 米什金货币金融学
├── 宏观经济学
├── 微观经济学
├── 财报
├── 研报
├── 复旦431资料
└── 自己的Obsidian
然后 Agent 可以回答:
“结合罗斯公司理财和我的笔记解释 WACC。”
或者:
“找出我过去所有关于 ROIC 的笔记。”
或者:
“罗斯公司理财和我的课堂笔记对资本结构解释有什么区别?”
这个时候 RAG 就非常有价值了。
十九、为什么 RAG 对你这种学习方式特别重要?
你以后会不断积累:
AI知识
金融知识
英语知识
数学知识
商业思考
自己的感悟
问题不是:
“有没有知识?”
而是:
几年以后你还找得到吗?
很多人学了 5 年以后:
80% 的东西找不到,也记不住。
RAG 的意义之一就是:
让过去的知识重新可调用。
所以你未来的知识库可能形成:
2026学习
↓
2027学习
↓
2028学习
↓
2029学习
↓
2030学习
但是 AI 可以瞬间:
“找出过去 4 年你对创业认知发生的变化。”
这时候个人知识库的价值就完全不同了。
二十、最后记一个最简单的比喻
把整个 AI 系统想象成一个学生:
LLM
大脑。
Prompt
老师布置作业。
Plan
学生制定学习计划。
ReAct
做题过程中发现不会,临时查资料。
RAG
图书馆。
Vector Database
图书馆索引系统。
Embedding
给每本书、每段内容贴“语义坐标”。
Retriever
图书管理员。
Memory
学生自己的记忆。
所以:
RAG 不是“让 AI 知道所有知识”。
而是:
让 AI 知道去哪里找正确的知识。
这其实是非常重要的一种思维变化。
因为现实世界真正厉害的人,也不是:
什么都背下来。
而是:
知道需要什么信息、去哪里找、如何判断、如何组合。
而 RAG,就是把这种能力赋予 AI。