RAG 你可以先记住一句最简单的话:

RAG = 让 AI 在回答你之前,先去“翻资料”。

它之所以像“图书馆”,是因为它的核心能力不是让模型记住更多东西,而是:

把大量外部资料整理好,在你提问时,先找到最相关的那几页,再拿给大模型阅读并回答。

RAG 全称是:

Retrieval-Augmented Generation
中文一般叫:检索增强生成

拆开来看:

  • Retrieval = 检索、查资料
  • Augmented = 增强
  • Generation = 生成答案

所以本质就是:

先检索,再生成。


一、为什么我把 RAG 比作“图书馆”?

假设你面前有一个非常聪明的人,但他没有看过你的资料。

你问他:

“罗斯《公司理财》第 12 章里对资本结构是怎么解释的?”

普通大模型可能会:

靠自己训练时学到的知识回答。

这相当于:

一个聪明人靠脑子里的记忆回答你。

但是 RAG 会做:

你的问题
↓
进入资料库
↓
找到《公司理财》第12章相关内容
↓
把最相关的几段拿出来
↓
交给大模型阅读
↓
大模型结合这些资料回答

所以它更像:

一个会自己去图书馆查书的研究员。

这就是为什么我说:

RAG = 图书馆。

不过更准确一点:

RAG 不是图书馆本身,而是“图书管理员 + 检索系统 + 阅读回答系统”。


二、没有 RAG 的 AI 和有 RAG 的 AI,有什么区别?

假设你有 5000 篇自己的 Obsidian 笔记。

你问:

“我之前学 ROIC 时是怎么理解的?”

没有 RAG

AI:

我不知道你以前写了什么。

或者:

根据一般知识,ROIC 是……

它只能回答通用知识。


有 RAG

AI先查你的笔记:

搜索:
ROIC
资本回报率
投入资本回报

找到你过去写的:

“ROIC 可以理解为公司拿股东和债权人的钱去做生意后,到底赚了多少经营利润。”

然后 AI 再回答:

“你之前把 ROIC 理解成……”

这时候 AI 就开始拥有:

使用你自己知识库的能力。

这就是 RAG 很强的地方。


三、RAG 到底是怎么工作的?

整个过程其实可以理解成 6 步。

我先给你一个总图:

你的资料
↓
切成很多小段
↓
转换成“向量”
↓
存进向量数据库
↓
你提出问题
↓
找出最相关的几段
↓
交给大模型
↓
生成答案

下面一个一个拆。


四、第一步:准备知识库

比如你的知识库里可以放:

Ross 公司理财
经济学教材
AI for Everyone
课堂笔记
Obsidian笔记
PDF论文
公司财报
研报
网页
自己的日记
项目文档

这些就是:

RAG 的原材料。

相当于往图书馆里面放书。


五、第二步:Chunking —— 把资料切成小块

这是 RAG 非常关键的一步。

假设你直接把一本 800 页的《公司理财》丢进去。

AI不可能每次提问都把 800 页全部读一遍。

所以系统会切成很多小块。

例如:

《公司理财》

Chunk 001
资本预算定义……

Chunk 002
NPV的计算……

Chunk 003
IRR的定义……

Chunk 004
资本结构……

Chunk 005
财务杠杆……

这些小块叫:

Chunk

也就是:

文本片段。

可以理解成:

一本书被拆成很多张“知识卡片”。


六、第三步:Embedding —— 给每张知识卡片建立“语义坐标”

这一部分是很多初学者最难理解的。

Embedding 中文叫:

嵌入 / 向量化

但你不要先管数学。

你可以把它理解成:

AI 给每段文字标记它“在讲什么”。

比如:

“ROIC 衡量企业投入资本产生经营利润的效率。”

经过 Embedding 后,会变成一串数字:

[0.12, -0.83, 0.44, 0.91, ...]

这些数字代表:

这段话在“语义空间”里的位置。

你可以想象一个巨大的地图:

                投资
                 ↑
        ROE      ROIC
          \       /
           \     /
          公司金融
             |
          资本结构
             |
          财务杠杆

含义接近的东西:

在地图上离得近。

例如:

ROIC投入资本回报率

文字不完全一样。

但 AI 会认为:

它们意思非常接近。

所以它们的向量距离会很近。


七、第四步:Vector Database —— 把这些知识坐标存起来

有了这些向量以后,就需要地方存。

这就是:

向量数据库 Vector Database

你可以把它理解成:

图书馆的智能索引系统。

传统数据库搜索:

找包含“ROIC”三个字的文本。

向量数据库搜索:

找“意思和 ROIC 最接近”的内容。

这个区别特别重要。

例如你问:

“一家公司拿到资本以后,赚钱效率高不高?”

你的问题里根本没有出现:

ROIC。

但是向量数据库可能会找到:

“ROIC 衡量投入资本产生经营利润的效率。”

因为:

意思相似。

这就是所谓:

语义搜索。


八、第五步:Retrieval —— 你提问以后,开始“找书”

假设你问:

“为什么高 ROIC 的公司通常更优秀?”

系统会先把你的问题也变成向量。

然后去向量数据库里找:

和这个问题最接近的知识块。

可能找到:

Chunk 122:
ROIC定义……

Chunk 341:
竞争优势与ROIC……

Chunk 875:
ROIC和资本成本的关系……

Chunk 1243:
巴菲特关于高资本回报公司的观点……

然后选最相关的,比如前 5 个。

这一步就是:

Retrieval 检索。

相当于图书管理员帮你找到:

“这 5 页最相关。”


九、第六步:Generation —— 大模型开始回答

这时候系统会把:

你的问题 + 检索到的资料

一起发给大模型。

相当于 Prompt 变成:

用户问题:
为什么高 ROIC 的公司通常更优秀?

参考资料:
[资料1]
……

[资料2]
……

[资料3]
……

请根据以上资料回答。

然后大模型才开始生成答案。

这就是:

Retrieval-Augmented Generation

也就是:

检索增强生成。


十、所以一个完整 RAG 可以画成这样

               你的资料
                  ↓
              文本清洗
                  ↓
              Chunking
              切成小块
                  ↓
              Embedding
              向量化
                  ↓
            Vector Database
              向量数据库
                  ↓
────────────────────────
                  ↑
             用户问题
                  ↓
              Embedding
                  ↓
            相似度检索
                  ↓
             Top 5资料
                  ↓
                  +
             用户问题
                  ↓
                 LLM
                  ↓
               最终回答

这个图你如果真正理解了,RAG 基本就理解 70% 了。


十一、为什么不能直接把所有资料一次性塞给 AI?

因为会有几个问题。

1. 太长

假设你的 Obsidian 有:

100 万字。

每次问一个问题都把 100 万字塞进去:

非常浪费。

而 RAG 可能只拿:

最相关的 3000~10000 字。


2. 成本高

模型读得越多:

token 越多 → 成本越高。

RAG 可以大幅减少上下文。


3. 噪声太大

假设你问:

“ROIC是什么?”

结果你给 AI 1000 篇笔记。

里面还有:

  • 英语
  • AI
  • 线性代数
  • 创业
  • 日记

反而影响回答。

RAG做的是:

只把最相关的资料挑出来。


4. 知识可以更新

这是 RAG 最大优势之一。

如果公司今天发布了新财报。

你不需要:

重新训练模型。

只需要:

把新财报放进 RAG 知识库。

马上就能用。


十二、RAG 和“训练模型”完全不是一回事

这个一定要区分。

Fine-tuning / 训练

相当于:

把知识学进大脑。

RAG

相当于:

需要的时候翻书。

例如一个学生:

Fine-tuning

把《公司理财》背进脑子。

RAG

考试允许带:

一本可以瞬间搜索的《公司理财》。

所以很多企业不会自己训练一个大模型。

而是:

GPT / Claude / Gemini
        +
       RAG
        ↓
企业自己的AI

因为这样便宜很多。


十三、RAG 和 Memory 又有什么区别?

你前面刚刚学到 Memory,这两个特别容易混。

最简单区分:

RAG = 查资料。

Memory = 记住你。

例如:

RAG

里面放:

《罗斯公司理财》

然后你问:

“资本结构理论是什么?”

AI去查书。


Memory

里面记录:

“用户已经理解 ROE,但是对 WACC 还比较陌生。”

下一次解释:

AI会少讲 ROE,多解释 WACC。

所以:

RAG
=
外部知识

Memory
=
过去经历 / 用户状态

十四、一个成熟 Agent 通常两个都有

例如你的私人金融老师:

                    AI老师
                      |
          ┌───────────┴───────────┐
          ↓                       ↓
         RAG                    Memory
          ↓                       ↓
   公司理财教材             你的学习记录
   金融学教材               你的薄弱知识
   课堂笔记                 你的学习进度
   财报                     你的目标

然后你问:

“继续学资本结构。”

AI:

第一步通过 Memory:

知道你之前学到哪里。

第二步通过 RAG:

找教材里相关内容。

第三步 LLM:

按你的水平解释。

这就已经非常接近:

真正的私人老师。


十五、那你自己怎么构建一个 RAG?

如果是你现在开始,我不建议你直接写复杂代码。

可以分成三档。


第一档:最简单

直接用:

支持知识库上传的 AI 软件。

流程:

上传PDF / Markdown
↓
软件自动切块
↓
自动Embedding
↓
自动建立向量数据库
↓
开始问答

你几乎不用懂代码。

这其实背后就是 RAG。


十六、第二档:你特别适合的 —— Obsidian + RAG

你现在本身就在使用 Obsidian。

以后可以形成:

Obsidian
│
├── AI
├── 金融
├── 英语
├── 数学
├── 商业
└── 日精进

然后建立 RAG:

Obsidian Markdown
↓
读取所有md
↓
Chunk
↓
Embedding
↓
Vector DB
↓
Agent

以后你问:

“我之前对于财务杠杆有什么理解?”

AI直接搜索你的 Obsidian。

或者:

“把我过去学过的 ROE、ROA、ROIC 串起来讲一遍。”

Agent 可以自动从你的知识库找到所有笔记。

这就是你所谓:

个人知识库真正开始“活起来”。

否则 Obsidian 只是:

储存笔记。

有 RAG 以后:

AI 可以主动读取和使用这些笔记。


十七、第三档:自己编程搭 RAG

如果以后你学开发,大概是这样的技术栈:

文档
↓
Loader
↓
Chunker
↓
Embedding Model
↓
Vector Database
↓
Retriever
↓
LLM
↓
Answer

实际技术可能是:

PDF / Markdown
↓
Python
↓
LangChain / LlamaIndex
↓
Embedding Model
↓
FAISS / Chroma / Qdrant
↓
GPT / Claude / Gemini

不用现在把这些名字背下来。

你先理解架构。


十八、比如你以后自己做一个“金融 RAG”

你可以放进去:

知识库
│
├── Ross Corporate Finance
├── 米什金货币金融学
├── 宏观经济学
├── 微观经济学
├── 财报
├── 研报
├── 复旦431资料
└── 自己的Obsidian

然后 Agent 可以回答:

“结合罗斯公司理财和我的笔记解释 WACC。”

或者:

“找出我过去所有关于 ROIC 的笔记。”

或者:

“罗斯公司理财和我的课堂笔记对资本结构解释有什么区别?”

这个时候 RAG 就非常有价值了。


十九、为什么 RAG 对你这种学习方式特别重要?

你以后会不断积累:

AI知识
金融知识
英语知识
数学知识
商业思考
自己的感悟

问题不是:

“有没有知识?”

而是:

几年以后你还找得到吗?

很多人学了 5 年以后:

80% 的东西找不到,也记不住。

RAG 的意义之一就是:

让过去的知识重新可调用。

所以你未来的知识库可能形成:

2026学习
↓
2027学习
↓
2028学习
↓
2029学习
↓
2030学习

但是 AI 可以瞬间:

“找出过去 4 年你对创业认知发生的变化。”

这时候个人知识库的价值就完全不同了。


二十、最后记一个最简单的比喻

把整个 AI 系统想象成一个学生:

LLM

大脑。

Prompt

老师布置作业。

Plan

学生制定学习计划。

ReAct

做题过程中发现不会,临时查资料。

RAG

图书馆。

Vector Database

图书馆索引系统。

Embedding

给每本书、每段内容贴“语义坐标”。

Retriever

图书管理员。

Memory

学生自己的记忆。

所以:

RAG 不是“让 AI 知道所有知识”。

而是:

让 AI 知道去哪里找正确的知识。

这其实是非常重要的一种思维变化。

因为现实世界真正厉害的人,也不是:

什么都背下来。

而是:

知道需要什么信息、去哪里找、如何判断、如何组合。

而 RAG,就是把这种能力赋予 AI。