RAG 知识图解(chalkboard 风格)

是什么

RAG(Retrieval-Augmented Generation,检索增强生成):在让 LLM 回答之前,先从外部知识库检索相关资料,把资料拼进 Prompt,再让模型基于这些资料生成答案。

一句话:不是让模型”凭记忆编”,而是”先查资料再回答”。

完整流程

文档切分 → Embedding 向量化 → 存入向量库
        ↓(用户提问时)
问题 Embedding → 向量库相似度检索 → 召回相关片段

片段 + 问题拼成 Prompt → LLM 生成答案
  • Embedding:把文本转成一串向量(数字数组),语义相近的文本向量也相近。
  • 向量库:专门存向量、支持”按相似度找最近邻”的数据库(如 Milvus、pgvector、Qdrant)。
  • 检索:用户问题也转成向量,在库里找最相似的几段文档。

它解决什么痛点

  1. 知识过时:模型训练完就”冻结”了,之后的新信息它不知道。RAG 让它能查最新文档。
  2. 幻觉:模型对不懂的会”自信地编”。给它以真实资料为依据,答案更靠谱。
  3. 私域知识:公司/个人的内部文档没进训练集,RAG 是低成本用上这些知识的首选方案。

适用场景

企业知识库问答、客服助手、个人笔记/文档检索、法规/手册查询等”答案必须基于指定资料”的场景。