创建时间: 2026-08-01最后更新: 2026-08-06作者: yangbo(2fb9ff41e)
上一篇我们看到,一份资料要经过读取、解析、清理、切块和向量化,才会进入 RAG 的索引。真正容易被低估的,并不是如何调用 Embedding API,而是交给 Embedding 模型的内容究竟是什么。
如果原始文件中的标题、表头、否定词和段落关系在解析时丢失,后面的向量只是在准确表达一份已经损坏的文本。系统启动时通常看不出这个问题,直到用户提问时才发现:知识库里明明有答案,检索结果却总是找不到它。
这篇文章从原始资料开始,完整走一遍文档处理过程。我们先看文件如何被读取和解析,再讨论清理与标准化,最后进入语义切块,并说明参数应该怎样选择、上下文如何保存以及结果如何检查。
订阅后可阅读剩余内容
AI 电子伴侣企业级项目实战
已发布239节计划发布120节目标已完成199%