使用 FastGPT 构建高质量 AI 知识库，大模型入门到精通，收藏这篇就足够了！

FastGPT 项目地址：https://github.com/labring/FastGPT/

引言

自从去年 12 月 ChatGPT 发布以来，带动了一轮新的交互应用革命。尤其在 GPT-3.5 接口全面开放后，大量的 LLM 应用如雨后春笋般涌现。然而，由于 GPT 的可控性、随机性和合规性等问题，很多应用场景都没法落地。

起源

3 月份，我在 Twitter 上刷到一个老哥使用 GPT 训练他自己的博客记录，成本极低（相比于 Fine-tuning）。他提供了一个完整的流程图：

向量搜索 GPT 流程图

看到这个推文后，我灵机一动，应用场景就十分清晰了。直接上手开干，不到一个月的时间，我在原有的助手管理基础上，为 FastGPT 加入了向量搜索功能。

初步发展

三个月过去了，FastGPT 依然延续着早期的思路去完善和扩展。目前，其在向量搜索 + LLM 线性问答方面的功能基本已完成。然而，我们始终没有发布关于如何构建知识库的教程。因此，我们打算在 V4 版本开发过程中，写一篇文章来介绍《如何在 FastGPT 上构建高质量知识库》。

FastGPT 的知识库逻辑

在正式开始构建知识库之前，我们需要了解 FastGPT 的知识库检索机制。首先，我们需要了解几个基本概念：

基础概念

向量：将人类的语言（文字、图片、视频等）转换为计算机可识别的语言（数组）。
向量相似度：计算两个向量之间的相似度，表示两种语言的相似程度。
语言大模型的特性：上下文理解、总结和推理。

这三个概念结合起来，就构成了 “向量搜索 + 大模型 = 知识库问答” 的公式。以下是 FastGPT V3 中知识库问答功能的完整逻辑：

向量搜索 GPT 流程图

FastGPT 与大多数其他知识库问答产品不同的地方在于，它采用了 QA 问答对进行存储，而不仅是 chunk（文本分块）处理。这样做是为了减少向量化内容的长度，使向量能更好地表达文本的含义，从而提高搜索的精度。

此外 FastGPT 还提供了搜索测试和对话测试两种途径对数据进行调整，从而方便用户调整自己的数据。

根据上述流程和方式，我们以构建一个 FastGPT 常见问题机器人为例，展示如何构建一个高质量的 AI 知识库。

FastGPT 仓库地址：https://github.com/labring/FastGPT

创建知识库应用

首先，我们创建一个 FastGPT 常见问题知识库。

创建知识库应用

基础知识获取

我们先直接把 FastGPT GitHub 仓库上一些已有文档，进行 QA 拆分，从而获取一些 FastGPT 的基础知识。下面以 README 为例。

QA 拆分示意图

QA 修正

我们从 README 中获取了 11 组数据，整体质量还是不错的，图片和链接都提取出来了。然而，最后一个知识点出现了一些截断，我们需要手动修正一下。

此外，我们注意到第一列第三个知识点，该知识点介绍了 FastGPT 的一些资源链接，但 QA 拆分将答案放在了 A 中。然而，用户的问题通常不会直接问“有哪些链接”，他们更可能会问：“部署教程”，“问题文档”等。因此，我们需要对此知识点进行简单处理，如下图所示：

手动修改知识库数据

接下来，我们可以创建一个应用，看看效果如何。首先创建一个应用，并在知识库中关联相关的知识库。另外，还需要在配置页面的提示词中，告诉 GPT：“知识库的范围”。

应用创建

README QA 拆分后效果

导入社区常见问题

接着，我们把 FastGPT 常见问题的文档导入。由于之前的整理不到位，我们只能手动录入对应的问答。

手动录入知识库结果

导入结果如上图。可以看到，我们均采用的是问答对的格式，而不是粗略的直接导入。目的就是为了模拟用户问题，进一步的提高向量搜索的匹配效果。可以为同一个问题设置多种问法，效果更佳。

FastGPT 还提供了 OpenAPI 功能，你可以在本地对特殊格式的文件进行处理后，再上传到 FastGPT，具体可以参考：FastGPT Api Docs

知识库微调和参数调整

FastGPT 提供了搜索测试和对话测试两个功能，我们可以通过这两个功能来进行知识库微调和参数调整。

我们建议你提前收集一些用户问题进行测试，根据预期效果进行跳转。可以先进行搜索测试调整，判断知识点是否合理。

搜索测试

通过搜索测试，我们可以输入问题，查看返回的知识库数据，来测试知识库的查询效果。下面是搜索测试的界面：

搜索测试界面

我们可以看到，系统返回了与之相关的问答数据。

你可能会遇到下面这种情况，由于“知识库”这个关键词导致一些无关内容的相似度也被搜索进去，此时就需要给第四条记录也增加一个“知识库”关键词，从而去提高它的相似度。

提示词设置

提示词的作用是引导模型对话的方向。在设置提示词时，遵守 2 个原则：

告诉 GPT 回答什么方面内容。
给知识库一个基本描述，从而让 GPT 更好的判断用户的问题是否属于知识库范围。

提示词设置

更好的限定模型聊天范围

首先，你可以通过调整知识库搜索时的相似度和最大搜索数量，实现从知识库层面限制聊天范围。通常我们可以设置相似度为 0.82，并设置空搜索回复内容。这意味着，如果用户的问题无法在知识库中匹配时，会直接回复预设的内容。

搜索参数设置

空搜索控制效果

由于 OpenAI 向量模型并不是针对中文，所以当问题中有一些知识库内容的关键词时，相似度
会较高，此时无法从知识库层面进行限定。需要通过限定词进行调整，例如：

我的问题如果不是关于 FastGPT 的，请直接回复：“我不确定”。你仅需要回答知识库中的内容，不在其中的内容，不需要回答。

效果如下：

限定词效果

当然，GPT-3.5 在一定情况下依然是不可控的。

通过对话调整知识库

与搜索测试类似，你可以直接在对话页里，点击“引用”，来随时修改知识库内容。

查看答案引用

结语

向量搜索是一种可以比较文本相似度的技术。
大模型具有总结和推理能力，可以从给定的文本中回答问题。
最有效的知识库构建方式是 QA 和手动构建。
Q 的长度不宜过长。
需要调整提示词，来引导模型回答知识库内容。
可以通过调整搜索相似度、最大搜索数量和限定词来控制模型回复的范围。

想入门 AI 大模型却找不到清晰方向？备考大厂 AI 岗还在四处搜集零散资料？别再浪费时间啦！2025 年 AI 大模型全套学习资料已整理完毕，从学习路线到面试真题，从工具教程到行业报告，一站式覆盖你的所有需求，现在全部免费分享！

👇👇扫码免费领取全部内容👇👇

一、学习必备：100+本大模型电子书+26 份行业报告 + 600+ 套技术PPT，帮你看透 AI 趋势

想了解大模型的行业动态、商业落地案例？大模型电子书？这份资料帮你站在 “行业高度” 学 AI：

1. 100+本大模型方向电子书

在这里插入图片描述

2. 26 份行业研究报告：覆盖多领域实践与趋势

报告包含阿里、DeepSeek 等权威机构发布的核心内容，涵盖：

职业趋势：《AI + 职业趋势报告》《中国 AI 人才粮仓模型解析》；
商业落地：《生成式 AI 商业落地白皮书》《AI Agent 应用落地技术白皮书》；
领域细分：《AGI 在金融领域的应用报告》《AI GC 实践案例集》；
行业监测：《2024 年中国大模型季度监测报告》《2025 年中国技术市场发展趋势》。

3. 600+套技术大会 PPT：听行业大咖讲实战

PPT 整理自 2024-2025 年热门技术大会，包含百度、腾讯、字节等企业的一线实践：

在这里插入图片描述

安全方向：《端侧大模型的安全建设》《大模型驱动安全升级（腾讯代码安全实践）》；
产品与创新：《大模型产品如何创新与创收》《AI 时代的新范式：构建 AI 产品》；
多模态与 Agent：《Step-Video 开源模型（视频生成进展）》《Agentic RAG 的现在与未来》；
工程落地：《从原型到生产：AgentOps 加速字节 AI 应用落地》《智能代码助手 CodeFuse 的架构设计》。

二、求职必看：大厂 AI 岗面试 “弹药库”，300 + 真题 + 107 道面经直接抱走

想冲字节、腾讯、阿里、蔚来等大厂 AI 岗？这份面试资料帮你提前 “押题”，拒绝临场慌！

1. 107 道大厂面经：覆盖 Prompt、RAG、大模型应用工程师等热门岗位

面经整理自 2021-2025 年真实面试场景，包含 TPlink、字节、腾讯、蔚来、虾皮、中兴、科大讯飞、京东等企业的高频考题，每道题都附带思路解析：

2. 102 道 AI 大模型真题：直击大模型核心考点

针对大模型专属考题，从概念到实践全面覆盖，帮你理清底层逻辑：

3. 97 道 LLMs 真题：聚焦大型语言模型高频问题

专门拆解 LLMs 的核心痛点与解决方案，比如让很多人头疼的 “复读机问题”：

三、路线必明： AI 大模型学习路线图，1 张图理清核心内容

刚接触 AI 大模型，不知道该从哪学起？这份「AI大模型学习路线图」直接帮你划重点，不用再盲目摸索！

在这里插入图片描述

路线图涵盖 5 大核心板块，从基础到进阶层层递进：一步步带你从入门到进阶，从理论到实战。

L1阶段:启航篇丨极速破界AI新时代

L1阶段：了解大模型的基础知识，以及大模型在各个行业的应用和分析，学习理解大模型的核心原理、关键技术以及大模型应用场景。

L2阶段：攻坚篇丨RAG开发实战工坊

L2阶段：AI大模型RAG应用开发工程，主要学习RAG检索增强生成：包括Naive RAG、Advanced-RAG以及RAG性能评估，还有GraphRAG在内的多个RAG热门项目的分析。

L3阶段：跃迁篇丨Agent智能体架构设计

L3阶段：大模型Agent应用架构进阶实现，主要学习LangChain、 LIamaIndex框架，也会学习到AutoGPT、 MetaGPT等多Agent系统，打造Agent智能体。

L4阶段：精进篇丨模型微调与私有化部署

L4阶段：大模型的微调和私有化部署，更加深入的探讨Transformer架构，学习大模型的微调技术，利用DeepSpeed、Lamam Factory等工具快速进行模型微调，并通过Ollama、vLLM等推理部署框架，实现模型的快速部署。

L5阶段：专题集丨特训篇【录播课】

四、资料领取：全套内容免费抱走，学 AI 不用再找第二份

不管你是 0 基础想入门 AI 大模型，还是有基础想冲刺大厂、了解行业趋势，这份资料都能满足你！
现在只需按照提示操作，就能免费领取：

👇👇扫码免费领取全部内容👇👇

2025 年想抓住 AI 大模型的风口？别犹豫，这份免费资料就是你的 “起跑线”！

使用 FastGPT 构建高质量 AI 知识库，大模型入门到精通，收藏这篇就足够了！

引言

起源

初步发展

FastGPT 的知识库逻辑

基础概念

创建知识库应用

基础知识获取

QA 修正

导入社区常见问题

知识库微调和参数调整

搜索测试

提示词设置

更好的限定模型聊天范围

通过对话调整知识库

结语

一、学习必备：100+本大模型电子书+26 份行业报告 + 600+ 套技术PPT，帮你看透 AI 趋势

1. 100+本大模型方向电子书

2. 26 份行业研究报告：覆盖多领域实践与趋势

3. 600+套技术大会 PPT：听行业大咖讲实战

二、求职必看：大厂 AI 岗面试 “弹药库”，300 + 真题 + 107 道面经直接抱走

1. 107 道大厂面经：覆盖 Prompt、RAG、大模型应用工程师等热门岗位

2. 102 道 AI 大模型真题：直击大模型核心考点

3. 97 道 LLMs 真题：聚焦大型语言模型高频问题

三、路线必明： AI 大模型学习路线图，1 张图理清核心内容

路线图涵盖 5 大核心板块，从基础到进阶层层递进：一步步带你从入门到进阶，从理论到实战。

L1阶段:启航篇丨极速破界AI新时代

L2阶段：攻坚篇丨RAG开发实战工坊

L3阶段：跃迁篇丨Agent智能体架构设计

L4阶段：精进篇丨模型微调与私有化部署

L5阶段：专题集丨特训篇 【录播课】

四、资料领取：全套内容免费抱走，学 AI 不用再找第二份

L5阶段：专题集丨特训篇【录播课】