文档越多,越难找到答案;知识越散,越难建立信任
企业文档以指数级增长,却散落在共享盘、Wiki、OA 与 IM 中——「存得下」与「找得到、信得过、用得对」之间,横亘着系统性鸿沟
文档存放系统
文档量大杂乱,知识孤岛林立
文档散落于共享盘、Wiki 与 IM,格式混杂、版本不一,缺少统一入口
平均检索耗时
检索靠「人找人」,效率低
找文档靠目录翻找与询问同事,平均耗时以小时计
文档长期未更新
文档更新滞后,内容口径不一致
改版后副本不同步,过期信息反复被引用,误导决策
员工不信任 AI 回答
通用大模型幻觉与越权风险
不了解企业私有知识易幻觉,且缺少权限收敛与审计
把「文档仓库」变成「可信赖的智能知识伙伴」
不只是把文档「存起来、搜得到」,而是让知识可问答、可溯源、可信任——员工从「找文档」转变为「问知识」
三层架构:从多源文档到可信问答
AI Gateway 位于员工与文档之间,向上承载自然语言问答入口,向下统一接入异构数据源,全链路完成「接入 → 解析 → 索引 → 召回 → 生成 → 审计」。
员工交互层
自然语言问答入口,覆盖全场景办公触点
企业知识中台
AI Gateway + 知识引擎,承载全部知识服务能力
企业数据源层
异构文档源统一纳管,一处接入全局可用
检索增强生成(RAG)数据流
文档接入与解析
多源连接器同步文档,格式自动识别,版式还原解析
语义分块与向量化
清洗去噪、语义边界分块 + 重叠窗口,Embedding 写入向量库
混合召回与重排序
向量检索 + BM25 双路召回,Rerank 模型精排证据
证据约束生成
大模型仅基于召回证据生成答案,输出附带引用溯源
实时更新闭环
变更检测触发增量索引,版本管理与失效重建,知识常新
RAG 不是「检索 + 生成」的简单拼接,而是一套可信工程
答案的可信度取决于检索质量的上限与生成约束的下限——解析分块、混合检索、重排序与引用溯源四者缺一不可
解析与分块质量决定召回上限
版式还原解析(表格、页眉页脚、目录结构)保留文档结构语义,语义分块 + 重叠窗口兼顾召回粒度与上下文完整性
混合检索覆盖两类查询
向量语义召回 · semantic
向量语义召回擅长「语义近似」表述,BM25 关键词召回擅长「术语精确」匹配,双路互补提升召回率
重排序精炼上下文
召回后
精排后
Rerank 模型对召回片段二次精排,裁剪无关噪声,控制送入模型的上下文质量与 Token 成本
引用溯源与置信兜底
入职满一年可休 5 天年假?
是的,入职满一年可享受 5 天年假1,具体见《员工手册》第 3.2 节2
答案强制附引用并可跳转原文,低置信度主动拒答并引导补充问题或转人工,杜绝「不懂装懂」
RAG 工程化 = 「分块解析打好底」+「混合检索召得全」+「重排序精排得准」+「引用兜底信得过」,四者共同决定答案可信度。
五大核心能力,构建常新、可信、可控的企业知识底座
从多源接入、智能解析、混合检索到 RAG 生成与实时更新治理,一站式打通「接入 → 索引 → 问答 → 治理」
异构文档源统一接入,终结知识孤岛
共享盘、Wiki、OA 与 IM 等异构数据源经连接器统一接入,格式自动识别(PDF / Word / Markdown / 表格等),支持定时增量同步与权限绑定。
- 多源连接器统一接入
- 多格式自动识别
- 定时增量同步
覆盖入职、研发、协同与一线赋能场景
新员工入职与制度查询
入职指南与人事/行政制度自然语言问答,答案带引用、秒级上手。
研发与项目知识沉淀
技术方案、接口文档、复盘纪要统一沉淀,经验可检索、可复用。
跨部门政策协同发布
制度与公告统一发布、实时更新,跨部门口径一致、版本可追溯。
销售与客户成功赋能
产品手册、案例库与话术库实时同步一线,售前售后随时取用。