返回知识库

AI 与提示 · 知识与检索

文档解析Document Parsing

文档解析把一页文件拆成带读序、页码和置信度的字段。拆错了——双栏残句、OCR 粘连——就不能送进检索。

先认出这一页发票,再看抽出来的字段能不能入库

下面就是知识库要吃进去的那一页。默认发票字段清楚、可入库;双栏会拼出残句,扫描件日期会粘住——失败章盖在这一页上。

invoice-2024-087.pdf可入库

增值税专用发票

购方:云杉科技有限公司

项目 API 服务 ×1

金额 ¥1,280.00

  1. 标题增值税专用发票0.99 · p.2
  2. 购方云杉科技有限公司0.97 · p.2
  3. 金额CNY 1,280.000.98 · p.2

原生文字层、单栏、表格清楚,读序和人眼一致。

原因:干净 PDF 自带文字层,读序、坐标、置信度都过门。下一步:换成双栏论文,看同一套抽取会不会拼出残句。

知识点:解析质量就是检索质量

页上的读序、置信度和拦截章已经演过,这里只给命名。

  • 解析输出不是一段纯文本,而是带读序、页码、坐标和置信度的结构块。
  • 双栏必须按栏读;按行读会把左右栏拼成残句,引用会指错段。
  • 表格靠行列关系;边框断裂要停在复核,不能打成一串字。
  • 扫描件靠 OCR,低置信字符必须人工核对,不能猜完再入库。

什么时候盯解析、怎么盯

RAG 引用错页、表格乱码、扫描件乱字,多半出在解析。

  • 信号:引用错页、表格问答答非所问、扫描件检索乱码。
  • 适用:PDF / Word / 扫描件要进知识库之前。
  • 不适用:源数据已是 JSON、CSV、API——直接分块更准。
  • 最短路径:带版面的解析器 → 看读序和置信度 → 低置信停复核 → 过门再进索引。

正反例:同一篇双栏论文,只换读法

都要把论文倒进知识库。

正例先认版面再按栏读

左栏读完再读右栏,引用能回到第 1 页左栏第 2 行。

反例按行拼字符硬入库

残句进了索引,检索到的是不存在的段落,回答会一本正经地引用错文。

快速自测

扫描签收单解析后,日期置信度 0.61、表格边框断裂。最安全的下一步是什么?

继续查证

术语的技术定义和行为以这些一手或权威资料为准。

下一步学

和本知识点经常一起出现的概念。