操作指南
AI 文档审查工作流:从来源包到批准草稿

AI 文档审查工作流应该把一组范围明确的来源文件转换成人员能够核实的结构化发现。AI 可以盘点文件、提取条款或事实、比较版本、标记缺口并起草报告,但不应隐藏来源冲突、虚构缺失内容,或作出最终法律、财务、就业或安全决定。
研究与披露: 本工作流参考了 IBM 文档工作流指南、IBM 文档处理指南和 NIST 生成式 AI 配套框架,资料复核日期为 2026 年 9 月 4 日。审查矩阵和验收清单均为原创编辑框架,不能替代具备资质的专业审查。
AI 文档审查适合什么场景
它适合在一组已知文档中处理范围明确、可重复的问题:比较政策版本、寻找缺失字段、为法律顾问整理合同条款、从招标文件中提取要求、将报告与来源文件核对,或者准备尽职调查索引。
不要从“审查所有内容”这种没有定义的请求开始。应明确决定、文档、问题、证据标准、审查者和输出。
选择审查模式
| 模式 | 目的 | 典型输出 |
|---|---|---|
| 提取 | 定位指定事实、条款、要求或字段 | 包含来源位置的结构化表格 |
| 比较 | 识别新增、删除和含义变化 | 版本矩阵和重大差异 |
| 合规检查 | 按明确规则集比较文档 | 逐项控制发现和缺口 |
| 尽职调查 | 为专家判断组织证据 | 问题清单、证据、责任归属和待解决问题 |
| 质量审查 | 按来源和验收标准检查草稿 | 修正、缺乏支持的声明和批准状态 |
| 探索 | 寻找供进一步调查的模式或问题 | 与已核实发现明确分离的假设 |
一个项目可以采用多种模式,但应将其作为可见阶段分别运行。探索假设不能悄悄变成合规发现。
第一步:锁定来源清单
分析前创建清单:
| 字段 | 目的 |
|---|---|
| 文档 ID 和文件名 | 建立稳定引用 |
| 版本和生效日期 | 防止与过期文本比较 |
| 来源和负责人 | 确立权威性 |
| 敏感级别和访问 | 限制暴露 |
| 纳入或排除 | 让范围可见 |
| 取代关系 | 解决版本关系 |
将原件保持为只读。记录任何损坏、不完整、重复或超出范围的文件。
定义来源权威顺序
分析前先写下冲突处理规则。政策审查中,当前已签署政策可能优先于手册草稿;合同工作中,已执行的修订可能取代原始条款;研究中,原始数据集可能优先于后续摘要。
系统应保留两个来源并解释所应用的关系。不要从记录中删除优先级较低的版本,因为它可能解释过去决定或揭示迁移问题。
按来源而不只是项目控制访问
来源包可能组合具有不同权限的文档。确认审查者和处理系统有权访问每份文件。不要因为所有项目参与者都能看到最终摘要,就让他们同时访问受限附录。
派生笔记可能继承访问限制。即使只提取一条简短条款,也可能暴露个人、法律、财务或安全敏感内容。
第二步:定义审查模式结构
先把审查问题转换成字段,再要求系统给出结论。
审查目标:
必需文档集合:
主题或条款:
提取措辞:
文档 ID 以及页码或章节:
生效日期:
与基线的差异:
问题类型:
影响:
缺失信息:
建议审查者:
状态:待处理 / 已确认 / 已解决 / 超出范围结构模式能够让缺口保持可见。叙述式摘要经常把缺失、冲突和不确定性模糊成流畅文字。
添加 extraction_status、review_status 和 decision_status 字段。一项发现可能成功提取,却受到审查者质疑,并且仍在等待授权决定。单一的 complete 字段无法表达这些差异。
对模式和审查标准进行版本控制。要求变化时,确定哪些发现必须重新运行。比较不同版本的问题数量时,必须考虑规则集是扩大还是缩小。
第三步:准备文档
开始实质审查前:
- 确认文件完整性、格式、可读性、页数和语言。
- 检测重复和近似重复文件,但不要过早删除证据。
- 保留表格、分栏、页眉、脚注、签名和修订记录的布局。
- 在需要时执行 OCR,并保留置信度或质量信号。
- 在有意义的边界处拆分大文件,同时保留页码引用。
- 识别缺失的附件、附表、链接文件和被引用文档。
- 标记手写、已脱敏、损坏或仅含图片的区域,交由人工处理。
只提取文本可能破坏含义。表格转换质量较差时,“排除”列中的值可能显示在“包括”标题旁边。信任批量结果前,应先抽查复杂布局。
第四步:先提取,再解释
第一轮只返回相关文字以及文档和位置引用,并将样本与原件核对。完成这一步后,才能让系统为差异分类或综合发现。把提取与解释分开,更容易发现错误。
对于表格和扫描文件,应验证布局、单位、标题、脚注和 OCR。一个识别正确的数字仍可能被放到错误列中。
采用两轮提取设计。第一轮识别候选位置,第二轮从这些位置返回确切段落和结构化字段。跨文档类型和布局比较样本,并加入本不应该找到相关内容的页面。
不要只测准确率,也要测遗漏。一次审查可能正确返回五项条款,却漏掉第六项必需条款;它看起来准确,实际仍不完整。
第五步:建立问题与证据矩阵
为每个问题保留支持段落、冲突来源、缺失文件、所用规则和审查决定。使用 unresolved 标记缺口,不要用看似可能的答案填补。
按影响和置信度确定优先级:
- 高影响、低置信度立即交由专家审查;
- 高影响、高置信度仍需责任人批准;
- 低影响、低置信度可以抽查或退回补充说明;
- 低影响、高置信度可按工作流已批准规则继续。
使用稳定的问题类别
类别可以包括缺失要求、措辞冲突、义务变化、来源过期、负责人未定义、声明缺乏支持、证据无法访问、计算不匹配、审批缺口和超出范围。稳定类别有助于分流,并揭示重复的流程问题。
每个问题都应包含影响理由,而不只是严重程度标签。审查者需要知道谁或什么受到影响,以及哪项决定被阻止。
保留分歧
如果两位审查者对一项条款有不同解释,应记录双方立场、支持段落以及有权决定的人。不要让 AI 把分歧融合成折中句子。
第六步:使用可追溯引用起草
每项重要发现都应链接到来源位置。区分文档原文、审查者解释和 AI 建议。来源冲突时,应说明冲突和来源优先级规则,而不是静默选择其中一项。
仅使用已批准的来源清单生成审查矩阵。
引用最少量的相关段落,并注明文档 ID 以及页码或章节。
将提取、解释和建议相互分离。
把缺失或冲突证据标记为未解决。
不得作出最终法律、财务、就业或安全决定。为已确认发现、未解决问题、范围限制和建议分别建立章节。建议应该引用它所回应的发现,并指定决策人。
避免制造置信度假象。只有定义并验证了含义,数值置信度才有用。来源质量、提取置信度、规则匹配和审查者一致性是不同信号。
第七步:审查、修订并批准固定版本
审查者打开引用位置、修正矩阵、解决或升级问题,并为特定输出版本签字。如果来源包发生变化,应识别受影响发现并重新批准,不能沿用旧批准。
使用原因代码记录修正:证据遗漏、位置错误、提取错误、解释错误、来源过期、范围变化或审查者偏好。这样可以把审查工作转化为评估集,并判断系统是否改进。
最终批准应说明覆盖范围。批准问题清单不会自动批准合同、付款、政策或发布。
完整示例:审查政策版本
一家公司必须在上线前,把新的差旅政策与当前员工手册、地区费用规则和经理指南比较。
来源清单
团队记录四份文件及其负责人和日期。政策草稿不具有权威性;地区费用规则决定当地报销限额,在新政策获批前,已签署的员工手册决定公司范围内的措辞。
审查结构模式
必需主题包括资格、预订、批准限额、收据、例外、安全、地区差异、数据处理、生效日期和负责人。每一行都需要确切措辞,以及每个适用来源中的位置。
提取与比较
AI 提取候选段落,确定性检查识别币种和数字差异。比较结果发现,草稿提高了一项餐费限额、删除了一项收据例外,并指定了一个组织目录中不存在的审批角色。
问题矩阵
限额变化分配给财务,删除例外分配给 HR 和法务,不存在的角色分配给政策运营。某个地区缺少来源,因此该行保持未解决。
草稿与批准
系统起草一份带引用和被阻止事项清单的决策备忘录,但不会宣称政策已经就绪。负责人解决问题,将修订来源作为新版本加入,重新运行受影响条目,再由授权政策负责人批准固定版本。
这套工作流在沟通开始前暴露了缺失来源和不存在的角色,因此取得成功。
按文档类型选择审查模式
合同
针对签约方、期限、续约、价格、义务、数据、安全、责任、终止、适用法律和引用附表建立条款矩阵。与已批准基线比较,但将法律判断交给法律顾问。
招标文件
把每项要求映射到响应位置、负责人、状态、证据和例外。区分强制措辞、评分指南和问题。单独验证提交说明、日期、格式和附件。
研究报告
提取重要声明、方法、研究对象、日期、限制、资助和源数据。检查草稿是否把相关性改写成因果关系,或把结论推广到研究对象之外。
政策和流程
跟踪权威、生效日期、适用性、角色、必需操作、例外、记录和被取代文档。确认培训和沟通使用的是已批准版本。
财务或运营报告
把数字追溯到来源表格、单位、筛选条件、期间和转换过程。重新计算重要合计,并与权威系统对账。
安全与提示词注入控制
文档文本是不受信任的输入。简历、合同或网页导出内容可能包含让 AI 忽略审查范围、泄露其他文件或使用工具的指令。处理系统应把这些文字视为文档内容,绝不能视为系统权限。
限制可访问来源和工具,隔离项目,最小化权限,验证结构化输出,并要求外部操作获得批准。记录每次运行访问过哪些来源和工具。上线前使用含有对抗性指令的文档进行测试。
不要通过跨项目搜索索引暴露某一方的受限文档。必须在查询时执行检索权限,并让缓存或派生内容遵循同一权限。
衡量审查质量与成本
| 指标 | 定义 |
|---|---|
| 发现召回率 | 已发现的必需发现 / 已知必需发现 |
| 引用准确率 | 正确支持位置 / 返回的引用 |
| 重大错误率 | 存在后果性提取或解释错误的发现 |
| 未解决问题可见性 | 正确保留的真实缺口 / 已知缺口 |
| 审查者修正时间 | 检查、修正和批准所需时间 |
| 返工率 | 下游使用后重新打开的审查 |
| 每项批准审查的成本 | 处理、工具、审查者和修正成本 |
根据已完成审查建立带标签的数据集,并加入没有发现问题的文档。模型、提取、提示词、结构模式、来源类型或审查标准变化后重新评估。
围绕证据设计审查界面
在结构化发现旁边显示原始页面和提取段落。审查者应能查看前后语境、比较版本、修正字段、改变处理状态、分配负责人和记录理由,同时不丢失来源位置。
谨慎使用视觉状态。不能只用颜色表达严重程度或批准情况。使用文本和可访问控件区分机器建议、人工已审查、已解决和已授权状态。
将相关发现分组并优先显示重要问题,以减轻审查疲劳,但必须保留检查完整来源的方法。隐藏低置信度行可能造成审查原本要发现的遗漏。
跟踪能够改进工作流的交互证据:被修正字段、被拒绝发现、被替换来源、被升级冲突,以及按问题类型统计的时间。不要把鼠标移动或表面操作当成审查质量指标。
校准人工抽样
上线早期审查每项发现。之后,如果实测表现和政策允许,可以抽查确定性的低风险提取。对于高影响问题、新文档类型、变更后的模型、已确认事故和接近决策阈值的案例,继续进行完整审查。
对部分样本使用盲法双人审查,测量审查者一致性。分歧可能说明标准模糊,而不是 AI 失败。应澄清量表、保留合理不确定性,不要在合格专家意见不同时强迫达成共识。
逐步上线
先在人工审查旁边以影子模式运行。下一阶段让 AI 准备提取表,但仍由审查者作出所有发现。然后允许低风险发现进入问题矩阵并接受完整审查。只有实测表现达标后,工作流才能自动路由或起草最终交付物。
为敏感、异常、无法访问或具有对抗性的文档保留人工路径。扩展到新语言、司法管辖区、条款集或文件格式属于新的验证范围,而不是普通配置开关。
验收检查清单
-
来源清单完整且具有访问控制。
-
每项重要发现都有文档和位置引用。
-
已将提取样本与原件核对。
-
缺失和冲突证据保持可见。
-
受限数据没有进入未经批准的系统。
-
高影响发现具有指定的合格审查者。
-
已批准输出和来源版本得到记录。
-
修正可用于未来评估。
-
文档内容无法改变系统权限或审查规则。
-
人工备用和来源变更后的失效路径已经测试。
文档工作流自动化指南介绍接收、路由、异常和保留。AI 知识管理指南则说明如何在更广泛的资料集合中管理来源责任和时效性。
常见问题
AI 可以审查合同吗?
AI 可以提取和比较条款、整理问题并准备审查矩阵。尤其在措辞、司法管辖区或缺失语境会影响结论时,应由具备资质的法律顾问作出法律解释和决定。
如何减少文档审查中的幻觉?
限制来源集合,先提取再综合,要求精确到位置的引用,使用结构化字段,允许结果保持未解决,并让审查者打开原件。
封闭式文档审查应该允许 AI 使用网页搜索吗?
只有范围明确允许时才可以。将外部研究与依据所提供记录得出的发现分开,并标记每种来源,使审查者知道结论由什么证据决定。
审查完成后应该保留什么?
根据适用记录政策保留来源清单、已批准输出、问题矩阵、审查者决定和必要审计记录。避免保留不必要的敏感提示词或中间内容。
AI 文档审查必须达到多高准确率?
按照发现类型和影响设定验收标准。即使实测准确率很高,高影响条款或数字仍可能需要完整人工检查。在代表性文档上同时测量召回率和准确率。
AI 可以同时比较数百份文档吗?
它可以辅助批量提取和比较,但数量增加会提高文件遗漏、引用失效、语境丢失和隐藏异常的风险。应使用清单、分阶段处理、抽样、对账和明确的失败报告。
批准后来源发生变化怎么办?
创建新的来源版本,识别并重新运行受影响发现,在含义或证据变化时重新批准。按照保留政策保存之前获批的记录。
审查者应该看到 AI 置信度分数吗?
只有在分数含义已经验证且不会鼓励自动化偏差时才显示。来源段落、规则、影响和不确定原因通常比单一百分比更可操作。
审查者修正可以自动用于训练系统吗?
可以把修正保留为候选评估或训练数据,但重复使用前要审查其质量、权限、隐私和代表性。匆忙作出的修正不会自动成为标准答案。
在 Ottermind 中使用来源清单、审查结构模式和验收清单启动审查,使最终文档始终与背后的证据和决定相连接。
