AI 长文档总结与问答:先检查遗漏,再建工作流
总结、提取和问答,要分别验收。
AI风向编辑整理 · 更新于 · 方法指南
把需求缩成一个可检查的输出
“读懂这份报告”太宽。先选择一个任务:提取合同关键日期、归纳会议决定,或回答几个带页码的问题。规定字段、缺失值和引用位置;原文没有答案时,应允许返回未找到。
长上下文只是能放下
能接收很长的文件,不保证每处都读得准确。准备几条分布在开头、中间、结尾的可核对问题,再加几条原文没有答案的问题。检查遗漏、错配数字和伪造引用,比摘要是否流畅更有用。
把扫描件质量算进流程
扫描文档要先检查文字识别,表格要保留行列关系。模型不能稳定补回输入里已经丢失的信息。用两页样本确认解析质量,再处理整批文件。敏感文档要先确认自己的数据使用权限和所用服务规则。
用实际用量估算成本
长文档的输入通常比提问本身长很多;多轮问答可能反复携带文档。先记录一份代表性文档的 Token 和调用次数,再使用工作台估算。若有缓存,依据真实命中率调整。