你会得到什么
第三份产物和前两份一样重要。一个只输出成功项的批处理流程,等于把失败悄悄吞掉了。
关键认知:什么时候让模型读,什么时候让它写脚本
分界线是 5 份。这不是硬规则,是一个经验阈值:超过 5 份,人工核对成本已经高到你不会真的去核,那就必须让流程本身可验证。
前置条件
1
上传文件
把文件传到工作区。单文件上限:文档类 512 MB、图片 20 MB、代码文件 50 MB。总量计入你的云盘配额(免费版 10 GB,付费档更高)。
2
确认文件是可解析的
扫描件 PDF(图片型)和文本型 PDF 是两回事。前者需要 OCR,抽取准确率和排版复杂度强相关。先随便挑一份让专家读一下,确认能读出文字再往下走。
3
自己先定字段
列出你要的字段名和类型(文本/数字/日期)。让模型「自己看看有什么字段」会导致每份文件抽出的字段集不一样,最后拼不成表。
步骤
第 1 步:抽样看清楚结构
不要一上来就处理全部。先看三份:第 2 步:让它写脚本,而不是直接干活
第 3 步:先跑 5 份,再跑全量
第 4 步:转成带公式的表格
CSV 只是中间产物。最终交付要能算:第 5 步:处理失败清单
第 6 步:验收
- 打开 xlsx,随机抽 5 行,对照原文件逐字段核
- 改一个「含税总额」单元格的值,确认合计行和不含税列跟着变
- 确认行数 = 成功数,且 成功数 + 失败数 = 文件总数
- 打开 failures.md,确认每条都有具体原因,没有「解析失败」这种没信息量的描述
边界与失败态
变体
需要语义判断,不只是抽字段
需要语义判断,不只是抽字段
分两段:脚本先把原文段落抽成结构化的 CSV,再让模型逐行读那些段落做判断(比如「这条付款条款有没有风险」)。不要让模型一边解析 PDF 一边判断——两件事混在一起时,出错了你分不清是没读到还是判断错。
文件在飞书文档里,不在本地
文件在飞书文档里,不在本地
连接飞书知识库后可以直接读,不用先下载。见 飞书接入。
要定期处理新到的文件
要定期处理新到的文件
把定稿的脚本和提示词固化成定时任务。注意每次执行都会真实计费,见 每日简报。
结果要给团队看
结果要给团队看
xlsx 适合自己算,网页适合给人看。把汇总结论做成站点见 发布一个站点。
相关页面
Excel 表格
公式优先原则与能力边界
文件与云盘
上传限制与配额
工具全表
读写与命令执行工具的参数与默认值
沙盒环境
脚本运行在哪里

