Skip to main content
这篇处理的是一类很常见但很容易做砸的活:手上有一批文件(合同、发票、简历、周报、导出的 CSV),需要从里面把关键字段抽出来,汇总成一张能筛能算的表。 做砸的方式基本只有一种——让模型逐个”读一下总结一下”。那样做的结果是:前几份很准,中间开始漏字段,最后几份的数字是编的,而且你没有任何办法知道是从第几份开始坏的。这篇的核心就是绕开这个坑:让模型写脚本去处理,而不是让模型自己去读

你会得到什么

第三份产物和前两份一样重要。一个只输出成功项的批处理流程,等于把失败悄悄吞掉了。

关键认知:什么时候让模型读,什么时候让它写脚本

分界线是 5 份。这不是硬规则,是一个经验阈值:超过 5 份,人工核对成本已经高到你不会真的去核,那就必须让流程本身可验证。

前置条件

1

上传文件

把文件传到工作区。单文件上限:文档类 512 MB、图片 20 MB、代码文件 50 MB。总量计入你的云盘配额(免费版 10 GB,付费档更高)。
2

确认文件是可解析的

扫描件 PDF(图片型)和文本型 PDF 是两回事。前者需要 OCR,抽取准确率和排版复杂度强相关。先随便挑一份让专家读一下,确认能读出文字再往下走。
3

自己先定字段

列出你要的字段名和类型(文本/数字/日期)。让模型「自己看看有什么字段」会导致每份文件抽出的字段集不一样,最后拼不成表。

步骤

第 1 步:抽样看清楚结构

不要一上来就处理全部。先看三份:
第 2 问的「有没有字段根本不存在」是关键。缺失字段和抽取失败是两回事,必须在写脚本之前就区分开。

第 2 步:让它写脚本,而不是直接干活

「先写完给我看」这一步别省。脚本是这个流程里唯一你能完整审阅的东西,看一眼正则和字段定位逻辑,比事后核对 47 行输出便宜得多。

第 3 步:先跑 5 份,再跑全量

对照原文件核这 5 行。全对才继续跑全量;有一处不对就回去改脚本,不要手工改结果——手工改过的那一行会让你误以为脚本是对的。

第 4 步:转成带公式的表格

CSV 只是中间产物。最终交付要能算:
「用公式,不要写死」这条必须明确说。默认行为容易变成把算好的数字直接填进单元格——表格看起来一模一样,但你改任何一个原始值,合计不会变。这类错误在交付给别人之后才暴露,代价最大。详见 Excel 表格

第 5 步:处理失败清单

这一步走完,失败清单里剩下的应该全是「确实需要人处理」的。如果还剩着「脚本能修但没修」的条目,那这次批处理就没完成。

第 6 步:验收

  1. 打开 xlsx,随机抽 5 行,对照原文件逐字段核
  2. 改一个「含税总额」单元格的值,确认合计行和不含税列跟着变
  3. 确认行数 = 成功数,且 成功数 + 失败数 = 文件总数
  4. 打开 failures.md,确认每条都有具体原因,没有「解析失败」这种没信息量的描述
第 3 项是最容易发现问题的检查:数字对不上,说明中间有文件被静默丢掉了。

边界与失败态

变体

分两段:脚本先把原文段落抽成结构化的 CSV,再让模型逐行读那些段落做判断(比如「这条付款条款有没有风险」)。不要让模型一边解析 PDF 一边判断——两件事混在一起时,出错了你分不清是没读到还是判断错。
连接飞书知识库后可以直接读,不用先下载。见 飞书接入
把定稿的脚本和提示词固化成定时任务。注意每次执行都会真实计费,见 每日简报
xlsx 适合自己算,网页适合给人看。把汇总结论做成站点见 发布一个站点

相关页面

Excel 表格

公式优先原则与能力边界

文件与云盘

上传限制与配额

工具全表

读写与命令执行工具的参数与默认值

沙盒环境

脚本运行在哪里