AWS Textract:表单与表格提取
Textract 不止是纯 OCR:它能提取键值对、表格和表单字段,非常适合发票、收据和结构化文档。纯文本提取比其表单/表格/查询功能更便宜。
AWS · 原生 OCR 引擎
通过 ExactRead 使用 AWS Textract 进行 OCR。上传图片或 PDF,提取可复核文本,与其他模型对比,并导出 TXT 或 JSON。AWS Textract 是来自 AWS 的原生 OCR 引擎。
上传一份文档,直接用该模型运行 OCR 看看效果——无需离开本页。
提供方
AWS
类型
原生 OCR 引擎
支持格式
图片与 PDF
额度成本
2 额度 / 文档
Textract 不止是纯 OCR:它能提取键值对、表格和表单字段,非常适合发票、收据和结构化文档。纯文本提取比其表单/表格/查询功能更便宜。
Textract 按页用量计费,启用表单、表格或查询时费率更高。通过 ExactRead 运行可省去 AWS/IAM 配置,让你在正式采用前先与视觉模型对比评测。
当你需要用原生 OCR 引擎识别图片与 PDF时,AWS Textract 是不错的选择。由于文档质量参差不齐,ExactRead 允许你单独运行 AWS Textract,也可以在标准化前与其他 OCR 路由并排对比。
文档质量参差不齐,判断 AWS Textract 是否合适的唯一可靠方式就是用你自己的文件测试。上传一份样本,在这里直接运行 AWS Textract,复核提取的文本,并在同一工作区与另一个 OCR 模型对比,再决定是否采用。
每个 AWS Textract 结果都会保留模型、状态、置信度、告警和结构化 JSON,复核人员能看到接受该输出的依据。已接受结果可导出为 TXT 或 JSON,用于后续流程。
适合。Textract 的表单与表格提取面向发票、收据等结构化文档。遇到特殊版式时,可在同一次 ExactRead 运行中与视觉模型交叉验证。
AWS Textract 是 ExactRead 暴露用于 OCR 的原生 OCR 引擎。判断是否合适的最佳方式,是用你自己的文档测试,并在同一次运行中与另一个模型对比输出。
在 ExactRead 上,AWS Textract 支持图片与 PDF。上传后,模型列表会根据文件实际兼容性过滤,因此不会启动无法运行的任务。
默认情况下,每次运行 AWS Textract 处理一份文档消耗 2 个额度。管理员可调整每个模型的额度成本,对比模式会按每个所选模型分别计费。