过程可见的 PDF 转文字 OCR
ExactRead 是一个 PDF 转文字 OCR 工作台:上传 PDF,它会把页面转换成可复核的文本,而不是一份黑盒下载文件。每次提取都会保留模型、状态、置信度、告警和结构化 JSON,让你在信任结果前看清它被推荐的原因。由于 PDF 版式各异——扫描页、导出报告、多栏合同——同一份 PDF 在不同引擎上的识别效果可能相差很大,ExactRead 会把这种差异集中呈现。
上传文档,在此直接对比模型,无需离开本页。
ExactRead 是一个 PDF 转文字 OCR 工作台:上传 PDF,它会把页面转换成可复核的文本,而不是一份黑盒下载文件。每次提取都会保留模型、状态、置信度、告警和结构化 JSON,让你在信任结果前看清它被推荐的原因。由于 PDF 版式各异——扫描页、导出报告、多栏合同——同一份 PDF 在不同引擎上的识别效果可能相差很大,ExactRead 会把这种差异集中呈现。
并非所有 OCR 模型都能读取 PDF。上传后,ExactRead 会把模型列表过滤为真正支持 PDF 类型的引擎,因此你不会启动无法运行的任务,也不会在不兼容的路由上浪费额度。Mistral OCR、PaddleOCR、AWS Textract、Google Cloud Vision 等原生 OCR 引擎可直接处理多页 PDF,通常无需在运行 PDF 转文字 OCR 前预先拆分或栅格化文件。
对于反复出现的 PDF 类型——发票、对账单、表单——选两三个支持 PDF 的模型,在对比模式下用同一文件运行。并排阅读输出,是判断哪个引擎更好地保留表格、标题和阅读顺序的唯一可靠方式。一旦某个路由持续胜出,就把它保存为偏好并复用于相似 PDF,或改用单模型以降低额度消耗。
已接受或推荐的结果可导出为纯 TXT 以便快速复用,或导出为结构化 JSON,保留全文、检测到的表格、文档类型、置信度和告警。这让 PDF 转文字 OCR 的输出可以直接进入复核队列、记账工具或内部自动化,而无需重新录入任何内容。
把PDF拖入工作台,或点击浏览选择。支持 PNG、JPEG、WebP 图片,以及供支持 PDF 的模型使用的 PDF。
上传后,模型列表会过滤为真正支持该文件的 OCR 引擎,因此你不会启动无法运行的任务。
需要速度和成本时选单模型,或用对比模式在同一PDF上一次运行多个 OCR 模型。
每个结果都会保留模型、状态、置信度和告警,并高亮推荐输出,让你快速判断准确度。
接受最忠实识别PDF的输出,然后复制它,或导出 TXT / JSON 用于下一步。
能力、格式支持和额度直接来自模型目录——是起点,不是排名。用你自己的文档实测再决定。
| 模型 | 提供方 | 类型 | 支持格式 | 额度 / 文档 |
|---|---|---|---|---|
| Mistral OCR | Mistral AI | 原生 OCR 引擎 | 图片与 PDF | 2 |
| PaddleOCR | Baidu PaddlePaddle | 原生 OCR 引擎 | 图片与 PDF | 1 |
| AWS Textract | AWS | 原生 OCR 引擎 | 图片与 PDF | 2 |
| Azure Document Intelligence | Microsoft Azure | 原生 OCR 引擎 | 图片与 PDF | 2 |
| Google Cloud Vision OCR | 原生 OCR 引擎 | 图片与 PDF | 2 | |
| MinerU | OpenDataLab | 原生 OCR 引擎 | 图片与 PDF | 1 |
支持格式
PDF,按模型兼容性过滤
模型建议
优先测试 Mistral OCR、PaddleOCR、Textract、Azure
额度说明
按每个 PDF 兼容模型运行计费
不能。ExactRead 会在上传后过滤模型列表,让支持 PDF 的引擎和仅支持图片的引擎在运行前就一目了然。只有支持 PDF 格式的模型才会作为选项出现。
可以。已接受或推荐的结果可导出为 TXT 或 JSON。JSON 会在纯文本之外保留全文、表格、文档类型、置信度和告警。
通常不需要。Mistral OCR、AWS Textract、Google Cloud Vision 等原生 OCR 引擎可直接读取多页 PDF。仅当某个模型因文件大小或页数拒绝时,才需要拆分。
每次模型运行按该模型每份文档的额度计费。单模型只收一次;对比模式会按每个所选模型分别计费。免费版每月包含 100 个 OCR 额度用于测试。
没有任何 OCR 能保证对每份扫描件都准确。ExactRead 会展示置信度、告警和多个模型的候选输出,帮助你发现错误,但重要 PDF 在使用前仍应人工复核。