字号 ·· | 护眼
theregister

ABBYY让传统OCR在AI流程中发挥作用

ABBYY将其 FineReader OCR(光学字符识别)引擎封装成一个可自主部署的工具,用于将文档转换为结构化文本,以便人工智能系统能够使用这些文本。该公司新推出的 FineParser 可以在基于 CPU 的 Docker 容器中运行,无需使用 GPU。该工具在提取文档内容的同时,会保留文档的原有布局。它能够处理多种语言的文档图像,并将其转换为结构化、格式化的文本,从而便于使用现代的生成式人工智能(如大型语言模型,LLMs)进行处理。

这并非 FineParser 的唯一用途:该公司表示,该工具还可以帮助将纸质文档导入现代的内容管理系统(CMS),或用于文档归档,也可以作为生产流程中的一个环节。ABBYY 将 FineParser 的处理方式称为“确定性”人工智能(即该工具会精确地提取文档的文本和结构,而不会生成随意的、可能具有误导性的内容)。提取出的数据可以进一步传递给生成式人工智能系统进行处理;不过生成式人工智能的输出结果往往具有较高的不确定性。

ABBYY 还提供了自己开发的开源机器学习框架 NeoML,该框架可在 GitHub 上获取。该公司还为希望将 FineReader 引擎集成到自家产品中的企业提供了相应的 OCR 开发工具包(SDK)。需要注意的是,FineParser 本身并非开源软件,但 ABBYY 在 GitHub 上维护了一个用于示例代码和社区支持的仓库。该工具提供免费试用版本,允许用户在一年内每月处理 1,000 页文档。若需更高级的功能,用户需要购买订阅服务;完全离线部署则需要使用企业级(Enterprise)方案。

在处理文档时,FineParser 能够准确识别文档中的列、标题和表格(即使这些表格没有边框),而不会返回一堆杂乱无章的文本。此外,FineParser 还支持手写文本以及超过 200 种语言的识别。开发者可以通过 FineParser 的 REST API 提交文档,并以纯文本、JSON 或 DocLang(一种专为大型语言模型设计的紧凑格式)的形式接收处理结果。ABBYY 强调:在让大型语言模型使用文档之前,首先需要有一个工具能够正确地读取这些文档的内容。

ABBYY坚信,其多年来一直采用的OCR(光学字符识别)技术——该技术依赖CPU进行处理,同时保留文档的排版格式,并将文本生成的任务交给其他工具来完成——在人工智能处理流程中依然具有重要的价值。有时候,那些看似“过时”的技术方法,恰恰是最实用、最有效的解决方案。®