在 Node.js 中解析 PDF 文本
Contents
[
Hide
]
从 PDF 文档解析文本
从 PDF 文档中解析文本是一项非常常见且有用的任务。 从 PDF 中提取文本有多种用途,包括提升搜索和可用性,以及在商业、研究和信息管理等各个领域实现数据分析和自动化。
如果您想从 PDF 文档中提取文本,您可以使用 AsposePdfExtractText 函数。 请检查以下代码片段,以使用 Node.js via C++ 提取 PDF 文件中的文本。
检查代码片段并按照步骤从 PDF 中提取文本:
CommonJS:
- 调用
require并导入asposepdfnodejs模块 作为AsposePdf变量。 - 指定要提取文本的 PDF 文件的名称。
- 调用
AsposePdf作为 Promise 并执行提取文本的操作。如果成功,接收对象。 - 调用函数 AsposePdfExtractText.
- 提取的文本存储在 JSON 对象中。因此,如果
json.errorCode为 0,则使用 console.log 显示提取的文本。如果json.errorCode参数不为 0,则文件中会出现错误,错误信息将包含在json.errorText中。
const AsposePdf = require('asposepdfnodejs');
const pdf_file = 'Aspose.pdf';
AsposePdf().then(AsposePdfModule => {
/*Extract text from a PDF-file*/
const json = AsposePdfModule.AsposePdfExtractText(pdf_file);
console.log("AsposePdfExtractText => %O", json.errorCode == 0 ? json.extractText : json.errorText);
});
ECMAScript/ES6:
- 导入
asposepdfnodejs模块。 - 指定要提取文本的 PDF 文件的名称。
- 初始化 AsposePdf 模块。如果成功,则接收对象。
- 调用函数 AsposePdfExtractText.
- 提取的文本存储在 JSON 对象中。因此,如果
json.errorCode为 0,则使用 console.log 显示提取的文本。如果json.errorCode参数不为 0,则文件中会出现错误,错误信息将包含在json.errorText中。
import AsposePdf from 'asposepdfnodejs';
const AsposePdfModule = await AsposePdf();
const pdf_file = 'Aspose.pdf';
/*Extract text from a PDF-file*/
const json = AsposePdfModule.AsposePdfExtractText(pdf_file);
console.log("AsposePdfExtractText => %O", json.errorCode == 0 ? json.extractText : json.errorText);