Node.js에서 PDF 텍스트 추출
Contents
[
Hide
]
PDF 문서의 모든 페이지에서 텍스트 추출
PDF에서 텍스트를 추출하는 것은 쉽지 않습니다. 일부 PDF 리더만 PDF 이미지나 스캔된 PDF에서 텍스트를 추출할 수 있습니다. 하지만 Aspose.PDF for Node.js via C++ 도구를 사용하면 Node.js 환경에서 모든 PDF 파일의 텍스트를 쉽게 추출할 수 있습니다.
이 코드는 AsposePDFforNode.js 모듈을 사용하여 지정된 PDF 파일에서 텍스트를 추출하고, 추출된 텍스트 또는 발생한 오류를 로그에 기록하는 방법을 보여줍니다.
코드 스니펫을 확인하고 PDF에서 텍스트를 추출하는 절차를 따르세요:
CommonJS:
- 호출
require그리고 가져오기asposepdfnodejs모듈로AsposePdf변수. - 텍스트를 추출할 PDF 파일의 이름을 지정하세요.
- 호출
AsposePdfPromise와 같이 텍스트를 추출하는 작업을 수행합니다. 성공하면 객체를 받습니다. - 함수를 호출합니다. AsposePdfExtractText.
- 추출된 텍스트는 JSON 객체에 저장됩니다. 따라서 ‘json.errorCode’가 0이면 console.log를 사용하여 추출된 텍스트가 표시됩니다. json.errorCode 매개변수가 0이 아니고 파일에 오류가 발생하면 오류 정보가 ‘json.errorText’에 포함됩니다.
const AsposePdf = require('asposepdfnodejs');
const pdf_file = 'Aspose.pdf';
AsposePdf().then(AsposePdfModule => {
/*Extract text from a PDF-file*/
const json = AsposePdfModule.AsposePdfExtractText(pdf_file);
console.log("AsposePdfExtractText => %O", json.errorCode == 0 ? json.extractText : json.errorText);
});
ECMAScript/ES6:
- 가져오기
asposepdfnodejs모듈. - 텍스트를 추출할 PDF 파일의 이름을 지정하세요.
- AsposePdf 모듈을 초기화합니다. 성공하면 객체를 받습니다.
- 함수를 호출합니다. AsposePdfExtractText.
- 추출된 텍스트는 JSON 객체에 저장됩니다. 따라서 ‘json.errorCode’가 0이면 console.log를 사용하여 추출된 텍스트가 표시됩니다. json.errorCode 매개변수가 0이 아니고 파일에 오류가 발생하면 오류 정보가 ‘json.errorText’에 포함됩니다.
import AsposePdf from 'asposepdfnodejs';
const AsposePdfModule = await AsposePdf();
const pdf_file = 'Aspose.pdf';
/*Extract text from a PDF-file*/
const json = AsposePdfModule.AsposePdfExtractText(pdf_file);
console.log("AsposePdfExtractText => %O", json.errorCode == 0 ? json.extractText : json.errorText);