Rust を使用して PDF からテキストを抽出する

PDF ドキュメントからテキストを抽出する

PDFドキュメントからテキストを抽出することは、非常に一般的で有用な作業です。PDFには、さまざまな目的でアクセス、分析、または処理が必要な重要な情報が含まれていることがよくあります。テキストを抽出することで、データベース、レポート、その他のドキュメントへの再利用が容易になります。

テキストを抽出すると、PDFのコンテンツが検索可能になり、ユーザーは文書全体を手動で確認することなく、特定の情報を迅速に見つけることができます。

PDFドキュメントからテキストを抽出したい場合は、次のものを使用できます extract_text 関数。 Rustを使用してPDFファイルからテキストを抽出するためのコードスニペットをご確認ください。

  1. 指定されたファイル名で PDF ドキュメントを開きます。
  2. extract_text PDF ドキュメントからテキストコンテンツを抽出します。
  3. 抽出したテキストをコンソールに出力します。

    use asposepdf::Document;

    fn main() -> Result<(), Box<dyn std::error::Error>> {
        // Open a PDF-document with filename
        let pdf = Document::open("sample.pdf")?;

        // Return the PDF-document contents as plain text
        let txt = pdf.extract_text()?;

        // Print extracted text
        println!("Extracted text:\n{}", txt);

        Ok(())
    }