Извлечь текст из PDF с использованием Rust

Извлеките текст из PDF‑документа

Извлечение текста из PDF‑документа — очень распространённая и полезная задача. PDF‑файлы часто содержат критически важную информацию, к которой необходимо получить доступ, проанализировать её или обработать для различных целей. Извлечение текста упрощает повторное использование в базах данных, отчётах или других документах.

Извлечение текста делает содержимое PDF доступным для поиска, позволяя пользователям быстро находить конкретную информацию без необходимости вручную просматривать весь документ.

Если вам нужно извлечь текст из PDF‑документа, вы можете использовать extract_text функцию. Пожалуйста, ознакомьтесь со следующим фрагментом кода, чтобы извлечь текст из PDF‑файла с помощью Rust.

  1. Откройте PDF‑документ с указанным именем файла.
  2. Извлеките текстовое содержимое из PDF‑документа с помощью extract_text.
  3. Выведите извлечённый текст в консоль.

    use asposepdf::Document;

    fn main() -> Result<(), Box<dyn std::error::Error>> {
        // Open a PDF-document with filename
        let pdf = Document::open("sample.pdf")?;

        // Return the PDF-document contents as plain text
        let txt = pdf.extract_text()?;

        // Print extracted text
        println!("Extracted text:\n{}", txt);

        Ok(())
    }