Извлечь текст из PDF с использованием Rust
Contents
[
Hide
]
Извлеките текст из PDF‑документа
Извлечение текста из PDF‑документа — очень распространённая и полезная задача. PDF‑файлы часто содержат критически важную информацию, к которой необходимо получить доступ, проанализировать её или обработать для различных целей. Извлечение текста упрощает повторное использование в базах данных, отчётах или других документах.
Извлечение текста делает содержимое PDF доступным для поиска, позволяя пользователям быстро находить конкретную информацию без необходимости вручную просматривать весь документ.
Если вам нужно извлечь текст из PDF‑документа, вы можете использовать extract_text функцию. Пожалуйста, ознакомьтесь со следующим фрагментом кода, чтобы извлечь текст из PDF‑файла с помощью Rust.
- Откройте PDF‑документ с указанным именем файла.
- Извлеките текстовое содержимое из PDF‑документа с помощью extract_text.
- Выведите извлечённый текст в консоль.
use asposepdf::Document;
fn main() -> Result<(), Box<dyn std::error::Error>> {
// Open a PDF-document with filename
let pdf = Document::open("sample.pdf")?;
// Return the PDF-document contents as plain text
let txt = pdf.extract_text()?;
// Print extracted text
println!("Extracted text:\n{}", txt);
Ok(())
}