Extraire du texte d'un PDF avec Rust

Extraire du texte d’un document PDF

L’extraction de texte à partir du document PDF est une tâche très courante et utile. Les PDF contiennent souvent des informations critiques qui doivent être accessibles, analysées ou traitées à diverses fins.

L’extraction de texte rend le contenu PDF recherchable, permettant aux utilisateurs de localiser rapidement des informations spécifiques sans parcourir manuellement l’ensemble du document.

Dans le cas où vous souhaitez extraire du texte d’un document PDF, vous pouvez utiliser extract_text fonction. Veuillez consulter le fragment de code suivant afin d’extraire du texte d’un fichier PDF en utilisant Rust.

  1. Ouvrez un document PDF avec le nom de fichier fourni.
  2. extract_text extrait le contenu texte du document PDF.
  3. Affichez le texte extrait dans la console.

    use asposepdf::Document;

    fn main() -> Result<(), Box<dyn std::error::Error>> {
        // Open a PDF-document with filename
        let pdf = Document::open("sample.pdf")?;

        // Return the PDF-document contents as plain text
        let txt = pdf.extract_text()?;

        // Print extracted text
        println!("Extracted text:\n{}", txt);

        Ok(())
    }