استخراج النص من PDF باستخدام Rust

استخراج النص من مستند PDF

استخراج النص من مستند PDF هو مهمة شائعة ومفيدة جداً. غالبًا ما تحتوي ملفات PDF على معلومات حيوية تحتاج إلى الوصول إليها، أو تحليلها، أو معالجتها لأغراض مختلفة. يتيح استخراج النص إعادة استخدام أسهل في قواعد البيانات، أو التقارير، أو مستندات أخرى.

يعمل استخراج النص على جعل محتوى PDF قابلاً للبحث، مما يسمح للمستخدمين بتحديد المعلومات المحددة بسرعة دون الحاجة إلى مراجعة المستند بأكمله يدويًا.

في حال رغبتك في استخراج النص من مستند PDF، يمكنك استخدام extract_text دالة. يرجى مراجعة مقتطف الشيفرة التالي لاستخراج النص من ملف PDF باستخدام Rust.

  1. افتح مستند PDF باستخدام اسم الملف المعطى.
  2. extract_text يستخلص محتوى النص من مستند PDF.
  3. اطبع النص المستخرج إلى وحدة التحكم.

    use asposepdf::Document;

    fn main() -> Result<(), Box<dyn std::error::Error>> {
        // Open a PDF-document with filename
        let pdf = Document::open("sample.pdf")?;

        // Return the PDF-document contents as plain text
        let txt = pdf.extract_text()?;

        // Print extracted text
        println!("Extracted text:\n{}", txt);

        Ok(())
    }