أداة إنشاء PDF قابل للبحث

اختر ملف PDF ممسوحًا ضوئيًا

PDF فقط · 10 MB

PDF فقط، بحد أقصى 10 ميغابايت و10 صفحات

ملف PDF الممسوح ضوئياً هو في الواقع مجرد كومة من الصور داخل حاوية PDF، لذا لا يمكنك تظليل النص أو نسخه أو البحث فيه. تجري هذه الأداة التعرف الضوئي على الحروف (OCR) على كل صفحة داخل متصفحك، وتدمج النتيجة كطبقة نص غير مرئية بمحاذاة الصفحة الأصلية. يبقى مظهر الصفحة الأصلي في مكانه، بينما يتيح Ctrl+F وتحديد النص استخدام الكلمات التي تعرَّف عليها المحرك. قد يخطئ التعرّف، وهذا الناتج ليس ملف PDF مهيأ بعلامات لإتاحة الوصول، لذا راجع النصوص المهمة مقابل المسح الأصلي.

كيف تُجري OCR على ملف PDF ممسوح ضوئياً

  1. 1

    ارفع الملف الممسوح ضوئياً

    اسحب ملف PDF ممسوحاً ضوئياً (عقود، فواتير، تقارير مؤرشفة). النص المطبوع يعمل بشكل أفضل؛ الكتابة اليدوية لا تعمل.

  2. 2

    اختر اللغة

    اختر لغة المستند (الإنجليزية أو الإسبانية أو الفرنسية أو الألمانية أو الإيطالية أو البرتغالية أو الهولندية) كي يحمّل محرك OCR نموذج الحروف الصحيح.

  3. 3

    شغّل التعرف

    تُعرَض كل صفحة بدقة عالية داخل متصفحك وتُمرَّر إلى محرك OCR. قد تستغرق المستندات الطويلة بضع دقائق.

  4. 4

    دمج طبقة النص

    تُوضع الكلمات المتعرَّف عليها كطبقة غير مرئية بمحاذاة الصفحة الأصلية، فيبقى مظهر كل صفحة دون تغيير.

  5. 5

    نزّل ملف PDF الجديد

    احصل على ملف PDF يحتفظ بالمسح الأصلي وصار قابلاً للبحث في أي قارئ حديث.

متى يعمل OCR جيداً (ومتى لا يعمل)

تعتمد جودة OCR على جودة المسح. قارن دائماً الأسماء المهمة والأرقام والصياغة القانونية بالصفحة الأصلية.

المُدخل ما يمكن توقعه
مسح طباعة نظيف نتائج جيدة غالباً، مع تدقيق النص المهم.
صورة لصفحة مطبوعة تعتمد النتيجة على التركيز والإضاءة وزاوية الصفحة.
كتاب قديم أو طباعة آلة كاتبة باهتة راجع النص المتعرَّف عليه بعناية.
كتابة يدوية أو خط متصل غير مدعومة بصورة موثوقة.
إيصالات أو مخرجات طابعة حرارية راجع الأرقام والحروف الباهتة بعناية.
تداخل قوي من الخلفية قد تكون النتائج ناقصة أو غير دقيقة.

PDF قابل للبحث مقابل PDF صور فقط

  • PDF صور فقط: صور نقطية خالصة، بلا نص. هذا ما يُنتجه ماسحك افتراضياً.
  • PDF قابل للبحث: صور نقطية مع طبقة نص غير مرئية (ما تُخرجه هذه الأداة). المظهر متطابق، ويعمل Ctrl+F.
  • PDF/A: مجموعة فرعية أرشيفية من PDF تُضمِّن خطوطها وتمنع الموارد الخارجية، وكثيراً ما تطلبها المحاكم والأرشيفات. تُخرج هذه الأداة PDF قابلاً للبحث عادياً، وليس PDF/A معتمداً؛ حوّله وتحقق منه بأداة PDF/A مخصصة إذا كان سير عملك يتطلب ذلك.

نصائح لأفضل النتائج

  • ابدأ بدقة تقارب 300 DPI. تكون غالباً توازناً مناسباً بين وضوح التفاصيل ووقت المعالجة. الدقة الأعلى تستهلك وقتاً وذاكرة أكثر.
  • قوّم الميل قبل OCR. توفّر معظم الماسحات تدويراً تلقائياً؛ حتى الميل البسيط قد يقلل جودة التعرّف.
  • لغة واحدة في كل تشغيل. يتعرّف المحرك على لغة واحدة في المرة، فاختر اللغة السائدة. وللمستند ثنائي اللغة، شغّله مرة لكل لغة واحتفظ بالنتيجة الأفضل.
  • احتفظ دائماً بالأصل. يُدخل OCR أخطاء صغيرة؛ والطبقة غير المرئية وسيلة راحة، لا دليلاً.

الأسئلة الشائعة

يُحفظ محتوى الصفحة الأصلي. يُضاف النص المتعرَّف عليه كطبقة غير مرئية بمحاذاته، لذا يُفترض أن يبقى مظهر الصفحة دون تغيير. راجع النتيجة إذا كانت المطابقة البصرية الدقيقة مهمة.

سبع لغات بالأبجدية اللاتينية: الإنجليزية والإسبانية والفرنسية والألمانية والإيطالية والبرتغالية والهولندية. اختر ما يطابق مستندك. أما الكتابات مثل السيريلية والعربية وCJK (الصينية واليابانية والكورية) فهي غير متاحة في هذه الأداة.

ليس بصورة موثوقة. هذه الأداة مخصصة للنص المطبوع. التعرّف على الكتابة اليدوية تقنية مختلفة، لذا راجع المواد المكتوبة بخط اليد أو انسخها يدوياً بشكل منفصل.

لا. الناتج ملف PDF قابل للبحث عادي: صور صفحاتك الأصلية مع طبقة نص OCR غير مرئية. وهو ليس ملف PDF/A معتمداً للأرشفة. إذا كان سير عملك يتطلب PDF/A، فحوّل الناتج وتحقق منه بأداة PDF/A مخصصة.

يعمل OCR بالكامل داخل متصفحك، لذا لا يُرسل ملف PDF المصدر إلى خادم لأجل التعرّف. يبقى التنزيل المحلي العادي على جهازك. لا يُرفع ملف PDF النهائي القابل للبحث إلى خادمنا إلا إذا اخترت إنشاء صفحة تنزيل؛ يبقى ملف المصدر محلياً، وتُحتفَظ بالنتيجة المرفوعة مدة تصل إلى 7 أيام.

أدوات ذات صلة