BookTranslator
BookTranslator

תרגום קובץ PDF סרוק: בעיות OCR ופתרונות מעשיים

למדו כיצד לבצע OCR ולתרגם קובצי PDF סרוקים, לאבחן כשלי זיהוי נפוצים ולשמור על העיצוב באמצעות זרימת עבודה מודעת-מסמכים.

BookTranslator

BookTranslator Team

9 min read

תשובה מהירה: קובץ PDF סרוק דורש OCR לפני תרגום

כדי לתרגם קובץ PDF סרוק, יש להריץ תחילה OCR כדי להפוך את תמונות העמודים לטקסט ניתן לבחירה. לאחר מכן, תרגמו את קובץ ה-PDF שעבר עיבוד OCR באמצעות כלי תרגום מסמכים כגון PDF Translator. אם תדלגו על שלב ה-OCR, כלי תרגום רבים יחזירו את הקובץ המקורי ללא שינוי, יפספסו עמודים או יתרגמו רק את החלקים שכבר מכילים שכבת טקסט.

השתמשו בזרימת העבודה הבאה:

  1. פתחו את קובץ ה-PDF ונסו לבח אי משפט.
  2. אם אינכם מצליחים לבחור טקסט, הפעילו OCR.
  3. סקרו את טקסט ה-OCR לפני תרגום.
  4. העלו את קובץ ה-PDF שעבר OCR אל PDF Translator.
  5. סקרו את הפלט המתורגם מול הסריקה המקורית.

אם קובץ ה-PDF שלכם כבר מכיל טקסט ניתן לבחירה והבעיה היא שמירת העיצוב, השתמשו במדריך ל-תרגום קובץ PDF ללא איבוד עיצוב.

מדוע קובצי PDF סרוקים נכשלים בכלי תרגום

קובץ PDF סרוק הוא לעתים קרובות רק אוסף של תמונות עמודים בתוך מעטפת PDF. העמוד עשוי להציג מילים לבני אדם, אך הקובץ עשוי שלא להכיל טקסט אמיתי שתכנה יכולה לחלץ.

זה יוצר תקלה פשוטה:

סוג קובץמה שהמתרגם רואהמה קורה
PDF מבוסס טקסטטקסט בתוספת נתוני עיצובהתרגום יכול להתחיל מיד.
PDF סרוק מבוסס-תמונה בלבדתמונות של עמודיםנדרש OCR תחילה.
PDF טקסט-מעל-תמונהתמונת סריקה בתוספת שכבת טקסט OCR מוסתרתהתרגום יכול לעבוד, אך שגיאות OCR משפיעות על האיכות.

הבדיקה השימושית ביותר אינה טכנית:

  1. פתחו את קובץ ה-PDF.
  2. נסו לסמן מילים בודדות.
  3. העתיקו משפט.
  4. הדביקו אותו בעורך טקסט.

אם המשפט נדבק כהלכה, לקובץ ה-PDF יש שכבת טקסט. אם שום דבר לא נדבק, או שכל העמוד מתנהג כתמונה אחת, קובץ ה-PDF זקוק ל-OCR.

OCR אינו רשות

OCR פירושו זיהוי תווים אופטי (Optical Character Recognition). הוא קורא טקסט מתמונה ויוצר טקסט הניתן לקריאה על ידי מכונה. עבור תרגום PDF, OCR בדרך כלל יוצר שכבת טקסט בלתי נראית מעל העמוד הסרוק.

שכבת טקסט זו הופכת למקור לתרגום. אם OCR עושה שגיאות, התרגום יורש את השגיאות הללו.

שגיאות OCR נפוצות:

שגיאת OCRסיכון לתרגום
rn נקרא כ-mמשמעות המילים משתנה.
1 נקרא כ-lמספרים, הפניות או קודים הופכים שגויים.
O נקרא כ-0מזהים, נוסחאות ושמות עלולים להינזק.
סימני ניקוד/דיאקריטיקה הושטושמות ומונחים הופכים ללא מדויקים.
עמודות מוזגומשפטים מתורגמים בסדר הלא נכון.
תאי טבלה נקראו שורה אחר שורה בצורה שגויהתוויות הנתונים אינן תואמות עוד את הערכים.
הערות שוליים טופלו כטקסט גוףציטוטים והערות עוברים להקשר השגוי.

זו הסיבה ששלב סקירת ה-OCR חשוב. אל תתרגמו מסמך סרוק עד שבדקתם מדגמית את הטקסט שחולץ.

זרימת העבודה של OCR-תחילה

שלב 1: זיהוי סוג ה-PDF

נסו לבחור טקסט. אם הבחירה עובדת, ייתכן שאינכם זקוקים ל-OCR. אם הבחירה נכשלת, התייחסו לקובץ כמבוסס-תמונה בלבד.

בחנו גם את העמוד ויזואלית:

  • עמודים עקומים מעידים על סריקה.
  • מרקם נייר אפור מעיד על סריקה.
  • צללים ליד הכריכה מעידים על ספר שצולם.
  • ניגודיות לא אחידה מעידה על צילום מסמך (פוטוסטאט).
  • חיפוש שאינו מוצא מילים גלויות מעיד על היעדר שכבת טקסט.

שלב 2: שיפור הסריקה במידת האפשר

איכות ה-OCR מתחילה באיכות התמונה. אם אתם יכולים לסרוק מחדש, עשו זאת לפני שתשקיעו זמן בתיקון שגיאות OCR.

השתמשו ברשימת התმოכות הזו לאיכות תמונה:

  • סרוקו ברזולוציה גבוהה דיה לטקסט קטן.
  • שמרו על עמודים שטוחים וישרים.
  • הימנעו מצללים ליד הכריכה.
  • חתכו קצוות טבלאות, אצבעות או הסחות דעת ברקע.
  • השתמשו בניגודיות חזקה בין הטקסט לדף.
  • שמרו על כל השורה גלויה.
  • השתמשו בכיוון העמוד הנכון.
  • אל תדחסו את התמונה בחוזקה רבה מדי עד כדי טשטוש אותיות.

עבור ספרים ישנים וצילומי מסמכים, הרווחים הגדולים ביותר מגיעים בדרך כלל מיישור, תיקון ניגודיות וסריקה מחדש של עמודים שאינם ממוקדים.

שלב 3: הפעלת OCR

בחרו כלי OCR בהתאם לקושי המסמך, ולא לפי המותג.

אפשרות OCRהטוב ביותר עבורלמה לשים לב
Adobe Acrobat OCRסריקות עסקיות כלליות וניקוי PDFבדקו את הגישה לתוכנית הנוכחית לפני ההסתמכות עליה.
ABBYY FineReaderסריקות מורכבות, טבלאות, עמודות ועיצובים קשיםעדיין דורש סקירה ידנית.
Tesseract או OCRmyPDFתהליכי עבודה מקומיים, טכניים וניתנים לחזרה של OCRדורש נוחות עם כלי שורת הפקודה.
כלי OCR מקווניםקבצים מזדמנים בסיכון נמוךפרטיות, מגבלות קבצים ואיכות משתנים.
אפליקציות סריקה לטלפוןלכידת סריקה חדשה במהירותעיוות פרספקטיבי עלול לפגוע ב-OCR.

עבור חוזים פרטיים, רשומות רפואיות, מסמכים פיננסיים, כתבי יד שלא פורסמו או עבודה אקדמית תחת ביקורת, העדיפו זרימת עבודה מקומית של OCR או סביבה מהימנה. אל תעלו סריקות רגישות לאתרי OCR חינמיים אקראיים.

שלב 4: סקירת טקסט ה-OCR

סקרו לפני התרגום, לא לאחריו. העתיקו טקסט מכמה עמודים קשים ובדקו האם הוא קריא.

עמודים לדוגמה שכדאי לבדוק:

  • עמוד השער.
  • עמוד גוף צפוף.
  • עמוד טבלה.
  • עמוד עם הערות שוליים.
  • עמוד עם טקסט קטן.
  • עמוד עם חותמות, כתב יד או הערות שוליים.
  • עמוד בכל שפה אם המסמך רב-לשוני.

חפשו:

  • פסקה חסרות.
  • עמודות ממוזגות.
  • מילים שבורות.
  • תווים שגויים.
  • סימני דיאקריטיקה שאבדו.
  • תוויות טבלה המופרדות מהערכים שלהן.
  • כותרות עליונות שהוכנסו לתוך טקסט הגוף.
  • מספרי עמודים המעורבבים במשפטים.

אם איכות ה-OCR גרועה, תקנו אותה לפני התרגום. מתרגם אינו יכול לשחזר באופן מהימן משמעות ש-OCR מעולם לא לכיד.

שלב 5: תרגום קובץ ה-PDF שעבר OCR

ברגע שלקובץ ה-PDF יש שכבת טקסט נקי, העלו אותו אל PDF Translator. שלב התרגום יכול כעת לעבוד עם טקסט במקום עם תמונות עמוד.

לאחר התרגום, השוו בין:

  • הסריקה המקורית
  • שכבת טקסט ה-OCR
  • ה-PDF המתורגם

סקירה משולשת זו עוזרת לכם לזהות האם השגיאה מקורה ב-OCR או בתרגום. אם טקסט ה-OCR שגוי, הרצו מחדש OCR. אם טקסט ה-OCR נכון אך התרגום שגוי, תקנו את התרגום.

שלב 6: סקירת תוכן בסיכון גבוה

מסמכים סרוקים מכילים לעתים קרובות בדיוק את התוכן שדורש סקירה מדוקדקת: חוזים ישנים, טפסים ממשלתיים, מאמרים אקדמיים, מדריכים, מסמכים היסטוריים ועמודי ספרים.

סקרו פריטים אלו באופן ידני:

  • שמות
  • תאריכים
  • מספרים
  • כתובות
  • קודי מוצר
  • הפניות משפטיות
  • ציטוטים
  • תוויות טבלה
  • יחידות מידה
  • נוסחאות
  • כתוביות
  • הערות שוליים

לקבצי מחקר ואקדמיה, קראו גם את המדריך ל-תרגום מאמרי מחקר אקדמיים, מכיוון שקובצי PDF אקדמיים סרוקים מוסיפים סיכוני ציטוט ועיצוב מעבר לסיכון ה-OCR.

דוגמאות לכשלים מוצגות זה לצד זה

השתמשו בטבלה זו בעת סקירת פלט ה-OCR.

סריקה מקורית מציגה כנראהפלט OCR שגוימדוע זה חשוב
modernmodemהמשמעות משתנה לחלוטין.
Section 10Section IOהפניות משפטיות או טכניות עלולות להינזק.
20262O26תאריכים ומזהים הופכים ללא מהימנים.
patientpatlentמונחים רפואיים או טכניים הופכים שגויים.
שתי עמודות נפרדותפסקה אחת ממוזגתהתרגום קורא משפטים בסדר הלא נכון.
שורת טבלה עם תוויות וערכיםשורה בודדת של טקסט מעורבהנתונים אינם מתאימים עוד לתווית הנכונה.
סמן הערת שוליים 1אות lהערות עשויצות להיות מוצמדות למשפט הלא נכון.

אם אתם רואים שגיאות אלו בשכבת ה-OCR, תקנו את ה-OCR לפני התרגום.

באיזה כלי עליכם להשתמש?

בחרו לפי קושי המסמך.

מסמךנתיב מומלץ
סריקה עסקית נקיOCR ב-Acrobat או בכלי OCR אמין אחר, ואז PDF Translator.
סריקת ספר ישןיישור ושיפור ניגודיות, ביצוע OCR בזהירות, ואז תרגום.
סריקת מאמר אקדמיביצוע OCR, סקירת נוסחאות/ציטוטים/טבלאות, ואז תרגום עם סקירת עיצוב.
הערות בכתב ידייתכן שתידרש תמלול ידני לפני התרגום.
מסמך אישי פשוטOCR מקוון עשוי להיות מקובל אם סיכון הפרטיות נמוך.
מסמך רגישהשתמשו ב-OCR מקומי או בזרימת עבודה מבוקרת ומהימנה.

אם אתם מעוניינים בהשוואת כלים רחבה יותר, ראו את המדריך למתרגם ה-PDF הטוב ביותר.

בעיות נפוצות בקובצי PDF סרוקים

עמודים ברזולוציה נמוכה

סריקות ברזולוציה נמוכה מטשטשות אותיות זו לזו. OCR עלול לבלבל בין rn ל-m, cl ל-d, או בין סימני פיסוק לאבק.

תיקון: סרוקו מחדש אם אפשר. אם לא, הגדילו את הניגודיות ונסו שוב OCR.

עמודים עקומים או מעוקלים

סריקות של ספרים מתעקלות לעתים קרובות ליד הכריכה. OCR קורא את השורות המעוקלות בצורה גרועה ועשוי לסדר מחדש את הטקסט.

תיקון: שטחו את העמוד, סרוקו מחדש, או השתמשו בכלי OCR הכולל יישור והסרת עיוותים.

פריסת רב-עמודות

OCR יכול למזג עמודות שמאליות וימניות לזרם משפטים אחד.

תיקון: בחנו את סדר הקריאה לפני התרגום. מאמרים אקדמיים דורשים תשומת לב מיוחדת כאן.

טבלאות

טבלאות קשות מכיוון ש-OCR צריך לזהות הן טקסט והן מבנה. טבלה עשויה להיראות נכון ויזואלית בזמן ששכבת הטקסט שגויה.

תיקון: העתיקו את טקסט ה-OCR מהטבלה וודאו שהתוויות עדיין תואמות לערכים.

כתב יד וחתימות

OCR של טקסט מודפס אמין הרבה יותר מזיהוי כתב יד. הערות שוליים בכתב יד, חתימות וטפסים ממולאים עלולים להיות מפוספסים או משובשים.

תיקון: תמללו באופן ידני כתב יד חיוני לפני התרגום.

שפות מעורבות

OCR עובד בצורה הטובה ביותר כאשר הוא מכיר את שפת המקור. סריקה עם אנגלית, צרפתית וסינית עלולה להיכשל אם ה-OCR מוגדר לשפה אחת בלבד.

תיקון: בחרו את כל שפות ה-OCR הרלוונטיות אם הכלי תומך בכך, ואז בדקו מדגמית כל מקטע שפה.

רשימת בדיקה לפרטיות ואבטחה

לפני העלאת קובץ PDF סרוק לכל מקום, שאלו:

  • האם המסמך מכיל נתונים אישיים?
  • האם הוא כולל חומר רפואי, משפטי, פיננסי, אקדמי או כזה שלא פורסם?
  • האם הוא מכוסה בהסכם לקוח או במדיניות בית ספר?
  • האם שירות OCR מקוון מותר עבור מסמך זה?
  • האם אתם זקוקים לזרימת עבודה מקומית במקום?
  • האם אתם יכולים להסיר עמודים שאינם זקוקים לתרגום?

קובצי PDF סרוקים הם לעתים קרובות רגישים מכיוון שהם מגיעים מחוזקים, תעודות זהות, טפסים, טיוטות מחקר וארכיונים פנימיים. התייחסו להחלטות העלאה ל-OCR באותו אופן שבו הייתם מתייחסים למסמך המקורי.

פוסטים קשורים