Jak rozpoznać tekst w zeskanowanym PDF?
- 1.
Wczytaj PDF
Przeciągnij plik na pole lub wybierz go z urządzenia. Jeśli dokument jest chroniony hasłem, wpisz je - hasło nie opuszcza Twojego komputera.
- 2.
Ustaw języki i zakres
Zaznacz języki dokumentu (domyślnie polski i angielski) i opcjonalnie wpisz zakres stron, np. „1-3, 5”.
- 3.
Uruchom OCR
Kliknij „Rozpoznaj tekst”. Przy pierwszym użyciu pobierany jest silnik OCR i dane języków (ok. 7 MB). Każda strona A4 zajmuje zwykle 3-10 sekund; możesz przerwać w dowolnej chwili.
- 4.
Pobierz wynik
Skopiuj tekst, pobierz go jako .txt albo pobierz przeszukiwalny PDF - oryginalne strony z niewidoczną warstwą tekstu.
Skan PDF a PDF z tekstem - jak sprawdzić?
Spróbuj zaznaczyć fragment tekstu w przeglądarce PDF. Jeśli się da - plik ma warstwę tekstową i OCR nie jest potrzebny: tekst wyciągniesz szybciej i bez błędów narzędziem PDF na tekst. Jeśli zaznacza się cała strona jak obrazek - to skan i potrzebne jest rozpoznawanie znaków (OCR). Narzędzie samo sprawdza do 5 stron i ostrzega, gdy dokument ma już tekst.
Jak działa OCR PDF w przeglądarce?
Każda wybrana strona jest renderowana do obrazu w rozdzielczości 300 DPI (strona A4 to ok. 2480 × 3508 px), a następnie rozpoznawana silnikiem Tesseract (licencja Apache-2.0) z siecią neuronową LSTM dla wybranych języków. Polskie litery - ą, ć, ę, ł, ń, ó, ś, ź, ż - są rozpoznawane, gdy zaznaczony jest język polski.
Plik nie jest wysyłany na serwer. Z internetu (CDN jsDelivr) pobierany jest tylko silnik OCR (ok. 1,4 MB) oraz dane języków: polski ok. 2,6 MB, angielski ok. 2,9 MB, niemiecki ok. 1,3 MB, ukraiński ok. 2,1 MB - jednorazowo, potem z pamięci przeglądarki.
Przeszukiwalny PDF - co to jest?
Przeszukiwalny PDF (ang. searchable PDF) wygląda dokładnie jak oryginalny skan, ale pod obrazem ma niewidoczną warstwę tekstu ułożoną w miejscach rozpoznanych słów. Dzięki temu w dokumencie działa wyszukiwanie (Ctrl+F), można zaznaczać i kopiować tekst, a systemy archiwizacji i wyszukiwarki indeksują jego treść. Wygląd stron i jakość skanu pozostają bez zmian, a plik zwykle rośnie tylko o kilkadziesiąt KB na stronę.
Opcja jest niedostępna dla plików chronionych hasłem - takie dokumenty da się odczytać i rozpoznać, ale nie zapisać ponownie w przeglądarce.
Ile trwa OCR i jak poprawić wynik?
| Dokument | Orientacyjny czas |
|---|---|
| 1 strona A4 | 3-10 s |
| 10 stron | ok. 1-2 min |
| 50 stron | ok. 5-8 min |
Czas zależy od komputera i liczby języków. Dla długich dokumentów wybierz zakres stron. Najlepsze wyniki dają skany 300 DPI, proste (bez przekrzywienia) i kontrastowe. Przy wyblakłym druku włącz „Popraw obraz”. Pewność poniżej 60% oznacza, że tekst wymaga dokładnej korekty. Pojedyncze zdjęcia i zrzuty ekranu rozpoznasz w narzędziu Tekst ze zdjęcia.
Najczęściej zadawane pytania
Czy OCR PDF jest darmowy?
+
Czy mój dokument jest wysyłany na serwer?
+
Czy mogę rozpoznać PDF zabezpieczony hasłem?
+
Jak zrobić przeszukiwalny PDF ze skanu?
+
Czy OCR rozpoznaje polskie znaki?
+
Co zrobić, gdy PDF ma już tekst?
+
Aktualizacja: