Przejdź do treści
HNarzędzia
pl
Kategorie

OCR PDF online - rozpoznaj tekst ze skanu PDF

Wczytaj zeskanowany dokument PDF, a narzędzie rozpozna tekst na każdej stronie (OCR). Wynik skopiujesz, pobierzesz jako .txt albo jako przeszukiwalny PDF z niewidoczną warstwą tekstu - wszystko dzieje się w Twojej przeglądarce.

  • Za darmo
  • Bez rejestracji
  • Prywatne
  • Działa lokalnie

Przeciągnij i upuść pliki tutaj

lub kliknij, aby wybrać z urządzenia

Zeskanowany plik PDF · także z hasłem · przetwarzanie lokalnie w przeglądarce

Plik nie jest nigdzie wysyłany - strony renderuje i rozpoznaje Twoja przeglądarka. Z internetu (CDN jsDelivr) pobierany jest tylko silnik OCR i dane wybranych języków.

Jak rozpoznać tekst w zeskanowanym PDF?

  1. 1.

    Wczytaj PDF

    Przeciągnij plik na pole lub wybierz go z urządzenia. Jeśli dokument jest chroniony hasłem, wpisz je - hasło nie opuszcza Twojego komputera.

  2. 2.

    Ustaw języki i zakres

    Zaznacz języki dokumentu (domyślnie polski i angielski) i opcjonalnie wpisz zakres stron, np. „1-3, 5”.

  3. 3.

    Uruchom OCR

    Kliknij „Rozpoznaj tekst”. Przy pierwszym użyciu pobierany jest silnik OCR i dane języków (ok. 7 MB). Każda strona A4 zajmuje zwykle 3-10 sekund; możesz przerwać w dowolnej chwili.

  4. 4.

    Pobierz wynik

    Skopiuj tekst, pobierz go jako .txt albo pobierz przeszukiwalny PDF - oryginalne strony z niewidoczną warstwą tekstu.

Skan PDF a PDF z tekstem - jak sprawdzić?

Spróbuj zaznaczyć fragment tekstu w przeglądarce PDF. Jeśli się da - plik ma warstwę tekstową i OCR nie jest potrzebny: tekst wyciągniesz szybciej i bez błędów narzędziem PDF na tekst. Jeśli zaznacza się cała strona jak obrazek - to skan i potrzebne jest rozpoznawanie znaków (OCR). Narzędzie samo sprawdza do 5 stron i ostrzega, gdy dokument ma już tekst.

Jak działa OCR PDF w przeglądarce?

Każda wybrana strona jest renderowana do obrazu w rozdzielczości 300 DPI (strona A4 to ok. 2480 × 3508 px), a następnie rozpoznawana silnikiem Tesseract (licencja Apache-2.0) z siecią neuronową LSTM dla wybranych języków. Polskie litery - ą, ć, ę, ł, ń, ó, ś, ź, ż - są rozpoznawane, gdy zaznaczony jest język polski.

Plik nie jest wysyłany na serwer. Z internetu (CDN jsDelivr) pobierany jest tylko silnik OCR (ok. 1,4 MB) oraz dane języków: polski ok. 2,6 MB, angielski ok. 2,9 MB, niemiecki ok. 1,3 MB, ukraiński ok. 2,1 MB - jednorazowo, potem z pamięci przeglądarki.

Przeszukiwalny PDF - co to jest?

Przeszukiwalny PDF (ang. searchable PDF) wygląda dokładnie jak oryginalny skan, ale pod obrazem ma niewidoczną warstwę tekstu ułożoną w miejscach rozpoznanych słów. Dzięki temu w dokumencie działa wyszukiwanie (Ctrl+F), można zaznaczać i kopiować tekst, a systemy archiwizacji i wyszukiwarki indeksują jego treść. Wygląd stron i jakość skanu pozostają bez zmian, a plik zwykle rośnie tylko o kilkadziesiąt KB na stronę.

Opcja jest niedostępna dla plików chronionych hasłem - takie dokumenty da się odczytać i rozpoznać, ale nie zapisać ponownie w przeglądarce.

Ile trwa OCR i jak poprawić wynik?

DokumentOrientacyjny czas
1 strona A43-10 s
10 stronok. 1-2 min
50 stronok. 5-8 min

Czas zależy od komputera i liczby języków. Dla długich dokumentów wybierz zakres stron. Najlepsze wyniki dają skany 300 DPI, proste (bez przekrzywienia) i kontrastowe. Przy wyblakłym druku włącz „Popraw obraz”. Pewność poniżej 60% oznacza, że tekst wymaga dokładnej korekty. Pojedyncze zdjęcia i zrzuty ekranu rozpoznasz w narzędziu Tekst ze zdjęcia.

Najczęściej zadawane pytania

Czy OCR PDF jest darmowy?

+
Tak. Narzędzie jest darmowe, bez limitu stron, rejestracji i znaków wodnych. Ograniczeniem jest tylko wydajność Twojego komputera.

Czy mój dokument jest wysyłany na serwer?

+
Nie. Strony renderuje i rozpoznaje Twoja przeglądarka. Z internetu pobierany jest wyłącznie silnik OCR i dane językowe (ok. 7 MB, jednorazowo).

Czy mogę rozpoznać PDF zabezpieczony hasłem?

+
Tak, jeśli znasz hasło - wpisz je po wczytaniu pliku. Tekst zostanie rozpoznany, ale przeszukiwalnego PDF nie da się wtedy zapisać.

Jak zrobić przeszukiwalny PDF ze skanu?

+
Wczytaj skan, zostaw włączoną opcję „Utwórz przeszukiwalny PDF”, kliknij „Rozpoznaj tekst”, a po zakończeniu - „Pobierz przeszukiwalny PDF”.

Czy OCR rozpoznaje polskie znaki?

+
Tak, gdy zaznaczony jest język polski. Bez niego litery takie jak ł czy ę zostaną odczytane jako t i e.

Co zrobić, gdy PDF ma już tekst?

+
Użyj narzędzia PDF na tekst - odczyta istniejącą warstwę tekstową w ułamku sekundy i bez błędów rozpoznawania.

Aktualizacja: