Przejdź do treści
HNarzędzia
pl
Kategorie

PDF na tekst online - wyodrębnij tekst z pliku PDF

Wyciągnij tekst z dokumentu PDF - cały lub z nagłówkami stron - skopiuj go do schowka albo zapisz jako plik .txt. Działa lokalnie w przeglądarce. Skanów (obrazów) bez warstwy tekstowej nie odczytuje - to wymaga OCR.

  • Za darmo
  • Bez rejestracji
  • Prywatne
  • Działa lokalnie

Przeciągnij i upuść pliki tutaj

lub kliknij, aby wybrać z urządzenia

Plik PDF · przetwarzanie odbywa się lokalnie w przeglądarce

Jak wyciągnąć tekst z PDF?

  1. 1.

    Wczytaj plik PDF

    Przeciągnij dokument na pole powyżej lub wybierz go z urządzenia. Jeśli jest chroniony hasłem, wpisz je.

  2. 2.

    Poczekaj na odczyt

    Narzędzie czyta kolejne strony i pokazuje postęp. Przy kilkuset stronach trwa to kilka sekund.

  3. 3.

    Dostosuj wynik

    Opcjonalnie włącz scalanie złamanych wierszy (łączy zawinięte linie w akapity) i nagłówki z numerami stron.

  4. 4.

    Skopiuj lub pobierz

    Kliknij „Kopiuj tekst”, aby wkleić go gdzie chcesz, albo „Pobierz .txt”, aby zapisać plik w kodowaniu UTF-8 (z polskimi znakami).

Skąd bierze się tekst i kiedy go nie będzie?

Większość plików PDF tworzonych z edytorów tekstu (Word, Google Docs), systemów księgowych i przeglądarek zawiera warstwę tekstową - to ją odczytuje to narzędzie, zachowując kolejność wierszy i akapitów w takiej postaci, w jakiej zapisał ją dokument.

Skany i zdjęcia dokumentów (z drukarki wielofunkcyjnej, aplikacji skanującej w telefonie) są obrazami - nie mają tekstu, który można odczytać. Takie pliki wymagają OCR (optycznego rozpoznawania znaków), którego to narzędzie nie zapewnia. Gdy wykryje brak tekstu, wyświetli odpowiedni komunikat. Szybki test: jeśli w przeglądarce nie da się zaznaczyć myszą słów w PDF, to prawdopodobnie jest skan.

Scalanie złamanych wierszy

W PDF każdy wiersz tekstu jest zapisany osobno, więc skopiowanie akapitu zwykle daje „drabinkę” krótkich linii. Opcja Scal złamane wiersze skleja wiersze należące do jednego akapitu (po linii kończącej się kropką, dwukropkiem lub wykrzyknikiem następny wiersz zaczyna się od nowej linii) i łączy wyrazy dzielone myślnikiem na końcu wiersza, np. „praw-” + „dziwy” → „prawdziwy”. Pozycje listy (myślnik, punktor, „1.”) zachowują osobne linie.

Jeśli dokument to tabela, formularz lub kod, wyłącz scalanie - wtedy układ wierszy pozostanie taki, jak w dokumencie.

Nagłówki stron, statystyki i dalsza praca z tekstem

Opcja Dodaj nagłówki stron wstawia przed tekstem każdej strony wiersz --- Strona 3 ---. Przydaje się, gdy cytujesz dokument i musisz wskazać, skąd pochodzi fragment, albo gdy szukasz strony, na której był dany zapis. Bez nagłówków puste strony są pomijane, a tekst kolejnych stron oddziela pusta linia.

Pod wynikiem widać liczbę słów, znaków i stron - np. 12-stronicowa umowa to zwykle ok. 4-5 tys. słów. Jeśli strony bez tekstu to tylko część dokumentu (np. podpisany skan ostatniej strony), narzędzie pokaże ostrzeżenie, że te strony mogą wymagać OCR. Gdy cały plik ma średnio mniej niż ok. 15 znaków na stronę, zostanie uznany za skan.

Wyodrębniony tekst możesz dalej obrobić, np. policzyć znaki lub porównać dwie wersje umowy.

Prywatność i ograniczenia

  • Tekst jest wyodrębniany w Twojej przeglądarce za pomocą pdf.js - dokument nie opuszcza urządzenia.
  • Układ kolumn, tabel i przypisów może zostać odczytany w innej kolejności niż na stronie - to cecha formatu PDF, który nie przechowuje „akapitów”, lecz pozycje fragmentów tekstu.
  • Znaki specjalne i polskie litery są zachowane (UTF-8). Zdarza się, że PDF ma uszkodzone mapowanie czcionek - wtedy zamiast liter pojawiają się dziwne znaki, i jedynym wyjściem jest OCR.

Najczęściej zadawane pytania

Dlaczego nie mogę skopiować tekstu z PDF?

+
Najczęściej plik jest skanem - stroną-obrazem bez tekstu. Wtedy potrzebny jest OCR. Rzadziej autor zablokował kopiowanie albo czcionki mają uszkodzone mapowanie znaków.

Czy to narzędzie rozpoznaje tekst ze skanów (OCR)?

+
Nie. Odczytuje wyłącznie istniejącą warstwę tekstową PDF. Dla skanów użyj programu z funkcją OCR (np. w aplikacji skanującej lub edytorze PDF).

W jakim formacie zapisywany jest plik tekstowy?

+
W formacie .txt w kodowaniu UTF-8, które zachowuje polskie znaki (ą, ę, ł, ż…). W nowoczesnych edytorach, w tym w Notatniku Windows, otwiera się poprawnie.

Czy PDF jest wysyłany na serwer?

+
Nie. Tekst jest odczytywany lokalnie w przeglądarce, a dokument nie opuszcza Twojego urządzenia.

Jak skopiować tekst tylko z wybranych stron?

+
Narzędzie odczytuje cały dokument. Aby uzyskać tekst z kilku stron, najpierw wytnij je narzędziem „Podziel PDF” (tryb „Wybrane strony”), a następnie wczytaj nowy plik tutaj.

Czy można odczytać PDF zabezpieczony hasłem?

+
Tak, jeśli znasz hasło do otwarcia - po wczytaniu pliku pojawi się pole na hasło, które jest używane tylko lokalnie.

Aktualizacja: