Poradnik

Jak wyodrębnić tekst z obrazu lub zrzutu ekranu w Windows

Wyodrębnianie tekstu ze zrzutu ekranu w Windows za pomocą OCR

Tekst jest tuż przed oczami — na zrzucie ekranu, na zdjęciu tablicy, w zeskanowanym dokumencie, w przepisie, który ktoś przysłał jako obrazek. Da się go odczytać wzrokiem. Ale przy próbie skopiowania nic się nie dzieje. Tekst jest uwięziony wewnątrz obrazu, a Windows traktuje całość jako jeden blok pikseli, a nie zbiór czytelnych słów.

To jedna z tych codziennych niedogodności, które — jak się wydaje — dawno powinny zostać rozwiązane. Telefon potrafi rozpoznać roślinę ze zdjęcia, a mimo to skopiowanie numeru telefonu ze zrzutu ekranu wciąż wymaga albo ręcznego przepisania, albo znalezienia właściwego narzędzia.

Technologia, która to rozwiązuje, nazywa się OCR (optyczne rozpoznawanie znaków). Istnieje od dziesięcioleci, ale w ostatnich latach zrobiła ogromny postęp. Pytanie nie brzmi, czy działa (bo działa), lecz które podejście ma sens w danej sytuacji.

Szybka odpowiedź: Windows ma kilka wbudowanych sposobów na wyodrębnianie tekstu z obrazów, ale są one ograniczone i nie zawsze oczywiste. Do niezawodnego wyodrębniania tekstu ze zrzutów ekranu, zdjęć i zeskanowanych dokumentów dedykowane narzędzie OCR, takie jak OCR Text Recognition Tool z Microsoft Store, wykonuje zadanie przy minimalnej konfiguracji — proszę otworzyć obraz, wyodrębnić tekst i go skopiować. Do sporadycznego użytku warto też znać funkcję wyodrębniania tekstu w Windows PowerToys.


Co właściwie robi OCR

OCR to proces analizy obrazu w celu rozpoznania zawartych w nim znaków i przekształcenia ich w tekst, który można zaznaczać, kopiować i edytować. W dużym uproszczeniu oprogramowanie przygląda się kształtom na obrazie, porównuje je ze znanymi wzorcami znaków i tworzy najlepsze przypuszczenie co do tego, czym jest każdy znak.

Nowoczesny OCR wykracza daleko poza proste dopasowywanie wzorców. Obecne silniki korzystają z modeli uczenia maszynowego, które rozumieją kontekst — „wiedzą”, że w niektórych krojach pisma „rn” wygląda niemal identycznie jak „m”, i na podstawie sąsiednich słów ustalają, o którą wersję naprawdę chodzi. Radzą sobie z tekstem pod skosem, nierównym oświetleniem, pismem odręcznym (w różnym stopniu) oraz z wieloma językami na jednej stronie.

Dokładność zależy od kilku czynników: jak wyraźny jest obraz źródłowy, jakiego kroju pisma użyto, czy tekst jest drukowany, czy odręczny, oraz jak dużo zakłóceń wizualnych zawiera obraz. Czysty zrzut ekranu dokumentu przetwarza się niemal idealnie. Rozmyte zdjęcie pogniecionego paragonu zrobione przy słabym oświetleniu to trudniejszy przypadek.


📊 Porównanie metod OCR w Windows

Metoda Cena Idealne do Wiele języków
OCR Text Recognition Tool Kilka wyodrębnień dziennie za darmo, potem przystępny plan płatny Niezawodne, codzienne wyodrębnianie tekstu z obsługą wielu języków Tak
PowerToys Text Extractor Za darmo Szybkie, jednorazowe wyodrębnienie, gdy korzysta się już z PowerToys Ograniczone
Google Lens (przeglądarka) Za darmo Szybkie wyodrębnianie ze zdjęć w przeglądarce Tak
OneNote OCR Za darmo z kontem Microsoft Osoby korzystające już z ekosystemu Microsoft Tak
Adobe Acrobat Pro Miesięczna subskrypcja płatna Profesjonalny OCR na zeskanowanych dokumentach PDF Tak

Sytuacje, w których to się przydaje

Zanim przejdziemy do narzędzi, warto zrozumieć typowe scenariusze. Ludzie szukają sposobu na wyodrębnianie tekstu z zaskakująco różnych powodów, a najlepsze podejście zależy od tego, z którym z nich mamy do czynienia.

Zrzuty ekranu z komunikatami o błędach lub kodem. Współpracownik przysyła zrzut ekranu z błędem. Trzeba wyszukać treść komunikatu lub wkleić ją do zgłoszenia. Przepisywanie śladu stosu znak po znaku jest żmudne i podatne na pomyłki. OCR wyodrębnia dokładny tekst w kilka sekund.

Zeskanowane dokumenty. Mamy zeskanowaną umowę, zdjęcie paragonu albo PDF, który w rzeczywistości jest zbiorem obrazów poszczególnych stron. Tekst wygląda normalnie na ekranie, ale niczego nie da się zaznaczyć. OCR zamienia obraz w prawdziwy tekst, który można kopiować i przeszukiwać.

Zdjęcia materiałów drukowanych. Strona z książki, tablica po spotkaniu, etykieta z wartościami odżywczymi, znak uliczny w obcym języku. Zawsze, gdy tekst można sfotografować, ale nie da się go cyfrowo zaznaczyć, OCR jest pomostem.

Dane zamknięte w obrazach. Ktoś przysyła tabelę jako zrzut ekranu zamiast arkusza kalkulacyjnego. Wykres ma etykiety, do których trzeba się odwołać. Slajd prezentacji zawiera tekst, który chcemy zacytować. Każdy z tych przypadków wymaga wyodrębnienia tekstu z obrazu, a nie z pliku źródłowego.

Tekst w obcym języku. Mamy obraz z tekstem w języku, którego nie znamy. Najpierw wyodrębnienie tekstu, a dopiero potem jego tłumaczenie jest pewniejsze niż próba tłumaczenia bezpośrednio z obrazu, ponieważ narzędzia tłumaczeniowe lepiej działają na czystym tekście wejściowym.


Metoda 1: PowerToys Text Extractor

Microsoft PowerToys to darmowy zestaw narzędzi dla Windows, a jedno z nich — Text Extractor — wykonuje podstawowy OCR. Jeśli PowerToys jest już zainstalowany, można go użyć od razu. Proszę nacisnąć Win + Shift + T i obrysować prostokątem tekst do wyodrębnienia. Rozpoznany tekst trafia prosto do schowka.

Sprawdza się przy czystym, dobrze oświetlonym tekście w standardowych językach. Zawodzi przy złożonych obrazach, treściach wielojęzycznych oraz w sytuacjach wymagających większej kontroli nad procesem. Nie ma podglądu tego, co zostało rozpoznane, nie da się poprawić błędów przed skopiowaniem, a obsługa języków zależy od tego, które pakiety językowe OCR zainstalowano w Windows.

Do szybkiego, sporadycznego użytku — pochwycenia wiersza tekstu ze zrzutu ekranu, skopiowania adresu z obrazu — jest zaskakująco przydatny. Przy czymkolwiek bardziej wymagającym okazuje się ograniczony.

Jeśli PowerToys nie jest zainstalowany, można go pobrać z Microsoft Store lub GitHuba. Instalacja jest prosta, choć otrzymuje się cały pakiet PowerToys, a nie tylko funkcję OCR.


Metoda 2: dedykowana aplikacja OCR

Jeśli wyodrębnianie tekstu zdarza się częściej niż sporadycznie, dedykowana aplikacja OCR jest praktyczniejszym wyborem. Przebieg pracy jest prostszy: proszę otworzyć obraz, kliknąć wyodrębnianie, a rozpoznany tekst pojawia się gotowy do skopiowania. Żadnych skrótów klawiszowych do zapamiętania, żadnego rysowania ramek zaznaczenia na ekranie, żadnego zgadywania, czy wyodrębnianie się powiodło, aż do momentu wklejenia gdzieś tekstu.

Dedykowane aplikacje zwykle lepiej radzą sobie też z przypadkami brzegowymi — obrazami z mieszanką języków, tekstem pod nietypowym kątem, zdjęciami niższej jakości, zeskanowanymi dokumentami z zakłóceniami w tle. Cały wysiłek inżynierski wkładają właśnie w proces OCR, co widać w dokładności przy trudnych danych wejściowych.

Niektóre aplikacje OCR przetwarzają obrazy za pomocą silników rozpoznawania w chmurze. To praktyczny wybór projektowy: silniki w chmurze są trenowane na znacznie większych zbiorach danych i zwykle są dokładniejsze, zwłaszcza w przypadku pisma odręcznego, nietypowych krojów pisma i alfabetów niełacińskich. Kompromis polega na tym, że obraz na chwilę opuszcza urządzenie w celu przetworzenia. W większości zastosowań — wyodrębnianie tekstu ze zrzutu ekranu, odczyt zeskanowanego paragonu — nie stanowi to problemu. Jeśli pracuje się z materiałami poufnymi, warto mieć to na uwadze.


Metoda 3: ukryta funkcja OCR w OneNote

OneNote ma wbudowany OCR, ale nie jest to oczywiste. Po wklejeniu lub wstawieniu obrazu na stronę OneNote proszę kliknąć go prawym przyciskiem i wybrać „Kopiuj tekst z obrazu”. OneNote przetwarza obraz i kopiuje rozpoznany tekst do schowka.

Dokładność jest przyzwoita przy czystych obrazach i tekście drukowanym. Wadą jest przebieg pracy: trzeba otworzyć OneNote, utworzyć stronę lub do niej przejść, wstawić obraz, chwilę poczekać na przetworzenie, a potem kliknąć prawym przyciskiem. Dla osób, które i tak korzystają z OneNote, to sprytna sztuczka. Dla pozostałych otwieranie aplikacji do notatek tylko po to, by wyodrębnić tekst z obrazu, to niewygodny objazd.

Kolejna osobliwość: OneNote czasem potrzebuje kilku sekund na przetworzenie obrazu, zanim pojawi się opcja „Kopiuj tekst”. Przy kliknięciu prawym przyciskiem od razu po wstawieniu opcji może jeszcze nie być.


Metoda 4: Google Lens w przeglądarce

Google Lens potrafi wyodrębniać tekst z obrazów bezpośrednio w Chrome. Proszę kliknąć prawym przyciskiem dowolny obraz na stronie internetowej i wybrać „Wyszukaj obraz z Google Lens”, a następnie przełączyć się na tryb „Tekst”. Rozpoznany tekst można zaznaczyć i skopiować.

W przypadku obrazów, które już są w przeglądarce — zrzutu ekranu opublikowanego na stronie, podglądu dokumentu, obrazu osadzonego — to wygodne, bo nie trzeba niczego instalować. W przypadku obrazów na pulpicie lub w folderze trzeba by najpierw przeciągnąć je do przeglądarki, co dokłada jeden krok.

Jakość OCR jest wysoka, zwłaszcza przy wielu językach. Silnik rozpoznawania Google należy do najlepszych dostępnych, a Lens korzysta z tej samej technologii. Ograniczeniem jest to, że działa tylko w Chrome i wymaga połączenia z internetem.


Co wpływa na dokładność OCR

Nie wszystkie obrazy dają takie same wyniki, niezależnie od użytego narzędzia. Zrozumienie tych czynników pomaga właściwie ustawić oczekiwania i — o ile to możliwe — poprawić obraz źródłowy przed wyodrębnianiem.

Rozdzielczość ma znaczenie. Obrazy o wyższej rozdzielczości dają lepsze wyniki OCR. Skan w rozdzielczości 300 DPI przetwarza się niemal idealnie. Zrzut ekranu małego bloku tekstu w rozdzielczości 72 DPI może dawać błędy. Jeśli ma się wpływ na źródło, warto rejestrować obraz w najwyższej możliwej rozdzielczości.

Kontrast liczy się bardziej niż kolor. Silniki OCR wewnętrznie przekształcają obrazy do wysokiego kontrastu przed przetwarzaniem. Czarny tekst na białym tle daje najlepsze wyniki. Jasnoszary tekst na nieco jaśniejszym szarym tle — coś, co dla oka wygląda dobrze — może zmylić silnik, bo współczynnik kontrastu jest zbyt niski.

Tekst prosty jest łatwiejszy niż przekrzywiony. Fotografując stronę, warto ująć ją na wprost, a nie pod kątem. Nowoczesny OCR radzi sobie z pewnym przekrzywieniem, ale każdy stopień obrotu nieco obniża dokładność. Przy skanowaniu, dla najczystszych wyników, lepiej użyć skanera płaskiego niż aparatu w telefonie.

Tekst drukowany a pismo odręczne. Tekst drukowany standardowymi krojami pisma przetwarza się bardzo dokładnie — 99%+ przy czystych obrazach. Rozpoznawanie pisma odręcznego znacznie się poprawiło, ale wyniki bywają różne. Staranne, jednolite pismo odręczne działa całkiem nieźle. Niechlujne pismo lub nietypowe style pozostają trudne dla każdego silnika OCR.

Zakłócenia i artefakty. Smugi, plamy po kawie, linie zagięć i artefakty kompresji — wszystko to obniża dokładność. Zwłaszcza kompresja JPEG potrafi rozmyć krawędzie znaków akurat na tyle, by doszło do błędnego odczytu. Jeśli źródłem jest mocno skompresowany obraz, silnik OCR ma mniej materiału do pracy.


Jak radzić sobie z zeskanowanymi plikami PDF

Szczególnym wariantem problemu z wyodrębnianiem tekstu jest zeskanowany PDF. To PDF, w którym każda strona jest w istocie fotografią — tekst wygląda normalnie podczas przeglądania, ale przy próbie zaznaczenia nic się nie podświetla. Przeglądarka PDF traktuje każdą stronę jako pojedynczy obraz.

Aby sprawdzić, czy PDF jest zeskanowany, czy tekstowy, proszę go otworzyć i spróbować zaznaczyć słowo, klikając i przeciągając. Jeśli da się podświetlić pojedyncze słowa, plik jest tekstowy i OCR nie jest potrzebny — tekst można skopiować bezpośrednio. Jeśli nic się nie podświetla albo cała strona zaznacza się jako jeden blok, plik jest zeskanowany.

W przypadku zeskanowanych plików PDF podejście jest takie samo jak dla każdego obrazu: należy przeprowadzić na nich OCR. Niektóre narzędzia OCR przyjmują pliki PDF bezpośrednio i przetwarzają każdą stronę jako obraz. Inne wymagają wcześniejszego przekonwertowania stron PDF na obrazy. Tak czy inaczej, wynikiem jest tekst możliwy do wyodrębnienia.

Jeśli dokument ma dodatkowo wrócić do formatu PDF z osadzonym tekstem (tak, by inni mogli go przeszukiwać i zaznaczać), potrzebne jest narzędzie tworzące „przeszukiwalny PDF” — warstwę OCR umieszczoną za obrazem, dzięki której wygląd wizualny pozostaje zachowany, a tekst staje się zaznaczalny. Adobe Acrobat robi to dobrze. Oferują to również niektóre dedykowane narzędzia OCR.


Rozwiązywanie problemów

Wyodrębniony tekst zawiera dużo błędów. Obraz źródłowy ma prawdopodobnie niską rozdzielczość, niski kontrast lub zawiera nietypowe kroje pisma. Proszę najpierw spróbować poprawić obraz — zwiększyć kontrast, przyciąć do samego obszaru tekstu lub zeskanować ponownie w wyższej rozdzielczości.

Tekst pojawia się w niewłaściwej kolejności. Układy wielokolumnowe i złożone projekty stron mogą wprowadzać silniki OCR w błąd co do kolejności czytania. Jeśli tekst zostaje wyodrębniony, ale akapity są pomieszane, może być konieczne wyodrębnianie mniejszych fragmentów naraz — jednej kolumny, jednego bloku, jednego akapitu.

Znaki specjalne lub symbole są błędne. Silniki OCR najlepiej radzą sobie ze standardowym tekstem alfabetycznym. Symbole matematyczne, znaki walut i specjalna interpunkcja są trudniejsze do rozpoznania i mogą pojawić się jako niewłaściwe znaki. Proszę je uważnie sprawdzić.

Alfabety niełacińskie mają niższą dokładność. OCR dla chińskiego, japońskiego, koreańskiego, arabskiego i innych alfabetów niełacińskich poprawił się, ale zwykle jest mniej dokładny niż rozpoznawanie pisma łacińskiego. Proszę upewnić się, że narzędzie OCR obsługuje dany język i że zainstalowano odpowiednie pakiety językowe.

Pismo odręczne w ogóle nie jest rozpoznawane. Nie każdy silnik OCR obsługuje pismo odręczne. Te, które to potrafią, zwykle wymagają, aby pismo było dość staranne i jednolite. Jeśli trzeba regularnie cyfryzować odręczne notatki, warto poszukać narzędzia, które wprost reklamuje rozpoznawanie pisma odręcznego.


Najczęstsze pytania (FAQ)

Czy Windows potrafi natywnie wyodrębniać tekst z obrazów?

Nie za pomocą żadnej oczywistej, wbudowanej funkcji. PowerToys Text Extractor dodaje taką możliwość po zainstalowaniu. OneNote ma ukrytą funkcję OCR. Żadne z tych rozwiązań nie działa od razu jednym kliknięciem.

Czy OCR jest na tyle dokładny, by ufać mu bez sprawdzania?

Przy czystych obrazach o wysokiej rozdzielczości z tekstem drukowanym dokładność wynosi zwykle 99%+. W przypadku obrazów niższej jakości, pisma odręcznego lub nietypowych krojów pisma należy zawsze sprawdzić wynik. Przy ważnych dokumentach nigdy nie warto zakładać, że wynik OCR jest idealny.

Czy mogę wyodrębnić tekst ze zdjęcia zrobionego telefonem?

Tak. Dokładność zależy od jakości zdjęcia. Dobre oświetlenie, stabilna ostrość i ujęcie na wprost dają najlepsze wyniki. Zdjęcia rozmyte lub zrobione pod kątem będą miały więcej błędów.

Czy OCR działa z pismem odręcznym?

Do pewnego stopnia. Staranne, jednolite pismo odręczne w popularnych alfabetach można rozpoznać z rozsądną dokładnością. Niechlujne pismo, nietypowe alfabety lub mocno stylizowane pismo pozostają trudne dla wszystkich narzędzi OCR.

Czy mogę wyodrębnić tekst z filmu lub z obrazu na żywo?

Nie bezpośrednio. Trzeba by zrobić zrzut ekranu klatki z potrzebnym tekstem, a następnie przeprowadzić na nim OCR. Niektóre narzędzia do przechwytywania ekranu pozwalają zatrzymać klatkę właśnie w tym celu.

A co z wyodrębnianiem tekstu w wielu językach?

Większość nowoczesnych narzędzi OCR obsługuje dziesiątki języków. Jeśli obraz zawiera tekst w więcej niż jednym języku, niektóre narzędzia radzą sobie z tym automatycznie, a inne wymagają wcześniejszego wskazania języków. Obsługa wielu języków to jeden z obszarów, w których dedykowane narzędzia OCR zwykle przewyższają opcje wbudowane.


Źródła


Podsumowanie

Wyodrębnianie tekstu z obrazów to problem rozwiązany — narzędzia istnieją, dokładność jest wysoka, a proces jest szybki. Prawdziwe pytanie brzmi tylko, które podejście pasuje do tego, jak często jest potrzebne i jak płynne ma być korzystanie z niego. PowerToys sprawdza się przy sporadycznym, szybkim pochwyceniu tekstu. Ukryta funkcja OneNote działa, gdy i tak się w nim jest. Do czegokolwiek bardziej regularnego OCR Text Recognition Tool daje kilka darmowych wyodrębnień dziennie, z obsługą wielu języków i prostym przebiegiem pracy — proszę otworzyć obraz, wyodrębnić, skopiować.

Niezależnie od wyboru, warto przestać przepisywać tekst ze zrzutów ekranu. Życie jest na to zbyt krótkie.