Přeskočit na obsah
nastroje.io

Jak dostat text z fotky nebo skenu do počítače

Rozpoznávání textu (OCR) přepíše účtenku, smlouvu i screenshot do editovatelné podoby. Poradíme, jak dokument nafotit, aby výsledek nebyl změť znaků.

· 3 min čtení

Dostanete smlouvu jako sken v PDF a potřebujete z ní citovat odstavec. Nebo máte vyfocenou účtenku a chcete částky přepsat do tabulky. Ruční přepisování je zbytečné: zvládne to rozpoznávání textu, zkráceně OCR.

Kdy OCR potřebujete a kdy ne

Tohle je první věc, kterou má smysl ověřit. Existují dva druhy PDF, které vypadají stejně:

  • PDF s textem vzniklo exportem z Wordu nebo z účetního programu. Text v něm jde označit myší a vyhledat.
  • Skenované PDF je v podstatě fotka nalepená na stránku. Označit v něm nejde nic.

Zkuste v dokumentu vyhledat libovolné slovo klávesovou zkratkou Ctrl+F. Když se najde, OCR nepotřebujete a lepší výsledek dá PDF do Wordu, protože pracuje s přesnými znaky, ne s jejich rozpoznáváním z pixelů.

Když se nenajde nic, jde o sken a je čas na OCR.

Postup

  1. Otevřete text z obrázku (OCR) a nahrajte fotku, screenshot nebo skenované PDF.
  2. Vyberte jazyk textu. U českého dokumentu vždy češtinu, jinak přijdete o háčky a čárky.
  3. Zvolte, jestli chcete zachovat řádky, nebo je spojit do odstavců. Pro kopírování do e-mailu se hodí odstavce, pro tabulky a seznamy spíš řádky.
  4. Spusťte rozpoznávání. Text se objeví v poli, kde ho rovnou opravíte, zkopírujete nebo stáhnete jako TXT.

U skenovaného PDF nástroj vykreslí stránky a rozpozná je po jedné, nejvýš dvacet. Celé rozpoznávání běží ve vašem prohlížeči, takže smlouva ani účtenka neopustí váš počítač. To u dokumentů s osobními údaji není detail.

Jak nafotit dokument, aby to fungovalo

Kvalita výsledku stojí a padá s předlohou. Rozpoznávání není kouzlo, jen hledá tvary písmen. Když je nevidí ostře, hádá.

Problém Následek Řešení
Focení z ruky za šera rozmazané hrany písmen světlo od okna, opřít telefon
Šikmý úhel písmena se zužují fotit kolmo shora
Stín přes stránku polovina textu zmizí odstoupit od zdroje světla
Zmačkaný papír přeskakující řádky vyrovnat, přitisknout knihou

Praktická pomůcka: většina telefonů má v aplikaci Poznámky nebo Soubory režim skenování dokumentu. Ten srovná perspektivu a zvýší kontrast. Takový sken projde OCR výrazně líp než obyčejná fotka.

Co OCR neumí

Psací písmo. Rozpoznávání je stavěné na tištěný text. Ručně psané poznámky přečte jen náhodně.

Rozvržení stránky. Výstupem je prostý text. Sloupce, tabulky a rámečky se rozpadnou do řádků a poskládat je zpátky musíte sami.

Zaručit správnost. I při vysoké jistotě rozpoznání se najde překlep, typicky nula proti písmenu O nebo jednička proti malému l. U částek a čísel účtů výsledek vždycky zkontrolujte.

Co s textem dál

Když jde o smlouvu, kterou potřebujete jen doplnit a podepsat, nemusíte ji přepisovat vůbec. Otevřete původní PDF v editoru PDF, vepište do něj údaje, podepište se a stáhněte. OCR použijte, až když text opravdu potřebujete mít jako text.

Časté otázky

Umí to česky?

Ano, včetně diakritiky. Jazyk se vybírá před spuštěním, protože model pro angličtinu by český text přepsal bez háčků a čárek.

Proč jsou ve výsledku překlepy?

Nejčastěji kvůli předloze: rozmazaná fotka, nízký kontrast nebo šikmý úhel. Pomůže i správně zvolený jazyk. U nízké jistoty rozpoznání na to nástroj sám upozorní.

Zvládne to ručně psaný text?

Ne. Rozpoznávání je určené pro tištěné písmo.

Kolik stran PDF zvládne?

Nejvýš dvacet. U delších dokumentů je rozumné rozdělit je nejdřív nástrojem Rozdělení PDF a rozpoznávat po částech.

Odesílá se dokument někam?

Ne. Jádro rozpoznávání i jazyková data se stáhnou do prohlížeče, asi 10 MB při prvním použití, a dokument se zpracuje u vás v počítači.

Nástroje z článku

Zpět na všechny články