PDF ricercabile (OCR)
PDF ricercabile (OCR)
Un documento scansionato è soltanto un'immagine: non vi si possono cercare parole né copiarne brani. Lo strumento legge le pagine scansionate del PDF, ne riconosce il testo in lingua italiana e lo aggiunge al file in forma invisibile, esattamente sotto le parole della scansione. Il documento mantiene lo stesso aspetto, ma con la ricerca del lettore PDF si trovano nomi, date, importi e numeri, e il testo si può selezionare e copiare. Puoi lasciare invariato il peso del file oppure ottimizzarlo ricomprimendo le immagini. Le pagine che contengono già testo non vengono modificate.
Il documento non lascia il tuo computer
Il riconoscimento del testo è eseguito interamente dal tuo browser: il documento non viene caricato, trasmesso né conservato su questo sito o su altri server. Il PDF ricercabile viene creato sul tuo dispositivo e scaricato direttamente.
Al primo utilizzo il browser scarica soltanto il motore di riconoscimento e il modello della lingua italiana, che poi conserva per le volte successive.
Come funziona lo strumento
A cosa serve
I documenti acquisiti con uno scanner — verbali, annotazioni, denunce, contratti, estratti conto, fascicoli di cancelleria in copia cartacea — sono immagini: il lettore PDF non vi trova alcuna parola e il testo non si può copiare. Lo strumento li trasforma in PDF ricercabili, senza cambiarne l'aspetto.
Come si usa
Scegli il PDF, o trascinalo nella card di caricamento; sono accettati anche i documenti firmati digitalmente (.p7m), dai quali viene estratto il PDF. Indica se lasciare invariato il peso del file o ottimizzarlo, e con quale livello. Premi «Rendi ricercabile e scarica»: il PDF ricercabile viene scaricato con lo stesso nome del file originale seguito da «-ricercabile».
Durante l'elaborazione
L'anello indica l'avanzamento complessivo; sotto sono elencate le fasi (preparazione, analisi delle pagine, riconoscimento del testo, ottimizzazione del peso, salvataggio). Sono indicati il tempo medio per pagina, il tempo residuo stimato e il tempo trascorso. La mappa mostra ogni pagina del documento con il suo stato: da leggere, in lettura, resa ricercabile, già dotata di testo, senza testo riconoscibile, senza immagini. Il riconoscimento richiede indicativamente tra 6 e 14 secondi per pagina, secondo la potenza del computer. Il pulsante «Interrompi il riconoscimento» lo ferma: il PDF viene comunque prodotto e le pagine non ancora lette restano solo immagine.
Il peso del file
Con «Lascia il peso invariato» le immagini restano quelle originali e il file cresce soltanto del testo aggiunto, che pesa pochissimo. Con «Ottimizza il peso», dopo il riconoscimento, le immagini vengono ricompresse al livello scelto: leggera (200 dpi, differenze pressoché invisibili), media (150 dpi, consigliata) o forte (110 dpi, massima riduzione, con minore dettaglio in stampa). Testo, caratteri e grafica vettoriale non vengono toccati.
Limiti del riconoscimento. Il testo dattiloscritto o stampato su scansioni nitide è riconosciuto con buona precisione, anche su pagine acquisite di traverso o capovolte; i manoscritti, i timbri, le fotocopie sbiadite e le tabelle fitte danno risultati incerti. Il testo riconosciuto serve a cercare e a copiare: non sostituisce la lettura del documento, e ogni citazione va verificata sull'immagine. Il PDF prodotto non conserva la firma digitale dell'originale.
Riservatezza
Il documento viene letto ed elaborato esclusivamente nel tuo browser: nessun file viene caricato su questo sito o su altri server. Da internet si scaricano soltanto, al primo utilizzo, il motore di riconoscimento e il modello della lingua italiana.
