ottobre 12, 2012

Tesseract OCR uno dei migliori programmi open source per il riconoscimento ottico dei caratteri.

Tesseract è un software libero per il riconoscimento ottico dei caratteri (OCR).

Sviluppato originariamente come software proprietario dalla Hewlett-Packard tra il 1985 e il 1995, non venne più aggiornato nel decennio successivo. Fu poi rilasciato come open source nel 2005 da Hewlett Packard e dall'Università del Nevada, Las Vegas, e rilasciato con la licenza Apache, versione 2.0. Lo sviluppo di Tesseract è attualmente sponsorizzato da Google.

Come tutti i programmi OCR, anche Tesseract serve a convertire il testo contenuto in un'immagine, ottenuta di solito per mezzo di uno scanner, in caratteri comprensibili ad un elaboratore di testi. I risultati sono molto buoni per quanto riguarda il riconoscimento dei caratteri; manca invece la capacità di mantenere il layout delle pagine, per esempio le tabelle o le colonne. Inizialmente limitato ai soli caratteri ASCII, nell'ottobre 2011 Tesseract supporta i caratteri UTF-8 e riconosce 33 lingue.
Un'altra limitazione di Tesseract è quella di accettare solo immagini Tagged Image File Format, con l'estensione «.tif». Il software inoltre è attualmente utilizzabile da riga di comando digitando, in una finestra di terminale, il seguente comando:

tesseract <percorso del file TIFF> <nome del file di output>

Sarà generato automaticamente un file di testo con estensione «.txt».

Il motore OCR Tesseract è stato uno dei 3 motori migliori nel test di accuratezza dell'UNLV nel 1995. Tra il 1995 e il 2006 non è stato fatto molto lavoro su di esso, ma successivamente è stato largamente migliorato da Google ed è probabilmente uno dei più accurati motori OCR open source disponibili. È in grado di leggere un'ampia varietà di formati immagine e di convertirli a testo in oltre 40 lin

Utilizzo.
Tesseract è attualmente uno strumento utilizzabile da riga di comando. Dopo averlo installato, il programma può essere usato digitando in una finestra di terminale il seguente comando:
tesseract <percorso del file TIFF> <nome del file di output>

Tesseract darà automaticamente al file generato l'estensione .txt. È importante che l'immagine abbia l'estensione .tif e non .tiff.

Il comando, quindi, dovrebbe apparire come segue:

tesseract /home/utente/input.tif output

Dove «utente» è il nome della cartella Home dell'account in uso, «input.tif» è il documento che deve essere convertito e «output» è il documento che Tesseract creerà come output.txt. L'estensione .txt sarà aggiunta automaticamente da Tesseract.

Preparare le immagini.
Tesseract accetta solo immagini con l'estensione .tiff. Per ottimizzare le immagini per l'acquisizione con Tesseract, dopo essersi assicurati di avere installato GIMP, procedere come segue:

    Aprire GIMP e andare nel menù Immagine → Modalità ed assicurarsi che l'immagine sia RGB o in

Scala di grigi.
    Selezionare dal menù Strumenti → Colore → Soglia e scegliere un valore di soglia adeguato.
    Selezionare dal menù Immagine → Modalità → Indicizzata e dalle opzioni selezionare 1-bit e Nessun dithering.

Usare Tesseract con PDF multipagine.
Spesso, i documenti scansionati vengono salvati come immagini in documenti .pdf. Usando ImageMagick (installabile tramite il pacchetto imagemagick), le singole pagine possono essere estratte come file .tiff per poi essere processate con Tesseract.

Il seguente script può aiutare ad automatizzare il processo:
PAGINE=100 # set to the number of pages in the PDF
SORGENTE=book.pdf # set to the file name of the PDF
OUTPUT=book.txt # set to the final output file
RESOLUTION=600 # set to the resolution the scanner used (the higher, the better)
touch $OUTPUT
for i in `seq 1 $PAGINE`; do
    convert -monochrome -density $RESOLUTION $SORGENTE\[$i\] page$i.tif
    tesseract page$i.tif page$i
    cat $OUTPUT page$i.txt > temp.txt
    rm $OUTPUT
    rm page$i.tif
    rm page$i.txt
    mv temp.txt $OUTPUT
done

Dopo aver avviato lo script, il testo trasformato dall'OCR dovrebbe essere contenuto nel file libro.txt.

Installazione:

Installiamo l'interfaccia grafica GUI per poter utilizzare Tesseract in maniera semplice ed intuitiva: gImageReader.
Lo scarichiamo da questo link.
Si tratta di un pacchetto .deb quindi lo installiamo semplicemente cliccandoci sopra.
L'icona la troviamo poi in Applicazioni > Grafica
Oppure, da terminale:

sudo add-apt-repository ppa:alex-p/notesalexp
sudo apt-get update
sudo apt-get install tesseract-ocr tesseract-ocr-eng

Downloads

tesseract-3.01-doc-html.tar.gz

tesseract-3.01.tar.gz

Avviamo Xsane, (sempre da Applicazioni > Grafica, attendiamo che riconosca il nostro scanner e procediamo alla configurazione del programma prima di effettuare la scansione. Bisogna settare il tutto in modo tale da permettere una scannerizzazione quanto più precisa possibile del documento. I parametri da inserire su Xsane sono questi che vedete nella figura sottostante.

Impostazioni:

a- la cartella di destinazione ed il nome del file immagine (la mia home in questo caso ed il file che otterremo si chiamerà out.tif)

b- .TIFF come estensione dell'immagine (questo formato è quello che garantisce la miglior qualità rispetto agli altri jpg, jpeg o png)

c- BINARIO è il parametro che sta a significare che l'iimagine del documento sarà resa in Bianco e Nero.

d- 1200 dpi come risoluzione. Il valore sotto il quale consiglio di NON scendere, secondo i miei test, causa il mancato riconoscimento totale o parziale testo, è 600 dpi.

Clicchiamo su "Acquisisci" ed attendiamo la fine del processo che si concluderà con il salvataggio dell'immagine out.tiff nella cartella di destinazione che abbiamo indicato in precedenza.

Una volta ottenuto il nostro documento, dobbiamo avviare Tesseract, attraverso gImageReader, per poter effettuare la SEMPLICE procedura OCR. Andiamo in APPLICAZIONI>GRAFICA e lanciamo il programm.

L'interfaccia è intuitiva e semplice da utilizzare. Basterà, infatti, cliccare su "Apri immagini" per aprire il file out.tif, creato in precedenza, e poi cliccare su "Riconoscere tutto" per iniziare il processo OCR, ed aspettare che finisca. Al termine, comparirà sulla destra, sotto forma di testo, il contenuto del file out.tif

Ricerca personalizzata

Se ti è piaciuto l'articolo , iscriviti al feed cliccando sull'immagine sottostante per tenerti sempre aggiornato sui nuovi contenuti del blog:

Trovato questo articolo interessante? Condividilo sulla tua rete di contatti Twitter, sulla tua bacheca su Facebook o semplicemente premi "+1" per suggerire questo risultato nelle ricerche in Google, Linkedin, Instagram o Pinterest. Diffondere contenuti che trovi rilevanti aiuta questo blog a crescere. Grazie! CONDIVIDI SU!

OCR , Ubuntu 10.04 Lucid Lynx , Ubuntu 10.10 Maverick Meerkat , Ubuntu 11.04 Natty Narwhal , Ubuntu 11.10 Oneiric Ocelot , Ubuntu 12.04 Precise Pangolin , Ubuntu 12.10 Quantal Quetzal , Utilities

Hugo Repetto

La prima versione ufficiale di Ubuntu fu rilasciata nell'ottobre 2004 e fu debitamente chiamata «Version 4.10», così da introdurre il sistema di numerazione "A.MM". Mentre era ancora in sviluppo, «Version 4.10» era affettuosamente conosciuta come «The Warty Warthog», letteralmente "il facocero verrucoso", un nome che ha continuato a vivere ben oltre i consueti limiti temporali dei nomi in codice dei software in fase di sviluppo.

Nessun commento:

Posta un commento

Non inserire link cliccabili altrimenti il commento verrà eliminato. Metti la spunta a Inviami notifiche per essere avvertito via email di nuovi commenti.

Ubuntulandia

ottobre 12, 2012

Tesseract OCR uno dei migliori programmi open source per il riconoscimento ottico dei caratteri.

Nessun commento:

Posta un commento

Ultimi post pubblicati

Archivio

Etichette

Ubuntulandia in Pinterest

Post Più Popolari

Informazioni personali

Ultimi post pubblicati

Ubuntu Blogs

I miei preferiti in Instagram

Etichette

Software Libero

Posts più popolari

Ubuntulandia in Facebook

RSVP