Metin tanıma hakkında
Bir tarama ya da sayfa fotoğrafı yalnızca bir resimdir: içinde arama yapamaz, bir cümlesini kopyalayamaz, ekran okuyucuya sesli okutamazsınız. Optik karakter tanıma (OCR), görüntüdeki harfleri bulur ve gerçek metne dönüştürür.
İki tür dosya için iki araç var:
- PDF OCR, taranmış bir PDF’ye görünmez bir metin katmanı ekler. Sayfalar aynı görünür, ama artık arama, kopyalama ve yapıştırma çalışır. Sözleşmeler, faturalar, arşivdeki yazışmalar ve ileride yeniden bulmak isteyeceğiniz her şey için kullanın.
- Görselden metne, bir fotoğrafı ya da ekran görüntüsünü okur ve kopyalayıp kaydedebileceğiniz düz metin verir.
Tanıma tarayıcınızda yapılır. Bu iş için açık kaynak OCR motoru Tesseract kullanılır ve İngilizce ile Rusça metinler okunur. Bir sayfa dizüstü bilgisayarda birkaç saniye, telefonda daha uzun sürer. Uzun ya da çok kötü taramalar için PDF OCR, OCRmyPDF ile çalışan bir sunucu modu sunar. Temizleme, görev oluşturulduktan 60 dk sonrasına planlanır. Teknik arızalar silmeyi geciktirebilir.
En iyi sonuç için sayfayı düz, eşit ışıkta ve tamamı kadraja girecek şekilde fotoğraflayın. Net bir tarama, metni sonradan düzeltmekten daha çok zaman kazandırır.
Sıkça sorulan sorular
Hangi diller tanınabiliyor?
İngilizce ve Rusça, ikisinin karıştığı sayfalar da dahil. Diğer diller henüz desteklenmiyor: bu dillerdeki metinler bozuk çıkar.
Tanıma ne kadar doğru?
Temiz basılı metin çok yüksek doğrulukla tanınır. El yazısı, bulanık fotoğraflar, eğik sayfalar ve süslü yazı tipleri kaliteyi düşürür; bu yüzden sonuçtaki adları ve sayıları kontrol edin.
OCR, PDF’imin görünümünü değiştirir mi?
Hayır. PDF OCR her sayfa görüntüsünü olduğu gibi bırakır ve tanınan metni onun altına, görünmez bir katmana yerleştirir.
Taramalarım yükleniyor mu?
PDF OCR aracının sunucu modunu seçmediğiniz sürece hayır. Tanıma varsayılan olarak cihazınızda, ağ erişimi olmayan bir çerçevede yapılır.