PDF’den metin çıkarın
PDF’nin metnini, belgeyi yüklemeden, okuma sırasıyla düz bir UTF-8 .txt dosyası olarak alın.
Biçimler ve sınırlar
Biçimler ve sınırlar
- Desteklenen biçimler
- Sonuç
- TXT
| Bilgisayarda | Telefon veya tablette | |
|---|---|---|
| En büyük dosya boyutu | 300 MB | 100 MB |
| En fazla sayfa | 2000 | 300 |
Cihazınızdaki sınırlar, cihazın belleğine bağlıdır. Daha büyük dosyalar da işlenebilir; araç sizi önceden uyarır.
Nasıl çalışır?
- 01 Metnini çıkarmak istediğiniz PDF’yi seçin.
- 02 İsterseniz sayfaları belirtin ya da “Daha fazla seçenek” altında “Her sayfanın başlangıcını işaretle” seçeneğini açın.
- 03 “Metni çıkar” düğmesine basın.
- 04 Metni önizlemeden kopyalayın veya .txt dosyasını indirin.
Bu araç hakkında
Bir PDF görüntüleyicisinden metin kopyalamak çoğu zaman karmakarışık satırlar verir: iç içe geçmiş iki sütun, cümlenin ortasına düşen bir sayfa başlığı. Hushdesk her karakterin konumuna bakar ve okuma sırasını yeniden kurar; iki sütunlu bir makale sütun sütun çıkar, başlıklar ve sayfa numaraları ait oldukları yerde kalır. Her düzenleyicide açılan, doğrudan bir çeviri aracına, arama dizinine veya sohbet botuna verilebilecek düz bir UTF-8 metin dosyası alırsınız. Türkçe, İngilizce, Rusça ve diğer alfabelerin çoğu eksiksiz aktarılır. Yalnızca taranmış resimlerden oluşan sayfalarda çıkarılacak harf yoktur: araç bu sayfaları adıyla belirtir ve bunun yerine OCR önerir.
-
Gerçek okuma sırası
Sütunlar her sayfada ayrı ayrı algılanır; iki sütunlu bir yayın, iki sütunu satır satır kesmek yerine önce sol, sonra sağ sütunla okunur.
-
Her alfabe
Dosya UTF-8 olarak kaydedilir: Türkçe harfler, Kiril, aksanlı harfler, para birimi işaretleri ve simgeler belgede nasıl görünüyorsa öyle gelir.
-
Taramalar işaretlenir
Bir sayfa metnin fotoğrafıysa, sessizce boş bir sonuç almak yerine bunun hangi sayfa olduğunu öğrenirsiniz.
-
Baştan gizlilik odaklı
Metni, tarayıcı sekmenizde çalışan bir motor okur. Raporlar, sözleşmeler ve tıbbi yazışmalar kimseye gönderilmez.
Sıkça sorulan sorular
Çıkarılan dosyada bazı metinler neden eksik?
Büyük olasılıkla o sayfalar taramadır: PDF’de harflerin kendisi değil, sayfanın bir fotoğrafı vardır. Sonuç bu sayfalar için uyarı verir. Belgeyi önce OCR ile işleyin, ardından metni çıkarın.
Metin dosyası tabloları ve biçimlendirmeyi korur mu?
Hayır. Bir .txt dosyasında yazı tipi, kalın yazı veya tablo hücresi yoktur; her tablo satırı, hücreleri boşluklarla ayrılmış tek bir satıra dönüşür. Biçimlendirmeyi koruyan düzenlenebilir bir belge için PDF’den Word’e aracını kullanın.
İki sütunlu sayfalar nasıl işlenir?
Araç, metin blokları arasında sayfa boyunca aşağı inen dikey bir boşluk arar ve iki yandaki blokları sırayla okur. Tam genişlikteki başlıklar ve alt bilgiler ayırıcı görevi görür; böylece sıra doğal kalır.
Yalnızca birkaç sayfanın metnini çıkarabilir miyim?
Evet. “Sayfalar” alanına 3, 7-9 gibi sayfa ve aralıklar girin; geri kalan her şey atlanır.
Türkçe ve diğer dillerle çalışıyor mu?
Evet; PDF’nin metin olarak sakladığı her alfabe UTF-8 olarak çıkarılır. Arapça veya İbranice gibi sağdan sola yazılan diller bir istisnadır: kelimeleri ters sırada çıkabilir.
Satır sonunda tireyle bölünen kelimeler yeniden birleştiriliyor mu?
Hayır. Satır sonunda bir kelimeyi bölen tire, PDF’de nasılsa öyle kalır; çünkü araç satır sonu tiresini gerçek bir tireden her zaman ayırt edemez.
Metni çıkarmak için PDF yükleniyor mu?
Hayır. Karakterlerin okunması da metin dosyasının oluşturulması da cihazınızda, tarayıcınızın ağdan kopardığı bir çerçevenin içinde yapılır.