PDF OCR: Taranmış PDF'yi Metne Çevirme
xFormat.space, taranmış PDF'lerde tarayıcının içinde OCR çalıştırır; her sayfayı işleyip cihaz üzerindeki bir tanıma modeliyle okur, böylece belgeyi yüklemeden sayfa sayfa metin elde edersin.
Tarayıcında çalışır; dosyaların cihazından çıkmaz.
Nasıl kullanılır
Bir PDF'de metni seçemiyor ya da kopyalayamıyorsan muhtemelen bu bir taramadır, yani sayfaların resimlerinden ibarettir. Bu araç her sayfayı işler, üzerindeki metni cihazında yerel olarak tanır ve kopyalayabileceğin ya da kaydedebileceğin düz metin verir. PDF bilgisayarından hiç çıkmaz.
- 1
Taranmış bir PDF'yi sayfaya sürükle ve OCR'yi aç.
- 2
Belgenin dilini seç.
- 3
Tanımayı Başlat'a tıkla, her sayfanın bitmesini bekle, sonra metni kopyala ya da TXT dosyası olarak indir.
Ne elde edersin, ne etmezsin?
Çıktı düz metindir; her sayfa "--- Sayfa N ---" satırıyla işaretlenir, ayrıca bir güven puanı ve metin bölgesi sayısı verilir. Aranabilir bir PDF değildir: araç dosyaya gizli bir metin katmanı yazmaz, yani orijinal PDF'n olduğu gibi kalır. PDF'n zaten metin seçmene izin veriyorsa OCR'ye hiç gerek yok; doğrudan kopyala.
Taranmış PDF'lerde doğruluk ipuçları
Sayfalar tanımadan önce 2 kat ölçekte işlenir; bu yüzden taramanın kalitesi tavanı belirler. Yaklaşık 300 dpi, düz ve yüksek kontrastlı bir tarama, eğik, gri ya da düşük çözünürlüklü bir taramadan çok daha iyi okunur. Doğru dili seç; Çince ve İngilizce, İngilizce, Japonca, Korece, Fransızca ve Almanca ayrı seçeneklerdir ve her çalıştırmada yalnızca birini kullanabilirsin. Tablolar, sütunlar ve dipnotlar metin satırları olarak okunur; düzen korunmaz ve sırayı toparlaman gerekebilir.
İşlem cihazında, her seferinde bir sayfa olmak üzere yapılır; uzun belgeler biraz zaman alır ve süre donanımına ve sayfa sayısına bağlıdır. Bitene kadar sekmeyi açık tut. İlk çalıştırma yaklaşık 15 MB'lık modeli indirir, sonra önbelleğe alınır. İsimleri, sayıları ve önemli her şeyi gözden geçir.
Sık sorulan sorular
Taranmış bir PDF'deki metni nasıl çıkarırım?
xFormat.space'te PDF'yi sayfaya bırak, belgenin dilini seç ve Tanımayı Başlat'a tıkla. Metin sayfa sayfa görünür; kopyalayabilir ya da TXT dosyası indirebilirsin.
Bu araç aranabilir bir PDF oluşturuyor mu?
Hayır. Yalnızca düz metin verir ve PDF'ne metin katmanı eklemez. Orijinal dosyan değişmeden kalır.
Taranmış PDF'm bir sunucuya yükleniyor mu?
Hayır. Sayfalar tarayıcında işlenir ve tanınır. Yalnızca metin tanıma modeli indirilir (ilk seferde yaklaşık 15 MB) ve PDF cihazında kalır.
PDF OCR için hangi diller çalışıyor?
Çince ve İngilizce (geleneksel Çince dahil), İngilizce, Japonca, Korece, Fransızca ve Almanca; her çalıştırmada bir dil.
OCR sonucum neden hatalı?
Genellikle sebep taramadır: düşük çözünürlük, eğik sayfalar, gölgeler ya da yanlış dil. Yaklaşık 300 dpi'lik net bir tarama kullan, dilin eşleştiğinden emin ol ve çıktıyı gözden geçir.