Aller au contenu

OCR PDF : extraire le texte d’un PDF scanné

xFormat.space fait l’OCR des PDF scannés dans votre navigateur, en effectuant le rendu de chaque page puis en la lisant avec un modèle de reconnaissance local, pour obtenir le texte page par page sans envoyer le document.

Fonctionne dans votre navigateur : vos fichiers ne quittent jamais votre appareil.

Comment ça marche

Si vous ne pouvez pas sélectionner ni copier le texte d’un PDF, c’est sans doute un scan, c’est-à-dire de simples images de pages. Cet outil effectue le rendu de chaque page, reconnaît le texte en local sur votre appareil et vous rend du texte brut à copier ou enregistrer. Le PDF ne quitte jamais votre ordinateur.

  1. 1

    Déposez un PDF scanné sur la page et ouvrez l’OCR.

  2. 2

    Choisissez la langue du document.

  3. 3

    Cliquez sur Lancer la reconnaissance, attendez la fin de toutes les pages, puis copiez le texte ou téléchargez-le en fichier TXT.

Ce que vous obtenez, et ce que vous n’obtenez pas

Le résultat est du texte brut, chaque page étant marquée par une ligne « --- Page N --- », avec un score de confiance et le nombre de zones de texte. Ce n’est pas un PDF consultable : l’outil n’ajoute pas de couche de texte invisible dans le fichier, et votre PDF d’origine reste tel quel. Si votre PDF permet déjà de sélectionner le texte, vous n’avez pas besoin d’OCR : copiez-le directement.

Conseils de précision pour les PDF scannés

Les pages sont rendues à l’échelle 2x avant la reconnaissance : la qualité du scan fixe donc le plafond. Un scan d’environ 300 dpi, bien droit et bien contrasté, se lit bien mieux qu’un scan de travers, grisâtre ou en basse résolution. Choisissez la bonne langue : chinois et anglais, anglais, japonais, coréen, français et allemand sont des choix séparés, un seul par analyse. Les tableaux, colonnes et notes de bas de page sont lus comme des lignes de texte : la mise en page n’est pas conservée et il faudra peut-être remettre de l’ordre.

Le traitement se fait sur votre appareil, une page à la fois : les longs documents prennent du temps, selon votre matériel et le nombre de pages. Laissez l’onglet ouvert jusqu’à la fin. La première analyse télécharge le modèle, environ 15 MB, ensuite gardé en cache. Relisez les noms, les chiffres et tout ce qui est important.

Questions fréquentes

Comment extraire le texte d’un PDF scanné ?

Sur xFormat.space, déposez le PDF sur la page, choisissez la langue du document et cliquez sur Lancer la reconnaissance. Le texte apparaît page par page, à copier ou à télécharger en fichier TXT.

Est-ce que ça crée un PDF consultable (texte sélectionnable) ?

Non. L’outil produit uniquement du texte brut et n’ajoute pas de couche de texte à votre PDF. Votre fichier d’origine n’est pas modifié.

Mon PDF scanné est-il envoyé sur un serveur ?

Non. Le rendu et la reconnaissance des pages se font dans votre navigateur. Seul le modèle de reconnaissance de texte est téléchargé, environ 15 MB la première fois, et le PDF reste sur votre appareil.

Quelles langues fonctionnent pour l’OCR PDF ?

Chinois et anglais (chinois traditionnel compris), anglais, japonais, coréen, français et allemand, une langue par analyse.

Pourquoi mon résultat OCR est-il imprécis ?

Le plus souvent à cause du scan : basse résolution, pages de travers, ombres ou mauvaise langue. Utilisez un scan net d’environ 300 dpi, vérifiez que la langue correspond, et relisez le résultat.