Ce qu’il faut décider avant le traitement
L’OCR WorkToolset s’exécute dans le navigateur. Il télécharge au premier usage les ressources nécessaires au moteur OCR, mais le document à reconnaître reste côté navigateur. Le résultat doit être relu, surtout pour les scans dégradés, tableaux ou petits caractères.
Quand cette méthode est adaptée
Récupérer le texte d’un PDF issu d’un scanner ou d’une photographie.
Créer une copie PDF recherchable à partir de pages image.
Préparer un document scanné avant traduction, recherche ou analyse textuelle.
Une procédure courte et contrôlable
1. Vérifier si une couche texte existe déjà
Essayez d’abord l’extraction de texte. Si le PDF contient déjà une couche texte exploitable, l’OCR est inutile et une extraction directe préservera mieux le contenu existant.
2. Choisir la langue et la portée
Sélectionnez la langue adaptée au document et, si l’outil le permet, limitez le traitement aux pages nécessaires pour réduire le temps de calcul.
3. Lancer l’OCR local
Le moteur analyse les images des pages dans le navigateur. La qualité dépend du scan, de l’orientation, de la résolution et de la typographie.
4. Relire avant réutilisation
Contrôlez noms propres, nombres, dates et références avant de réutiliser le texte. Une reconnaissance OCR reste probabiliste et peut produire des substitutions de caractères.
Extraction directe ou OCR ?
Ce que le guide ne doit pas vous faire oublier
- L’OCR peut confondre certains caractères, notamment dans les scans flous, inclinés ou de faible résolution.
- Une copie PDF recherchable issue de l’OCR est rasterisée et ne conserve pas nécessairement formulaires, liens interactifs ou signatures numériques.
- Les tableaux complexes et mises en page multicolonnes doivent être contrôlés après reconnaissance.
Avant de lancer le traitement
Pourquoi mon PDF n’a-t-il aucun texte à extraire ?
Un scan peut être constitué uniquement d’images. Dans ce cas, une couche texte doit être créée par OCR.
Le document est-il envoyé au serveur WorkToolset ?
Non pour l’OCR local : le moteur et ses ressources sont chargés dans le navigateur, puis le document y est traité.
L’OCR est-il toujours exact ?
Non. Il faut relire les passages importants, en particulier les nombres, noms propres et documents de qualité médiocre.
Le guide vous donne la méthode. L’outil exécute le traitement.
Travaillez sur une copie, contrôlez l’aperçu et vérifiez toujours le résultat avant diffusion ou validation métier.