Aller au contenu principal
Certyneo
Guide · PDF scanné en Word

Convertir un PDF scanné en Word modifiable

Un PDF scanné ne contient qu'une photo de chaque page : converti tel quel, il donne un document Word fait d'images, impossible à corriger. Pour obtenir du texte modifiable, il faut d'abord la reconnaissance de caractères (OCR), puis la conversion du PDF en Word. Les deux se font ici, dans votre navigateur, sans envoyer le document à personne. Ce guide explique la marche à suivre, comment préparer un scan pour qu'il soit bien lu, et comment corriger ce que la machine a mal reconnu.

Déposez votre PDF ici

ou choisissez un fichier sur votre ordinateur, votre tablette ou votre téléphone

Lecture 100 % locale : le document n'est jamais envoyé sur Internet.

Reconnaître un PDF scanné

Un PDF peut être né numérique — exporté par un traitement de texte, un logiciel de facturation ou un site — ou être la numérisation d'une feuille de papier. Le premier contient du vrai texte ; le second, une image par page. À l'écran, les deux se ressemblent.

Trois indices ne trompent pas :

  • la recherche d'un mot (Ctrl+F) ne trouve rien, alors que le mot est visible sur la page ;
  • impossible de sélectionner une phrase : la souris dessine un rectangle au lieu de surligner des mots ;
  • en zoomant fort, les lettres deviennent floues ou pixelisées au lieu de rester nettes.

C'est aussi le cas d'une photo de document prise au téléphone puis enregistrée en PDF, d'un fax, ou d'un courrier passé dans un copieur multifonction. Un même fichier peut mélanger les deux : des pages nées numériques et une annexe scannée, par exemple.

Dans le lecteur, le test le plus simple reste la recherche : ouvrez le document, tapez un mot que vous voyez sur la page. S'il n'est pas trouvé, la page est une image et la reconnaissance de caractères est nécessaire. S'il l'est, le PDF contient déjà du texte et vous pouvez passer directement à la conversion, sans OCR : le résultat sera plus fidèle, puisque la police et la mise en forme d'origine seront reprises.

Convertir un PDF scanné en Word : la méthode en deux temps

L'outil du lecteur, en haut de cette page, s'ouvre directement sur la conversion en Word. Pour un scan, commencez par la reconnaissance de caractères.

  1. Ouvrez le PDF dans le lecteur, par glisser-déposer ou depuis vos fichiers.
  2. Dans le menu des outils, choisissez « Reconnaissance de texte (OCR) ». Sélectionnez la langue du document, puis « Seulement les pages sans texte » : les pages déjà nées numériques sont laissées telles quelles.
  3. Lancez l'OCR. Comptez quelques secondes par page ; le PDF reste visuellement identique, mais son texte devient sélectionnable et cherchable.
  4. Ouvrez ensuite l'outil Convertir, laissez « Document Word (.docx) » et cliquez sur Convertir.
  5. Ouvrez le fichier .docx dans Word, LibreOffice ou Google Docs, et relisez-le avant de vous en servir.

Si vous convertissez sans passer par l'OCR, l'outil vous le signale : les pages numérisées figurent en image dans le document Word, et le message indique lesquelles. Vous pouvez alors revenir en arrière, lancer l'OCR, et convertir de nouveau.

Ce que fait l'OCR, et ce que devient le scan dans Word

La reconnaissance de caractères analyse l'image de chaque page, repère les lignes, découpe les mots et les compare aux formes des lettres de la langue choisie. Elle ajoute ensuite au PDF un calque de texte invisible, posé exactement sur les mots de l'image. Le document n'a pas changé d'aspect, mais il contient désormais du texte.

La conversion en Word lit ce texte comme celui de n'importe quel PDF : elle reconstitue les lignes, les paragraphes et, quand les colonnes sont bien alignées, les tableaux. Le document Word obtenu contient donc le texte reconnu, sans l'image du scan par-dessous. C'est ce que l'on cherche pour retravailler un contrat ancien, reprendre un courrier ou réutiliser un rapport imprimé.

Les mots dont l'OCR n'est pas assez sûre sont écartés plutôt qu'inventés : mieux vaut un mot manquant, facile à repérer à la relecture, qu'un mot faux qui passerait inaperçu.

Une conséquence à connaître : la police d'origine n'est pas connue d'un scan. Le texte prend la police par défaut du document Word ; changez-la en une fois après la conversion si vous voulez retrouver l'aspect du papier.

Préparer un scan pour une bonne reconnaissance

La qualité de la reconnaissance dépend d'abord de celle de l'image. Quelques réglages, au moment de la numérisation, évitent l'essentiel des corrections.

RéglageRecommandéPourquoi
Résolution300 points par pouceEn dessous de 200, les petites lettres se confondent ; au-dessus de 400, le fichier grossit sans gain.
CouleurNiveaux de grisPlus de nuances que le noir et blanc pur, qui abîme les lettres fines.
CadragePage droite, marges visiblesUne page de travers de plus de quelques degrés dégrade la lecture des lignes.
Éclairage (photo)Lumière uniforme, sans ombreUne ombre sur la moitié de la page efface des mots.
OriginalFeuille à plat, encre netteUn pli ou une agrafe masque des caractères.

Pour une photo prise au téléphone, les applications de numérisation qui redressent et recadrent la page automatiquement font un meilleur fichier qu'une photo brute. Vous pourrez ensuite ouvrir le PDF dans le lecteur en ligne pour vérifier sa netteté avant l'OCR.

Choisir la bonne langue de reconnaissance

L'OCR ne lit pas les lettres une à une au hasard : elle s'appuie sur un modèle entraîné pour une langue, qui connaît ses caractères, ses accents et ses mots fréquents. Un document français lu avec le modèle anglais perd ses accents et confond des lettres ; un document russe ou arabe n'est tout simplement pas lu.

Le lecteur propose 48 langues, dont l'arabe, le chinois simplifié et traditionnel, le japonais, le russe, l'hindi et la plupart des langues européennes. Il présélectionne celle de l'interface ; changez-la si votre document est écrit dans une autre langue. L'anglais est toujours ajouté en second, parce qu'un document dans n'importe quelle langue contient souvent des noms de produits, des adresses e-mail ou des termes anglais.

Le français et l'anglais sont inclus dans le lecteur. Les autres langues sont téléchargées une fois depuis certyneo.com, puis gardées par votre navigateur : seul le modèle de langue voyage, jamais votre document. Dans l'application de bureau, ces langues font partie de Certyneo Reader Pro.

Relire et corriger le document obtenu

Même sur un bon scan, une relecture s'impose : l'OCR confond parfois des formes proches. Les erreurs les plus fréquentes sont connues, ce qui permet de les chercher directement.

  • les chiffres et les lettres voisines : 0 et O, 1 et l, 5 et S, surtout dans les références et les numéros ;
  • les montants : une virgule lue comme un point, une espace de milliers disparue ;
  • les mots coupés en fin de ligne par un trait d'union, qui restent coupés en deux ;
  • les tableaux sans bordure, dont les colonnes peuvent être mal séparées ;
  • les tampons, signatures manuscrites et annotations au stylo, lus comme du texte parasite ou ignorés.

Utilisez la fonction Rechercher de votre traitement de texte pour vérifier les montants et les numéros un par un : ce sont les erreurs qui coûtent le plus. Si le document contient surtout des tableaux de chiffres, la conversion en Excel donne souvent un résultat plus facile à contrôler.

Scanner, convertir, signer : garder la valeur du document

Un document converti en Word n'est plus l'original : c'est une copie de travail. Gardez toujours le PDF scanné de départ, qui fait foi, et datez la version Word si vous la faites circuler.

Pour conserver le scan lui-même dans un format d'archivage durable, convertissez-le en PDF/A après l'OCR : le texte reconnu reste cherchable dans l'archive. Et si le document retravaillé doit être approuvé, faites-le signer électroniquement plutôt que de l'imprimer, le signer et le scanner de nouveau.

Pour les documents nés numériques, pas besoin d'OCR : notre guide sur la conversion en Word modifiable détaille ce que devient chaque élément de la page.

Questions fréquentes sur les PDF scannés

Peut-on convertir un PDF scanné en Word sans OCR ?

On obtient alors un document Word qui contient les images des pages, fidèle à l'œil mais impossible à modifier. Pour obtenir du texte, la reconnaissance de caractères est indispensable ; elle se lance en un clic dans le lecteur, avant la conversion.

Mon document scanné est-il envoyé sur Internet pour la reconnaissance ?

Non. L'OCR et la conversion tournent dans votre navigateur. Seul le modèle de la langue choisie peut être téléchargé, une fois, s'il ne s'agit ni du français ni de l'anglais ; le document, lui, ne quitte jamais votre appareil.

Combien de temps prend la reconnaissance ?

Quelques secondes par page sur un ordinateur récent, un peu plus sur un téléphone. Un document de vingt pages scannées se traite en une à deux minutes. L'option « Seulement les pages sans texte » évite de repasser les pages qui n'en ont pas besoin.

L'écriture manuscrite est-elle reconnue ?

Non, ou très mal. Les modèles de reconnaissance sont faits pour le texte imprimé. Une note manuscrite dans la marge sera ignorée ou transformée en quelques caractères parasites, à supprimer à la relecture.

Pourquoi certains mots manquent-ils dans le document Word ?

Les mots que la reconnaissance lit avec trop peu de certitude sont écartés plutôt que devinés. Un scan flou, une encre pâle ou une tache sur la page en sont la cause la plus fréquente : numériser de nouveau à 300 points par pouce règle en général le problème.

Mon scan contient plusieurs langues, que choisir ?

Choisissez la langue majoritaire du document : l'anglais est ajouté automatiquement en second. Pour un document bilingue français et allemand, par exemple, faites deux passages si l'une des deux parties est mal reconnue, en changeant la langue entre les deux.

Le dossier « convertir un PDF »

Les autres guides de la conversion de PDF, pour chaque type de document.

Transformez votre scan en document modifiable

OCR puis conversion en Word, dans votre navigateur. Gratuit, sans inscription, sans envoi du fichier.