Aller au contenu
Assistance informatique · ConseilsParis et communes desservies

Guide pratique

Comment extraire le texte d'une image ou d'un PDF ?

Par Frédéric HourdeauMis à jour le

Documents et bureautique — guide pratique

Une photo, une page scannée ou certains PDF contiennent des pixels, pas des caractères directement modifiables. La reconnaissance optique de caractères, ou OCR, analyse l’image pour proposer du texte que l’on peut copier, rechercher ou corriger.

L’OCR évite une ressaisie complète, mais il ne garantit pas un résultat exact. Les noms propres, montants, dates, références, tableaux et caractères peu lisibles doivent toujours être comparés au document d’origine.

Vérifier d’abord si l’OCR est nécessaire

Ouvrez le PDF dans votre lecteur habituel et essayez de sélectionner quelques mots avec la souris.

  • si chaque mot peut être sélectionné et copié, le document contient déjà une couche de texte ;
  • si toute la page se sélectionne comme une seule image, un OCR est nécessaire ;
  • si seuls certains éléments sont sélectionnables, le PDF peut mélanger texte, images et pages scannées ;
  • si la copie produit des caractères incohérents, la police intégrée ou l’encodage peut poser problème.

Collez un court extrait dans un document vierge avant de convertir tout le fichier. Vous éviterez une opération inutile et verrez immédiatement si les accents, espaces et retours à la ligne sont conservés.

Un PDF protégé peut interdire la copie ou la modification. Ne cherchez pas à contourner une protection si vous n’avez pas l’autorisation du propriétaire.

Choisir la méthode selon le besoin

Sur un petit écran, faites défiler le tableau horizontalement.

Situation Méthode adaptée
Quelques lignes visibles à l’écran sous Windows 11 Outil Capture d’écran et Actions de texte
Une image ou un PDF inséré dans des notes Office OCR de OneNote
Petit PDF ou fichier image non confidentiel déjà destiné à Google Drive Ouverture avec Google Docs
PDF composé principalement de vrai texte Ouverture d’une copie dans Word
Nombreuses pages, tableaux ou traitement régulier Logiciel OCR dédié et essai sur un échantillon
Document sensible ou soumis à une règle interne Solution locale ou service expressément autorisé

Le meilleur choix dépend autant de la confidentialité, du volume et de la mise en page que de la qualité de reconnaissance.

Méthode rapide avec l’Outil Capture d’écran de Windows 11

Pour copier quelques lignes affichées à l’écran :

  1. ouvrez l’image ou la page du PDF avec un zoom suffisant ;
  2. appuyez sur Windows + Maj + S ;
  3. encadrez uniquement la zone de texte utile ;
  4. ouvrez la capture dans l’Outil Capture d’écran ;
  5. cliquez sur Actions de texte ;
  6. sélectionnez les mots souhaités ou choisissez Copier tout le texte ;
  7. collez le résultat dans Word, le Bloc-notes ou l’application cible ;
  8. relisez-le face à l’image.

Microsoft indique que la reconnaissance des Actions de texte est effectuée localement sur l’appareil. Cette méthode est donc pratique pour un extrait ponctuel et évite de téléverser l’image dans un service d’OCR en ligne.

Recadrez serré, agrandissez le texte et remettez la page à l’endroit. Une barre d’outils, une photo ou une colonne voisine dans la capture peut perturber l’ordre de lecture.

La fonction de masquage rapide des adresses électroniques et numéros de téléphone aide à préparer une capture, mais le résultat doit être contrôlé manuellement avant partage : aucun masquage automatique ne remplace la vérification visuelle de toutes les données sensibles.

Conserver la méthode OneNote pour les images et impressions PDF

OneNote reste capable d’extraire du texte d’une image ou d’une impression de fichier :

  1. insérez l’image dans une page OneNote ;
  2. pour un PDF, insérez-le sous forme d’impression afin d’obtenir les pages ;
  3. faites un clic droit sur l’image ;
  4. choisissez Copier le texte de l’image ;
  5. pour une impression multipage, choisissez le texte de la page ou de toutes les pages ;
  6. collez le résultat dans un document séparé et corrigez-le.

Cette méthode reprend l’idée utile de l’ancien article AIService de 2013. Les anciens chemins de menus ne sont toutefois plus conservés, car ils dépendaient d’une version d’Office de l’époque.

Microsoft précise que l’option peut ne pas apparaître immédiatement pendant l’analyse et que certains résultats peuvent prendre du temps. La qualité dépend fortement de la lisibilité de l’image. OneNote convient donc à une récupération pratique, pas à la validation automatique d’un document contractuel ou comptable.

Convertir un petit fichier avec Google Drive

Google Drive peut ouvrir une image ou un PDF avec Google Docs afin d’en extraire le texte :

  1. importez le fichier dans un espace Drive autorisé ;
  2. faites un clic droit dessus ;
  3. choisissez Ouvrir avec > Google Docs ;
  4. laissez Google créer un document contenant l’image et le texte reconnu ;
  5. comparez le résultat au fichier d’origine avant de le réutiliser.

Pour obtenir de bons résultats, Google recommande un fichier de 2 Mo ou moins, correctement orienté, net et bien contrasté. Cette conversion accepte notamment les PDF multipages et les images JPEG, PNG et GIF. Relisez le texte obtenu en le comparant à l’original, particulièrement les chiffres et les tableaux.

Les caractères gras, italiques, tailles et sauts de ligne peuvent être conservés, mais les listes, tableaux, colonnes, notes de bas de page et notes de fin sont moins susceptibles d’être reconnus correctement.

Cette solution envoie le fichier dans le compte Google utilisé. Pour un document médical, juridique, social, bancaire, client ou interne à une entreprise, vérifiez au préalable que ce stockage et ce traitement sont autorisés. N’utilisez pas un compte personnel ou un service en ligne choisi au hasard pour des données professionnelles confidentielles.

Ouvrir un PDF textuel dans Word

La version de bureau de Word peut ouvrir un PDF et créer une copie convertie en document modifiable :

  1. dans Word, choisissez Fichier > Ouvrir ;
  2. sélectionnez le PDF ;
  3. acceptez la création d’une copie convertie ;
  4. enregistrez le résultat sous un nouveau nom ;
  5. vérifiez la mise en page et le texte.

Microsoft précise que la conversion fonctionne mieux avec des documents principalement composés de texte. Si la page contient surtout des graphiques, elle peut être importée comme une image non modifiable. Word ne doit donc pas être présenté comme un OCR universel.

Conservez toujours le PDF original. Ne remplacez pas une archive ou une pièce reçue par sa version Word, qui n’a ni la même mise en page ni nécessairement la même valeur documentaire.

Améliorer la qualité avant reconnaissance

La qualité de l’entrée est souvent plus importante que le choix du logiciel.

  • placez le document à plat ;
  • utilisez une lumière homogène sans reflet ni ombre ;
  • photographiez perpendiculairement à la page ;
  • cadrez toute la zone utile ;
  • faites la mise au point sur le texte ;
  • choisissez une résolution suffisante sans compression excessive ;
  • tournez chaque page dans le bon sens ;
  • augmentez légèrement le contraste si le papier est jauni ;
  • évitez le zoom numérique du téléphone ;
  • sélectionnez la bonne langue dans l’outil lorsqu’il le permet.

Pour un document long, numérisez d’abord deux pages représentatives : une page simple et la plus difficile. Mesurez le temps de correction avant de traiter l’ensemble.

Une résolution plus élevée ne corrige pas un flou de mouvement, une page courbée ou un reflet. Reprendre proprement la photo est souvent plus rapide que corriger des centaines d’erreurs.

Reconnaître les erreurs typiques

L’OCR confond facilement :

  • 0, O et Q ;
  • 1, I, l et | ;
  • les virgules et points dans les nombres ;
  • les tirets, apostrophes et guillemets ;
  • les accents et ligatures ;
  • les tableaux et colonnes ;
  • les mots coupés en fin de ligne ;
  • les en-têtes, pieds de page et numéros de page ;
  • l’ordre des paragraphes dans une mise en page complexe.

Un texte qui paraît correct peut contenir une seule erreur critique. Pour une facture, contrôlez les montants, la devise, les dates, le numéro de facture, le SIREN ou SIRET, l’IBAN et les coordonnées. Pour un contrat, vérifiez les noms, obligations, délais, négations et signatures. Pour un dossier médical, faites relire chaque terme et valeur par la personne compétente.

N’utilisez pas un résultat OCR comme preuve que le document original dit exactement la même chose.

Traiter les tableaux et formulaires

Un tableau n’est pas seulement une suite de mots : la ligne et la colonne donnent le sens. Un OCR peut reconnaître chaque nombre tout en le plaçant sous le mauvais intitulé.

Pour un petit tableau, il est souvent plus sûr de recréer la structure puis de reporter les valeurs en les contrôlant ligne par ligne. Pour un gros volume, choisissez un outil capable d’exporter les cellules, testez plusieurs pages et définissez des contrôles : totaux, nombre de lignes, format des dates et valeurs manquantes.

Les cases cochées, signatures, annotations manuscrites, tampons et zones de formulaire doivent rester associés à l’image originale. Leur interprétation automatique est particulièrement fragile.

Si le but est l’accessibilité, une simple couche OCR ne suffit pas toujours. Le PDF doit aussi disposer d’un ordre de lecture, de titres, d’une langue, de descriptions utiles et d’une structure vérifiée.

Documents manuscrits et mauvaise impression

La reconnaissance de l’écriture manuscrite est moins prévisible que celle d’un texte imprimé. Testez quelques lignes et prévoyez une transcription manuelle contrôlée pour les noms, chiffres et passages ambigus.

Sur une photocopie pâle ou un fax :

  • numérisez en niveaux de gris plutôt qu’avec un noir et blanc trop agressif ;
  • redressez la page ;
  • éliminez les bordures sombres sans couper le texte ;
  • conservez une version non retouchée ;
  • comparez le résultat à plusieurs niveaux de zoom.

Ne « corrigez » pas automatiquement une faute apparente dans un nom ou une référence. L’objectif est d’abord de transcrire fidèlement, puis de signaler séparément les anomalies.

Confidentialité et services d’IA

Un OCR en ligne ou une intelligence artificielle peut impliquer l’envoi du document à un prestataire. Avant de l’utiliser, vérifiez :

  • quel compte reçoit le fichier ;
  • où il est stocké et pendant combien de temps ;
  • si le contenu peut être utilisé pour améliorer un service ;
  • quels sous-traitants interviennent ;
  • comment supprimer le fichier et l’historique ;
  • si le contrat de l’entreprise autorise ce traitement ;
  • si des données personnelles ou soumises au secret doivent être masquées.

Ne collez pas un document client complet dans un assistant grand public simplement parce qu’il sait lire une image. Pour un extrait sensible, privilégiez une fonction locale, un outil professionnel validé ou un environnement contractuellement autorisé.

Le texte extrait reste une donnée à protéger. En le copiant dans un courriel, un tableur ou un document partagé, vous pouvez créer de nouvelles copies plus difficiles à suivre que le PDF d’origine.

Organiser un traitement de plusieurs documents

Pour un lot récurrent :

  1. définir les types de documents et les champs utiles ;
  2. séparer les originaux, les fichiers préparés et les résultats ;
  3. attribuer un identifiant stable à chaque document ;
  4. traiter un échantillon représentatif ;
  5. mesurer les erreurs et le temps de correction ;
  6. fixer les contrôles obligatoires ;
  7. journaliser les rejets et corrections ;
  8. limiter les accès et la durée de conservation ;
  9. conserver l’original selon les obligations applicables ;
  10. valider avant d’automatiser l’import dans un logiciel métier.

L’automatisation n’est rentable que si le contrôle coûte moins cher que la ressaisie et si les erreurs résiduelles sont acceptables pour l’usage prévu.

Liste de contrôle avant utilisation du texte

  • le document original est conservé ;
  • la méthode est autorisée pour son niveau de confidentialité ;
  • toutes les pages attendues sont présentes ;
  • la langue et l’orientation sont correctes ;
  • noms, dates, montants et références ont été relus ;
  • l’ordre des colonnes et paragraphes a été vérifié ;
  • les signatures, cases et annotations restent visibles dans l’original ;
  • le fichier de sortie porte un nom différent ;
  • les copies temporaires inutiles sont supprimées selon la procédure prévue.

Besoin de convertir un document sans perdre sa structure ?

AIService peut choisir une méthode adaptée, améliorer les numérisations, extraire et remettre en forme le texte, puis organiser les contrôles avant import dans Word, Excel ou un logiciel métier. Pour des documents sensibles ou un traitement régulier, le choix tient compte des accès, de la confidentialité et de la conservation des originaux.

Demander une aide pour convertir un document

Découvrir la formation et l'accompagnement

Pour continuer

Sources officielles

Ces ressources officielles complètent les explications du guide. Les interfaces et les conditions des services peuvent évoluer.