OCR multilingue : choisir la langue de reconnaissance

Pour extraire du texte en chinois, en japonais, en coréen ou dans une autre langue prise en charge, ouvrez l’outil Image en texte et sélectionnez la langue de l’image. L’anglais est sélectionné par défaut, quelle que soit la langue du site. Il n’existe ni détection automatique de la langue ni option permettant de combiner plusieurs langues de reconnaissance.
Langues disponibles
Les 15 choix proposés sont l’anglais, le chinois simplifié, le chinois traditionnel, le japonais, le coréen, le français, l’allemand, l’espagnol, l’italien, le portugais, le russe, l’arabe, l’hindi, le thaï et le vietnamien. Une langue absente de cette liste n’est pas disponible sur la page actuelle.
Reconnaissance de texte sur une image
- Sélectionnez un fichier JPG/JPEG, PNG, WebP, GIF, BMP ou TIFF. L’envoi vers le serveur commence dès que vous sélectionnez l’image.
- Choisissez la langue de reconnaissance et, pour le chinois, le système d’écriture correspondant.
- Une fois l’envoi terminé, cliquez sur « Extraire le texte » pour lancer la reconnaissance sur le serveur.
- Comparez le résultat à l’image source. Copiez-le ou téléchargez le fichier TXT encodé en UTF-8 ; collez le texte dans un éditeur pour le corriger.
Pour un contenu PDF, utilisez d’abord PDF en images, puis lancez la reconnaissance séparément sur chaque image de page nécessaire.
Limites des fichiers d’entrée
Chaque tâche accepte une seule image de 20 Mo maximum. Chaque côté doit mesurer au plus 8192 px, et le produit largeur × hauteur ne doit pas dépasser 25 millions de pixels. Seule la première image d’un GIF ou la première page d’un TIFF multipage est reconnue. Toutes ces limites s’appliquent simultanément.
Conseils pour l’OCR des langues asiatiques
OCR chinois
Choisissez le chinois simplifié ou traditionnel selon la source. Vérifiez les caractères qui se ressemblent, la ponctuation et les noms en les comparant à l’image. Gardez tous les traits bien visibles, sans réduire l’image au point de rendre les caractères denses indissociables.
OCR japonais
Choisissez le japonais pour un texte contenant des kanjis, des hiraganas et des katakanas. Les petits furiganas peuvent être confondus avec la ligne principale ; vérifiez leur position et l’ordre de lecture. Les colonnes verticales et les mentions en anglais mêlées au texte nécessitent une relecture et peuvent demander des recadrages séparés.
OCR coréen
Choisissez le coréen et vérifiez les espaces entre les blocs syllabiques du hangeul. Utilisez une source nette pour que les traits restent distincts. Les noms de marques en anglais ou les nombres présents dans la même image doivent aussi être vérifiés ; aucune précision n’est garantie lorsque plusieurs systèmes d’écriture sont mélangés.
Conseils pour obtenir de meilleurs résultats
Qualité de l’image
Les images nettes et en haute résolution donnent les meilleurs résultats, quelle que soit la langue.
Lisibilité de la police
Les polices classiques sont mieux reconnues que les polices décoratives.
Contraste avec l’arrière-plan
Un contraste élevé entre le texte et l’arrière-plan améliore la précision.
Taille du texte
Assurez-vous que les caractères sont assez grands pour être clairement lisibles.
Cas d’usage courants
Préparer une traduction
Extrayez du texte dans une langue étrangère pour l’utiliser avec un service de traduction.
Numériser des documents
Convertissez des documents imprimés dans une langue étrangère en texte numérique.
Photos de voyage
Extrayez le texte de panneaux, de menus et de documents pendant vos voyages.
Recherche
Récupérez le texte de sources universitaires en langue étrangère.
Documents professionnels
Traitez des échanges professionnels et des contrats multilingues.
Langues mélangées et mises en page complexes
Pour une page contenant plusieurs langues, choisissez la langue principale et vérifiez chaque partie. La reconnaissance des autres systèmes d’écriture n’est pas garantie. Vous pouvez isoler différentes zones de texte avec l’outil Recadrer une image, puis les traiter séparément en choisissant une langue différente pour chacune.
Veillez à ce que les caractères soient nets et bien droits. L’écriture manuscrite, le texte vertical, les polices décoratives, les petites annotations et les colonnes peuvent nécessiter des corrections. L’outil produit du texte brut, pas un document traduit, un tableau mis en forme ou un PDF avec recherche textuelle.
Vérifiez vous-même la précision
Il n’existe pas de pourcentage de précision fixe pour une langue donnée. La qualité de l’image, les caractères et la mise en page influencent chaque résultat. Le score de confiance du modèle affiché ne correspond pas à un pourcentage mesuré de caractères correctement reconnus. Vérifiez les noms, les dates, les montants, la ponctuation et l’ordre de lecture en les comparant à la source.
Résoudre les problèmes
Si le résultat utilise le mauvais système d’écriture, vérifiez d’abord la langue sélectionnée : l’outil ne la détecte pas automatiquement. Si des caractères manquent, examinez la netteté de la source, le contraste et les limites du recadrage. Séparez les colonnes denses ou les petites annotations si cela peut aider. Retestez le même court extrait après chaque modification pour en évaluer l’effet ; renvoyer plusieurs fois un original illisible a peu de chances de résoudre le problème de fond.
Questions fréquentes
Choisir le japonais traduit-il le texte ?
Non. Ce choix sélectionne un modèle de reconnaissance ; le résultat reste dans la langue source.
Que faire si la langue est absente ou si le résultat est mauvais ?
Utilisez une méthode compatible avec la langue ou la mise en page concernée. Pour les langues prises en charge, essayez une source plus nette ou un recadrage plus serré, puis relisez à nouveau le résultat.
D’autres outils pour vos prochains travaux sur les images
Découvrez les outils ImgConvert pour la conversion, les fichiers PDF et les GIF.
- Convertisseurs d’images
- Outils PDF
- Outils GIF