Outils · Documents

OCR : image, PDF & extraction de champs

Texte sélectionnable depuis une photo ou un PDF scanné, ou repérage direct des informations clés (SIRET, IBAN, dates, montants). Traitement local, sans envoi au serveur.

OCR via Tesseract.js dans le navigateur (WebAssembly). Les fichiers restent sur votre appareil ; seul le modèle de langue (~10–15 Mo) est téléchargé une fois depuis le CDN Tesseract. L’extraction de champs repose sur des validateurs mathématiques (Luhn, mod-97 IBAN), pas sur une IA cloud.

La précision dépend de la qualité et de la netteté du document source : relisez le texte extrait avant usage. En mode champs, relisez chaque valeur avant saisie comptable, virement ou dossier administratif.

Tesseract.js (OCR open source)

Consultation
Traitement 100 % local

Après l’OCR, le type de document est suggéré automatiquement, puis SIRET, IBAN, dates et montants sont repérés par motifs et validés mathématiquement quand c’est possible. Aucune IA : 0 Mo de modèle supplémentaire. Relisez et corrigez le tableau avant export.

JPG, PNG ou PDF scanné. OCR 100 % local (Tesseract.js), rien n’est envoyé au serveur.

À quoi ça sert

Facture scannée, RIB, extrait Kbis : le texte est là, mais ressaisir le SIRET ou l’IBAN à la main prend du temps et multiplie les risques de typo. L’OCR reconstruit des caractères sélectionnables ; le mode « Extraction champs » va plus loin en repérant les identifiants administratifs et financiers les plus courants.

Tesseract.js tourne en WebAssembly dans votre navigateur : le document ne part pas sur un serveur d’OCR cloud. Seul le modèle de langue est téléchargé une fois (~10–15 Mo). L’extraction structurée V1 n’ajoute aucun poids : ce sont des motifs et des clés de contrôle officielles (Luhn, mod-97), pas un modèle de langage. Sur un scan flou, comptez des champs « À vérifier » : le tableau reste éditable avant export JSON ou CSV.

Méthode : Pipeline : Tesseract.js (OCR WASM) produit le texte brut ; des motifs textuels suggèrent le type de document (Facture, RIB, Kbis, Devis, Contrat, Autre) puis extraient les champs (libellés SIRET, IBAN, TTC…) avec normalisation légère des confusions OCR (0/O, 1/l). SIRET et SIREN : validation Luhn (norme INSEE). IBAN : mod-97 ISO 13616. BIC : format SWIFT 8 ou 11 caractères. Montants : formats français. Aucune inférence par modèle de langage en V1.

Questions fréquentes

Quels champs sont détectés et comment ?
En mode « Extraction champs », l’outil suggère d’abord un type de document (Facture, RIB, Kbis, Devis, Contrat ou Autre) à partir de mots-clés et d’en-têtes typiques : cette suggestion reste toujours modifiable dans le menu déroulant. Il repère ensuite SIRET (14 chiffres), SIREN (9 chiffres), IBAN, BIC/SWIFT, dates au format français et montants HT/TTC. Chaque valeur passe d’abord par des motifs textuels, puis par un validateur mathématique quand il existe : clé de Luhn pour SIRET et SIREN (norme INSEE), contrôle mod-97 pour l’IBAN (ISO 13616). Un badge « Validé » signifie que la clé de contrôle est correcte ; « À vérifier » indique un motif détecté mais non validé (OCR bruité ou caractère manquant).
Que faire si un champ n’est pas détecté ?
Remplissez la ligne à la main dans le tableau : l’export JSON ou CSV reste disponible dès qu’au moins un champ contient une valeur. Aucune erreur bloquante : les lignes vides sont normales sur un document qui ne contient pas ce type d’information (un RIB sans SIRET, par exemple).
Pourquoi le premier lancement est-il plus long ?
Tesseract.js charge un modèle de langue (~10–15 Mo) depuis le CDN au premier usage, puis le navigateur le met en cache. Les pages suivantes sont plus rapides. Le fichier image ou PDF, lui, ne quitte pas votre appareil. L’extraction de champs n’ajoute aucun modèle supplémentaire.
Un PDF multi-pages est-il traité d’un coup ?
Le traitement se fait page par page dans le navigateur (WebAssembly). Sur un gros scan, comptez quelques secondes par page et laissez l’onglet ouvert jusqu’à la fin. Les champs sont recherchés dans l’ensemble du texte fusionné.

Relisez toujours le texte et les champs extraits avant réutilisation. Hébergé en France.

Partager