OCR : image, PDF & extraction de champs
Texte sélectionnable depuis une photo ou un PDF scanné, ou repérage direct des informations clés (SIRET, IBAN, dates, montants). Traitement local, sans envoi au serveur.
OCR via Tesseract.js dans le navigateur (WebAssembly). Les fichiers restent sur votre appareil ; seul le modèle de langue (~10–15 Mo) est téléchargé une fois depuis le CDN Tesseract. L’extraction de champs repose sur des validateurs mathématiques (Luhn, mod-97 IBAN), pas sur une IA cloud.
Tesseract.js (OCR open source)
- Consultation
- Traitement 100 % local
Après l’OCR, le type de document est suggéré automatiquement, puis SIRET, IBAN, dates et montants sont repérés par motifs et validés mathématiquement quand c’est possible. Aucune IA : 0 Mo de modèle supplémentaire. Relisez et corrigez le tableau avant export.
JPG, PNG ou PDF scanné. OCR 100 % local (Tesseract.js), rien n’est envoyé au serveur.
À quoi ça sert
Facture scannée, RIB, extrait Kbis : le texte est là, mais ressaisir le SIRET ou l’IBAN à la main prend du temps et multiplie les risques de typo. L’OCR reconstruit des caractères sélectionnables ; le mode « Extraction champs » va plus loin en repérant les identifiants administratifs et financiers les plus courants.
Tesseract.js tourne en WebAssembly dans votre navigateur : le document ne part pas sur un serveur d’OCR cloud. Seul le modèle de langue est téléchargé une fois (~10–15 Mo). L’extraction structurée V1 n’ajoute aucun poids : ce sont des motifs et des clés de contrôle officielles (Luhn, mod-97), pas un modèle de langage. Sur un scan flou, comptez des champs « À vérifier » : le tableau reste éditable avant export JSON ou CSV.
Méthode : Pipeline : Tesseract.js (OCR WASM) produit le texte brut ; des motifs textuels suggèrent le type de document (Facture, RIB, Kbis, Devis, Contrat, Autre) puis extraient les champs (libellés SIRET, IBAN, TTC…) avec normalisation légère des confusions OCR (0/O, 1/l). SIRET et SIREN : validation Luhn (norme INSEE). IBAN : mod-97 ISO 13616. BIC : format SWIFT 8 ou 11 caractères. Montants : formats français. Aucune inférence par modèle de langage en V1.
Questions fréquentes
Quels champs sont détectés et comment ?
Que faire si un champ n’est pas détecté ?
Pourquoi le premier lancement est-il plus long ?
Un PDF multi-pages est-il traité d’un coup ?
Relisez toujours le texte et les champs extraits avant réutilisation. Hébergé en France.