Chandra

Chandra

C'EST QUOI ?

Chandra est un modèle OCR qui transforme des images et des PDF en Markdown, HTML ou JSON tout en préservant la mise en page. C'est un modèle vision-langage : au lieu de juste extraire du texte à plat, il détecte la structure (titres, colonnes, tableaux, figures) et reconstruit un document propre. Il vient de Datalab, l'équipe derrière Marker et Surya.

POURQUOI C'EST INTÉRESSANT ?

  • Sortie structurée : Markdown, HTML ou JSON avec la disposition conservée, pas un mur de texte désordonné.
  • Solide sur le compliqué : tableaux, formules mathématiques, mises en page denses, diagrammes et légendes sont bien reconstruits.
  • Manuscrit et formulaires : reconnaissance de l'écriture cursive et des formulaires, cases à cocher comprises.
  • Multilingue : plus de 90 langues, y compris des écritures non latines (arabe, japonais, hindi, russe).
  • Plusieurs façons de le lancer : CLI (pip install chandra-ocr), en local via Hugging Face Transformers, ou sur un serveur vLLM, plus une petite app Streamlit pour tester.
  • Licence à connaître : le code est en Apache 2.0, mais les poids du modèle sont sous OpenRAIL-M (usage encadré, licence commerciale dispo). À vérifier avant un usage en prod.

CAS D'USAGE

  • Numériser des scans, PDF ou formulaires manuscrits en documents exploitables.
  • Récupérer proprement des tableaux financiers ou des papiers scientifiques chargés en maths.
  • Alimenter un pipeline RAG avec du Markdown propre plutôt que du texte OCR brut.
  • Traiter des documents multilingues sans changer d'outil selon la langue.