C'EST QUOI ?
Chandra est un modèle OCR qui transforme des images et des PDF en Markdown, HTML ou JSON tout en préservant la mise en page. C'est un modèle vision-langage : au lieu de juste extraire du texte à plat, il détecte la structure (titres, colonnes, tableaux, figures) et reconstruit un document propre. Il vient de Datalab, l'équipe derrière Marker et Surya.
POURQUOI C'EST INTÉRESSANT ?
- Sortie structurée : Markdown, HTML ou JSON avec la disposition conservée, pas un mur de texte désordonné.
- Solide sur le compliqué : tableaux, formules mathématiques, mises en page denses, diagrammes et légendes sont bien reconstruits.
- Manuscrit et formulaires : reconnaissance de l'écriture cursive et des formulaires, cases à cocher comprises.
- Multilingue : plus de 90 langues, y compris des écritures non latines (arabe, japonais, hindi, russe).
- Plusieurs façons de le lancer : CLI (
pip install chandra-ocr), en local via Hugging Face Transformers, ou sur un serveur vLLM, plus une petite app Streamlit pour tester. - Licence à connaître : le code est en Apache 2.0, mais les poids du modèle sont sous OpenRAIL-M (usage encadré, licence commerciale dispo). À vérifier avant un usage en prod.
CAS D'USAGE
- Numériser des scans, PDF ou formulaires manuscrits en documents exploitables.
- Récupérer proprement des tableaux financiers ou des papiers scientifiques chargés en maths.
- Alimenter un pipeline RAG avec du Markdown propre plutôt que du texte OCR brut.
- Traiter des documents multilingues sans changer d'outil selon la langue.
