C'EST QUOI ?
Unstract prend des documents non structurés - PDF, scans, images, DOCX, feuilles de calcul - et en sort du JSON propre en s'appuyant sur des LLM. Tu décris ce que tu veux extraire en langage naturel dans le Prompt Studio, puis tu déploies le résultat en API REST ou en pipeline ETL vers ton entrepôt de données. L'objectif : remplacer les templates par fournisseur et les regex maison par un prompt unique qui encaisse les variations de mise en page.
POURQUOI C'EST INTÉRESSANT ?
- Prompt Studio, pas de templates : le schéma d'extraction se définit en langage naturel, avec test en direct sur des documents réels. Un nouveau type de facture ne demande plus des jours de dev.
- Deux modes de déploiement : soit une API REST à qui tu postes un fichier et qui te renvoie du JSON, soit un pipeline ETL qui va chercher les documents dans un bucket et charge le résultat en base.
- Agnostique au provider LLM : OpenAI, Anthropic, Bedrock, Gemini, Mistral, Ollama en local. Tu changes de modèle sans réécrire les prompts, et tu peux rester on-premise.
- Connectique déjà branchée : S3, MinIO, GCS, Azure Blob, Google Drive, Dropbox, SFTP en entrée ; Snowflake, BigQuery, Redshift, PostgreSQL, MySQL, SQL Server en sortie.
- Serveur MCP et nœud n8n : l'extraction s'expose aux agents IA via Model Context Protocol, ou s'insère directement dans un workflow n8n existant.
- Self-hosted en une commande :
./run-platform.shmonte la stack complète en Docker Compose. Django, Celery, FastAPI, PostgreSQL, Redis et RabbitMQ, sans assemblage manuel.
CAS D'USAGE
- Extraction automatique de factures fournisseurs hétérogènes vers un ERP, sans template par émetteur.
- Traitement de dossiers KYC et de pièces d'identité en conformité, avec sortie JSON auditable.
- Ingestion de contrats et de polices d'assurance dans un entrepôt de données pour analyse.
- Numérisation de comptes rendus médicaux ou de formulaires fiscaux vers une base structurée.
- Outillage d'un agent IA maison qui interroge un corpus documentaire via le serveur MCP.
À SAVOIR
Le cœur est en AGPL-3.0, mais plusieurs fonctions d'accuracy et d'exploitation restent réservées aux offres Cloud et Enterprise : vérification par double LLM (LLMChallenge), extraction SinglePass pour réduire les coûts de tokens, interface de revue humaine, SSO et RBAC. Le socle libre reste utilisable en production, il faut juste savoir où passe la ligne. Prévoir 8 Go de RAM minimum.
