C'EST QUOI ?
Falcon-Perception est un moteur d'inférence PyTorch pour modèles multimodaux vision-langage. Il exécute des tâches de vision par ordinateur - détection d'objets, segmentation d'instances, OCR - pilotées par des requêtes en langage naturel. L'idée : une implémentation minimale et lisible, mais réellement performante, d'un Transformer autorégressif qui comprend images et texte ensemble.
POURQUOI C'EST INTÉRESSANT ?
- KV cache paginé : gestion mémoire GPU efficace avec batching continu, sans implémentation d'attention maison.
- CUDA graph capture : élimine l'overhead de lancement des kernels pour des inférences plus rapides.
- Vision pilotée par le texte : détection et segmentation à partir d'une simple requête en langage naturel, plus OCR en mode brut ou conscient de la mise en page.
- Backend MLX : support natif d'Apple Silicon en plus de CUDA, donc utilisable sur Mac.
- Prêt pour la prod : serveur API REST multi-GPU, préemption en environnement mémoire contraint, tokenisation en arrière-plan via pool de threads CPU.
- Code lisible : pensé pour être étudié et modifié, pas une boîte noire optimisée à outrance.
CAS D'USAGE
- Extraire du texte structuré de documents scannés ou de captures d'écran avec OCR conscient de la mise en page.
- Détecter et segmenter des objets dans une image en décrivant simplement ce qu'on cherche.
- Servir un modèle vision-langage en production derrière une API REST multi-GPU.
- Prototyper rapidement via l'interface web Streamlit fournie.
- Benchmarker des modèles de perception visuelle sur plusieurs échantillons.
