Falcon-Perception

Falcon-Perception

C'EST QUOI ?

Falcon-Perception est un moteur d'inférence PyTorch pour modèles multimodaux vision-langage. Il exécute des tâches de vision par ordinateur - détection d'objets, segmentation d'instances, OCR - pilotées par des requêtes en langage naturel. L'idée : une implémentation minimale et lisible, mais réellement performante, d'un Transformer autorégressif qui comprend images et texte ensemble.

POURQUOI C'EST INTÉRESSANT ?

  • KV cache paginé : gestion mémoire GPU efficace avec batching continu, sans implémentation d'attention maison.
  • CUDA graph capture : élimine l'overhead de lancement des kernels pour des inférences plus rapides.
  • Vision pilotée par le texte : détection et segmentation à partir d'une simple requête en langage naturel, plus OCR en mode brut ou conscient de la mise en page.
  • Backend MLX : support natif d'Apple Silicon en plus de CUDA, donc utilisable sur Mac.
  • Prêt pour la prod : serveur API REST multi-GPU, préemption en environnement mémoire contraint, tokenisation en arrière-plan via pool de threads CPU.
  • Code lisible : pensé pour être étudié et modifié, pas une boîte noire optimisée à outrance.

CAS D'USAGE

  • Extraire du texte structuré de documents scannés ou de captures d'écran avec OCR conscient de la mise en page.
  • Détecter et segmenter des objets dans une image en décrivant simplement ce qu'on cherche.
  • Servir un modèle vision-langage en production derrière une API REST multi-GPU.
  • Prototyper rapidement via l'interface web Streamlit fournie.
  • Benchmarker des modèles de perception visuelle sur plusieurs échantillons.

SOURCES

DÉPÔThttps://github.com/tiiuae/Falcon-Perception
LICENCEApache-2.0