LFM2.5-VL-3B : modèle vision-langage pour edge computing
LFM2.5-VL-3B est un modèle vision-langage conçu pour fonctionner sur du matériel local, avec des capacités améliorées en compréhension d'écrans, détection d'objets et traitement multi-images. Il surpasse les modèles concurrents dans plusieurs benchmarks visuels et textuels.
« LFM2.5-VL-3B is our most capable vision-language model you can run on your own hardware. » - Hugging Face Blog
Que faut-il retenir ?
- LFM2.5-VL-3B comprend les documents et les écrans avec détection d'objets améliorée.
- Le modèle traite plusieurs images simultanément avec un raisonnement amélioré.
- Il excelle dans l'appel de fonctions, en texte seul et en situations vision-texte.
- LFM2.5-VL-3B mène sa catégorie de taille sur les tâches d'images réelles.
Pourquoi cette nouvelle compte-t-elle ?
Ce modèle ouvre des possibilités pour les applications embarquées nécessitant une compréhension visuelle avancée sans dépendre du cloud. Ses performances en edge computing le rendent particulièrement utile pour les développeurs d'applications temps réel et les fabricants de matériel intelligent.
34T tokens utilisés pour l'entraînement préalable
Public concerné : développeurs, entreprises
Quelles sont les améliorations clés de LFM2.5-VL-3B par rapport aux versions précédentes ?
LFM2.5-VL-3B apporte quatre améliorations majeures : une meilleure compréhension des écrans/UI, un ancrage amélioré des objets, un traitement multi-image plus performant et des capacités d'appel de fonctions renforcées. Le modèle utilise 4 fois plus de données visuelles que les versions précédentes.