Bataille passée · 2024-08-26 UTC
Computer Vision Duel — 26 août 2024
De la catégorie Computer Vision. 8 marques placées sur 3 combattants. OpenCV AI Kit (OAK) a décroché la couronne.
Classement final
Le casting
Les combattants
Profils de chaque outil ayant concouru dans cette bataille, classés par leur score final.

OpenCV AI Kit (OAK)
Caméras IA spatiales open source combinant vision par ordinateur et détection de profondeur embarquée.

OpenCV AI Kit (OAK) est une famille d'appareils de périphérie qui associent des caméras de profondeur stéréo à un accélérateur de réseau neuronal embarqué, permettant aux développeurs d'exécuter des modèles de vision par ordinateur et d'IA directement sur la caméra sans GPU hôte. Construit autour du processeur Intel Movidius Myriad X VPU et pris en charge par le SDK DepthAI, les appareils OAK peuvent effectuer la détection d'objets, le suivi, l'estimation de pose et la localisation 3D en temps réel. La plate-forme est open source, avec des schémas de matériel documentés, des API Python et C++, et des intégrations pour ROS, ce qui la rend populaire pour la robotique, les drones, l'inspection industrielle et les prototypes de recherche. Les développeurs peuvent déployer des modèles pré-entraînés à partir de OpenVINO Model Zoo ou convertir leurs propres réseaux PyTorch et TensorFlow pour exécuter sur l'appareil. OAK est produit par Luxonis en collaboration avec la communauté OpenCV, avec des variantes allant des modules USB compacts aux caméras compatibles PoE adaptées aux déploiements embarqués et autonomes.
Répartition des critères
- Perception stéréo de profondeur avec localisation 3D d'objets
- Inférence neuronale embarquée via le VPU Myriad X
- SDK DepthAI Python et C++
- Support des modèles OpenVINO, PyTorch et TensorFlow
- Facteurs de forme USB, PoE et module autonome
- Intégration avec ROS et les flux de travail OpenCV

Oxipit.ai
Vision par ordinateur alimentée par l'IA pour les flux de travail d'imagerie médicale.

Oxipit.ai est une plateforme de vision par ordinateur alimentée par l'IA pour les flux de travail d'imagerie médicale, en particulier la radiologie. L'entreprise développe des solutions d'IA cliniquement validées pour améliorer l'efficacité, soutenir les flux de travail diagnostiques et renforcer les soins aux patients. Oxipit propose trois suites complètes : Oxipit CXR Suite pour la radiographie thoracique, Oxipit CT Suite pour le scanner thoracique et Oxipit MSK Suite pour l'imagerie musculosquelettique. Leur innovation phare, ChestLink, identifie de manière autonome les examens de radiographie thoracique normaux avec une précision de 99,9 %, automatisant jusqu'à 40 % des cas. La plateforme vise à rationaliser les flux de travail en radiologie, réduire les oublis et soutenir la prise de décision confiante. Oxipit s'est associé à plusieurs prestataires de soins de santé et a récemment conclu un accord pour être acquis par Sectra, un leader de l'imagerie d'entreprise et des technologies de santé, afin d'étendre ses solutions d'IA cliniquement validées à l'échelle mondiale.
Répartition des critères
- Détection automatisée d'anomalies dans la radiographie thoracique
- Priorisation et tri des cas
- Assistance à la rédaction de rapports de radiologie
- Vérifications d'assurance qualité
- Intégration des flux de travail PACS et DICOM
- Soutien décisionnel clinique pour les radiologues

OmniVision
Modèle vision-langage compact conçu pour le déploiement sur appareil et en périphérie

OmniVision est un modèle de vision-langage léger conçu pour apporter une compréhension multimodale aux appareils aux ressources limitées. En minimisant le nombre de paramètres et l'empreinte mémoire, il peut fonctionner localement sur du matériel de périphérie sans recourir à l'inférence en nuage, ce qui le rend adapté aux applications mobiles, aux systèmes embarqués et aux flux de travail sensibles à la confidentialité. Le modèle accepte des entrées d'images ainsi que des invites de texte et peut effectuer des tâches telles que répondre à des questions visuelles, légender des images et comprendre des scènes de base. Sa petite taille échange une capacité brute contre de la vitesse, de l'efficacité et une accessibilité hors ligne, le positionnant comme une option pratique pour les développeurs qui créent des fonctionnalités multimodales réactives dans des environnements contraints.
Répartition des critères
- Compréhension vision-langage
- Optimisé pour le matériel en périphérie et mobile
- Légende d'image et question-réponse visuelle
- Nombre de paramètres réduit
- Capacité d’inférence hors ligne
- Intégration conviviale pour les développeurs


