Battaglia passata · 2024-08-26 UTC
Computer Vision Sfida — 26 agosto 2024
Dalla categoria Computer Vision. 8 segni piazzate tra 3 sfidanti. OpenCV AI Kit (OAK) ha conquistato la corona.
Classifica finale
La formazione
Gli sfidanti
Profili di ogni strumento che ha gareggiato in questa battaglia, ordinati per punteggio finale.

OpenCV AI Kit (OAK)
Camere con IA spaziale aperte sorgente che combinano la visione computazionale e la rilevazione di profondità su dispositivo.

OpenCV AI Kit (OAK) è una famiglia di dispositivi edge che combinano telecamere di profondità stereo con un acceleratore di rete neurale integrato, consentendo agli sviluppatori di eseguire modelli di visione artificiale e AI direttamente sulla telecamera senza una GPU host. Costruiti attorno al VPU Intel Movidius Myriad X e supportati dall'SDK DepthAI, i dispositivi OAK possono eseguire il rilevamento degli oggetti, il tracciamento, la stima della posa e la localizzazione 3D in tempo reale. La piattaforma è open source, con schemi hardware documentati, API Python e C++, e integrazioni per ROS, il che la rende popolare per robotica, droni, ispezione industriale e prototipi di ricerca. Gli sviluppatori possono distribuire modelli pre-addestrati da OpenVINO Model Zoo o convertire le proprie reti PyTorch e TensorFlow per eseguire sul dispositivo. OAK è prodotto da Luxonis in collaborazione con la comunità OpenCV, con varianti che vanno da moduli USB compatti a telecamere abilitate PoE adatte a implementazioni embedded e autonome.
Suddivisione dei criteri
- Percezione di profondità stereo con localizzazione di oggetti 3D
- Inferenza neurale su dispositivo mediante VPU Myriad X
- SDK Python e C++ DepthAI
- Supporto per modelli OpenVINO, PyTorch e TensorFlow
- Formati di modulo per USB, PoE e modulo standalone
- Integrazione con ROS e workflow di OpenCV


Oxipit.ai è una piattaforma di visione per computer AI alimentata per flussi di lavoro di imaging medico, in particolare radiologia. La società sviluppa soluzioni AI validate clinicamente per migliorare l'efficienza, supportare i flussi di lavoro diagnostici e migliorare l'assistenza ai pazienti. Oxipit offre tre suite complete: il Kit completi CXR per la radiografia toracica, il Kit completi CT per il TAC toracico e il Kit completi MSSK per l'imaging muscoloscheletrico. La loro innovazione bandiera, ChestLink, identifica autonomamente con precisione del 99,9% gli studi di radiografia toracica normali, automatizzando fino al 40% dei casi. La piattaforma mira a semplificare i flussi di lavoro di radiologia, ridurre gli errori di oversight e supportare la decisione di fiducia. Oxipit ha partnerizzato con alcuni provider di sanità e ha recentemente raggiunto un accordo per essere acquistato da Sectra, un fornitore di enterprise imaging e IT per la sanità, per scalare le sue soluzioni AI validate clinicamente a livello mondiale.
Suddivisione dei criteri
- Detettori automatici di anomalie della radiografia toracica
- Pianificazione e triage dei casi
- Assistenza di reporting per la radiologia
- Revisioni di assicurazione della qualità
- Integrazione di workflow con PACS e DICOM
- Supporto alla decisione clinica per i radiologi

OmniVision
Modello visivo-linguistico compatto progettato per la distribuzione di intelligenza artificiale al margine dispositivo/edge.

OmniVision è un modello linguistico-visivo leggero progettato per portare la comprensione multimodale su dispositivi con risorse limitate. Riducendo al minimo il numero di parametri e l'impronta di memoria, può essere eseguito localmente su hardware edge senza affidarsi all'inferenza cloud, rendendolo adatto per app mobili, sistemi embedded e flussi di lavoro sensibili alla privacy. Il modello accetta input di immagini insieme a prompt di testo e può eseguire attività come la risposta a domande visive, la creazione di didascalie per immagini e la comprensione di base delle scene. Le sue dimensioni ridotte sacrificano la capacità grezza in cambio di velocità, efficienza e accessibilità offline, posizionandolo come un'opzione pratica per gli sviluppatori che creano funzionalità multimediali reattive in ambienti con risorse limitate.
Suddivisione dei criteri
- Capacità di comprendere visivo-linguistico
- Ottimizzato per la hardware mobile e di margine
- Captura dell'immagine e domande visive Q&A
- Conto parametri compatto
- Capacità di inferenza offline
- Integrazione amichevole per sviluppatori


