
YOLO (You Only Look Once)Detección de objetos en tiempo real que identifica múltiples objetos en pasada única de la imagen.
Resumen
Funciones clave
- Detección de objetos en tiempo real con una pasada única
- Predicción de cajas delimitadoras y probabilidades de clase
- Soporte para tareas de detección, segmentación y estimación de pose
- Modelos pretrained en conjuntos de datos comunes como COCO
- Despliegue en GPU, CPU y dispositivos de borde
- Capacidad de entrenamiento personalizado en conjuntos de datos del usuario
Precio
- Modelo
- Freemium
- Categoría
- Visión por Computadora
- Valoración
- 4.8 / 5 (6)
Casos de uso
Seguridad de video en tiempo real
Detecta y sigue a personas, vehículos o objetos de interés en las alimentaciones de cámara de seguridad en vivo usando la inferencia rápida de YOLO en una sola pasada.
Percepción de vehículos autónomos
Identifica peatones, coches, señales de tráfico y obstáculos en tiempo real para apoyar decisiones de conducción y navegación en sistemas de conducción automática.
Despliegue en dispositivos de borde y robótica
Ejecuta la detección de objetos directamente en hardware embebido y robots, lo que permite interacción respuesta con el ambiente sin depender de la nube.
Entrenamiento de detección personalizada en conjuntos de datos del usuario
Fine-tunes modelos pretrained de YOLO en conjuntos de datos etiquetados del usuario para detectar objetos específicos de la dominio en aplicaciones industriales, médicas o de comercio.
Pros y contras
Ventajas
- Inferencia muy rápida adecuada para uso en tiempo real
- Ecosistema abierto de código fuente y apoyo de la comunidad
- Detecta múltiples clases de objetos con una sola pasada
- Funciona en hardware de borde y dispositivos embebidos
- Mejoras continuas a lo largo de versiones del modelo
Contras
- Puede tener dificultades con objetos pequeños o estrechamente empaquetados
- Requiere conjuntos de datos etiquetados y experiencia en entrenamiento
- La licencia varía según versiones y ramas
- La precisión puede ser inferior a detectores en etapas más lentas
Historial de batallas
En 1 batalla del Panteón.
Last battle
Reseñas
Promedio de 6 valoraciones.
Inicia sesión para dejar una reseña.
Does the job
Pretty happy overall. Support for detection, segmentation, and pose tasks just works and runs on edge hardware and embedded devices. Requires labeled datasets and training expertise can be annoying, but no dealbreakers — I'd recommend it to a friend without hesitating.
Solid for our team
We rolled this out across the team last quarter and continual improvements across model versions. Pretrained models on common datasets like COCO fits neatly into how we already work, and deployable on GPU, CPU, and edge devices removed a step we used to do by hand. but it has held up under daily use.
Use it every day
Honestly didn't expect to like it this much. Support for detection, segmentation, and pose tasks is exactly what I needed, and strong open-source ecosystem and community support. I do wish requires labeled datasets and training expertise, but I reach for it almost every day now and it just clicks.
Use it every day
Honestly didn't expect to like it this much. Customizable training on user datasets is exactly what I needed, and continual improvements across model versions. I do wish can struggle with small or densely packed objects, but I reach for it almost every day now and it just clicks.
Years in this space
I've evaluated a lot of these over the years. What stands out here is pretrained models on common datasets like COCO — handled better than most — and extremely fast inference suitable for real-time use. Requires labeled datasets and training expertise is my one real gripe. Worth the time if this is your use case.
Compared a few options
Evaluated this against two competitors. Where it wins: customizable training on user datasets and extremely fast inference suitable for real-time use. Where it lags: requires labeled datasets and training expertise. On balance the feature set — especially customizable training on user datasets — justifies the 5 stars for our use case.
Preguntas y respuestas
What are the main limitations of YOLO compared to two‑stage detectors?
YOLO’s single‑pass design excels in speed but may struggle with very small or densely packed objects, and its accuracy can be lower than slower, two‑stage detectors that use region proposals.
Asked by Esther Adeyemi · Sep 4, 2025
Can I train YOLO on my own dataset for custom object classes?
Yes, YOLO is fully customizable; you can fine‑tune pretrained models (e.g., on COCO) using your own labeled dataset, though you’ll need labeling expertise and some training experience.
Asked by Jasper Vermeer · Aug 12, 2025
What hardware is needed to run YOLO in real-time?
YOLO can run on GPUs, CPUs, and edge devices; for real‑time performance you typically need a GPU (e.g., NVIDIA RTX series) but the model also supports inference on CPUs and embedded hardware with reduced frame rates.
Asked by Dara Fitzgerald · Jul 31, 2025
Hacer una pregunta
Alternativas a Visión por Computadora

motor de búsqueda de rostros con inteligencia artificial para encontrar fotos en línea de una persona específica

Garantía de calidad de GenAI que explora y prueba tu aplicación como un usuario real.

Demo de algoritmo genético que evoluciona coches autoseparadores virtuales en el navegador.

Generación de imágenes y vídeo ultra-realísticas con entrenamiento personalizado de modelos LoRA.

Plataforma de operación remota de vehículos para un manejo de flotas de vehículos sin conductor seguro.

Marco de frameworks de agentes de IA autónomos para la construcción de aplicaciones robotizadas basadas en tareas.

Software personalizado, IA y soluciones digitales diseñadas para acelerar el crecimiento empresarial.

plugins de mejora de fotos con inteligencia artificial que automatizan trabajos de piel, color y detalles mientras conservan los texturas naturales.
Trending now

Ayuda precisa con las tareas de biología y explicaciones detalladas

API de inteligencia de documentos que analiza, divide, reconoce textos impresos y extrae datos estructurados desde PDF complejos, presentaciones y hojas de cálculo.

Modelo multimodal de 12G que maneja imágenes e texto intercalados con una ventana de contexto de 128K.

Respuestas patrocinadas, pagadas por clic.
