Batalla anterior · 2024-01-17 UTC
LLM Duelo — 17 de enero de 2024
De la categoría LLM. 37 marcas colocadas entre 8 combatientes. ASI:One se llevó la corona.
Clasificación final
La formación
Los combatientes
Perfiles de cada herramienta que compitió en esta batalla, clasificadas por su puntuación final.

ASI:One
Asistente de IA agentica que coordina agentes autónomos para completar tareas de varios pasos.

ASI:One es un asistente de IA construido bajo el concepto de inteligencia agentica, donde una interfaz conversacional puede desplegar y coordinar agentes autónomos especializados para gestionar solicitudes complejas. En lugar de solo devolver texto, puede planificar, llamar a herramientas y ejecutar flujos de trabajo en nombre del usuario. Desarrollado dentro del ecosistema de la Artificial Superintelligence Alliance, se posiciona como un agente de IA personal que se integra con redes de agentes descentralizadas. Los usuarios pueden chatear con él para consultas cotidianas o delegar tareas más largas como investigaciones, comparaciones, programación de agendas y búsquedas de datos en servicios conectados.
Desglose de criterios
- Interfaz de chat conversacional
- Orquestación de agentes autónomos
- Planificación y ejecución de tareas de varios pasos
- Conectividad con agentes y servicios externos
- Memoria y contexto al estilo de asistente personal
- Construido sobre la pila de agentes de la ASI Alliance

Gemini 2.0 Flash
El modelo de IA multimodal rápido de Google, diseñado para tareas en tiempo real con una ventana de contexto de 1 M tokens.

Gemini 2.0 Flash es el modelo de nueva generación de Google DeepMind, optimizado para velocidad, escala y razonamiento multimodal. Acepta texto, imágenes, audio y video como entrada y puede generar texto, imágenes y salida de audio, lo que lo hace adecuado para aplicaciones interactivas ricas. Diseñado con flujos de trabajo agénicos en mente, el modelo admite el uso de herramientas nativas, la llamada de funciones y una ventana de contexto de 1M de tokens para manejar documentos grandes, bases de código o sesiones prolongadas. La baja latencia lo hace una opción práctica para asistentes, análisis en tiempo real y despliegues a escala de producción. Los desarrolladores pueden acceder a Gemini 2.0 Flash a través de la API de Gemini, Google AI Studio y Vertex AI, con SDK disponibles en los principales lenguajes.
Desglose de criterios
- Ventana de contexto de 1M tokens
- Entrada multimodal: texto, imagen, audio, vídeo
- Llamada a herramientas nativas y ejecución de código
- Respuestas en streaming en tiempo real
- Generación de imágenes y audio
- Disponible a través de Gemini API y Vertex AI

Mistral Small 3
Modelo de lenguaje grande abierto compacto con rendimiento competitivo y demandas de cómputo más bajas.

Mistral Small 3 es un modelo de lenguaje grande ligero de Mistral AI, diseñado para ofrecer sólidas capacidades de razonamiento y generación mientras se ejecuta de manera eficiente en hardware modesto. Se dirige a desarrolladores y organizaciones que desean una IA capaz sin los costos de infraestructura de los modelos de última generación. Liberado bajo una licencia abierta, el modelo se puede autoalojar, ajustar con precisión e integrar en aplicaciones comerciales. Su equilibrio entre velocidad, precisión y eficiencia de recursos lo hace adecuado para asistentes de chat, generación de contenido, tareas de codificación e implementaciones locales donde la latencia o la privacidad son importantes.
Desglose de criterios
- Publicación de modelo con peso abierto
- Optimizado para inferencia eficiente
- Resultados de benchmark competitivos
- Apoyo para ajustes finos y personalización
- Procedimiento para la implementación en la sede
- Síntesis de texto en idiomas múltiples

OpenAI o3
Modelo de razonamiento avanzado de OpenAI para solucionar problemas complejos y multietape

OpenAI o3 es un modelo de razonamiento de frontera diseñado para abordar problemas que requieren un pensamiento cuidadoso y paso a paso. Se basa en el enfoque de la serie o de gastar más recursos computacionales durante la inferencia para planificar, verificar y refinar las respuestas, lo que lo hace adecuado para tareas de matemáticas, codificación, ciencias y análisis lógico. En comparación con los modelos de chat de propósito general, o3 enfatiza la profundidad sobre la velocidad. Puede desglosar indicaciones ambiguas, evaluar múltiples enfoques y producir resultados más fiables en pruebas de referencia que ponen a prueba el razonamiento y el uso de herramientas. Los desarrolladores pueden acceder a él a través de la API de OpenAI y ChatGPT, donde se integra con herramientas como navegación web, Python y análisis de archivos. El modelo está dirigido a investigadores, ingenieros y usuarios avanzados que necesitan una mayor precisión en problemas complejos y están dispuestos a intercambiar cierta latencia y costo por resultados de mayor calidad.
Desglose de criterios
- Razonamiento de cadena de pensamiento extendido
- Uso de herramientas incluyendo códigos, web y análisis de archivo
- Ventana de contexto amplia para documentos largos
- Disponibilidad de API y ChatGPT
- Mayor precisión en los benchmarks de STEM
- Soporte para flujos de trabajo agentes complejos

DeepSeek R1
Un modelo de lenguaje grande y de código abierto que sobresale en razonamiento, matemáticas y tareas de programación, con licencia MIT para uso y modificación gratuita.

DeepSeek R1 es un modelo de lenguaje grande de código abierto que destaca en tareas de razonamiento, matemáticas y codificación. Utiliza una arquitectura de Mezcla de Expertos (MoE) con 37B de parámetros activos y 671B de parámetros totales, admitiendo una longitud de contexto de 128K. El modelo incorpora técnicas avanzadas de aprendizaje por refuerzo para lograr capacidades de auto-verificación, reflexión multi-paso y razonamiento alineado con los humanos. DeepSeek R1 ha logrado un rendimiento de última generación en varios benchmarks, incluyendo una precisión del 97,3% en MATH-500, una tasa de aprobación del 79,8% en AIME 2024, y superando al 96,3% de los participantes en Codeforces. El modelo está disponible en múltiples variantes, que van desde 1,5B hasta 70B de parámetros, y está licenciado bajo MIT para uso y modificación gratuitos. DeepSeek R1 se puede utilizar en línea de forma gratuita, y una versión acelerada con WebGPU se puede ejecutar localmente en un navegador. El modelo está diseñado para la resolución de problemas complejos, la comprensión multilingüe y la generación de código de nivel de producción. Sus puntos fuertes incluyen capacidades excepcionales de razonamiento matemático, generación de código y comprensión del lenguaje natural. Sin embargo, como modelo de código abierto, puede requerir experiencia técnica para implementarlo y ajustarlo para casos de uso específicos. DeepSeek R1 se encuentra entre los modelos de inteligencia artificial de mejor rendimiento a nivel mundial, con capacidades comparables a las soluciones propietarias líderes. Su naturaleza de código abierto permite un desarrollo impulsado por la comunidad y mejoras continuas, incluyendo soporte multimodal planificado, mejoras conversacionales y optimización de inferencia distribuida. El modelo tiene un desarrollo de aprendizaje por refuerzo puro, lo que le permite lograr un rendimiento matemático de nivel GPT-4 a un costo significativamente menor. La capacidad de visualización de cadena de pensamiento aborda los desafíos de la "caja negra" de la IA, proporcionando información sobre el proceso de razonamiento del modelo. La API de DeepSeek R1 ofrece un endpoint compatible con OpenAI para integración, con un precio de $0.14 por millón de tokens. Los pesos del modelo son de código abierto, lo que permite su uso comercial y modificación.
Desglose de criterios
- Arquitectura Mixture of Experts (MoE)
- Técnicas avanzadas de aprendizaje por refuerzo
- Capacidades de auto-verificación y reflexión en múltiples pasos
- Razonamiento alineado con el ser humano
- Soporte para longitud de contexto de 128K
- Endpoint de API compatible con OpenAI

DeepSeek V3
Modelo de mezcla de expertos de código abierto que ofrece razonamiento a nivel GPT-4o a una fracción del costo.

DeepSeek V3 es un modelo de lenguaje de mezcla de expertos (MoE) a gran escala desarrollado por DeepSeek AI. Activa solo un subconjunto de sus parámetros totales por token, lo que le permite ofrecer un rendimiento sólido en tareas de razonamiento, matemáticas y codificación, manteniendo los costos de inferencia significativamente más bajos que los modelos densos comparables. Lanzado con pesos abiertos, DeepSeek V3 se ha convertido en una opción popular para desarrolladores e investigadores que necesitan un modelo de base capaz que puedan autoalojar, ajustar finamente o integrar a través de API. Los benchmarks lo colocan en competencia con los principales modelos propietarios como GPT-4o, particularmente en evaluaciones de matemáticas y razonamiento lógico. El modelo es muy adecuado para asistentes técnicos, canalizaciones de generación de código, flujos de trabajo de investigación y cualquier aplicación donde la calidad del razonamiento y la eficiencia presupuestaria sean importantes.
Desglose de criterios
- Arquitectura de mezcla de expertos
- Benchmarks competitivos de razonamiento y matemáticas
- Pesos de modelo de código abierto
- Acceso API a través de la plataforma DeepSeek
- Soporte para ventana de contexto larga
- Amigable para ajuste fino
Llama 3.3
MLM de Meta multilingüe de peso abierto ajustado para la generación de texto eficiente y de alta calidad.

Llama 3.3 es un modelo de lenguaje grande de Meta diseñado para ofrecer sólidas capacidades de razonamiento, codificación y multilingüismo, siendo más eficiente de ejecutar que los modelos insignia anteriores. Admite una amplia gama de idiomas y es adecuado para asistentes de chat, generación de contenido, resúmenes y herramientas para desarrolladores. Lanzado con pesos abiertos, se puede implementar localmente o a través de los principales proveedores de nube e inferencia, lo que brinda a los equipos flexibilidad sobre el costo, la latencia y el manejo de datos. Su variante ajustada a instrucciones está optimizada para seguir las indicaciones con precisión y producir respuestas conversacionales útiles. Los desarrolladores suelen utilizar Llama 3.3 como base para ajustar aplicaciones específicas de dominio, sistemas de generación aumentada por recuperación y flujos de trabajo agénicos.
Desglose de criterios
- Generación de texto multilingüe
- Variante de chat ajustada a instrucciones
- Soporte de largo contexto
- Capacidades de codificación y razonamiento
- Pesos abiertos para la fine-tuning
- Compatible con marcos de inferencia de mayor relevancia
Pronoia
Gran modelo de lenguaje grande fin-tuneado con prioridad para el idioma árabe, especializado en comprensión y generación de alta calidad
Pronoia es un modelo de lenguaje grande ajustado específicamente para el árabe, con el objetivo de ofrecer una comprensión, generación y razonamiento más precisos en el idioma que los modelos multilingües de propósito general. Se posiciona como un LLM enfocado en árabe líder, con optimizaciones para dialectos, formas clásicas y árabe estándar moderno. El modelo se puede utilizar para tareas como la creación de contenido, resumen, traducción, atención al cliente e inteligencia conversacional en mercados de habla árabe. Al concentrar su entrenamiento en datos árabes, se dirige a matices como la morfología, los diacríticos y el contexto cultural que los modelos más amplios a menudo manejan de manera inconsistente.
Desglose de criterios
- Modelo de lenguaje optimizado para árabe
- Generación y resumen de texto
- Soporte de traducción
- Capacidades conversacionales y de chatbot
- Adecuado para procesamiento de lenguaje natural árabe empresarial
- Cobertura de MSA y dialectos





