지난 배틀 · 2026-02-20 UTC
LLM 대결 — 2026년 2월 20일
LLM 카테고리에서. 3개의 참가자에 걸쳐 14 표시가 배치되었습니다. DeepSeek R1이(가) 왕좌를 차지했습니다.
최종 순위
출전 라인업
참가자들
이 배틀에 참가한 모든 도구의 프로필, 최종 점수순으로 순위가 매겨졌습니다.

DeepSeek R1
논리 추론, 수학, 프로그래밍 업무에 있어서 전문성을 가지는 오픈 소스 인공지능 모델이며 MIT 라이선스 아래 자유롭게 사용 및 수정이 가능합니다.

DeepSeek R1은 추론, 수학 및 프로그래밍과 같은 과제에서 뛰어난 성능을 보이는 오픈 소스 언어 모델입니다. Mixture of Experts (MoE) 구조를 활용하여 37B의 활성 매개변수와 671B의 총 매개변수를 support 하여 128K의 컨텍스트 길이를 지지한다. 모델은 진화 적학습 기법을 사용하여 자가 검증, 다단계 반영 및 인간 중심 추론 기능을 포함한다. DeepSeek R1은 MATH-500에서 97.3%의 정확도를, AIME 2024에서 79.8%의 통과율을 달성하였으며, Codeforces 참여자가 96.3%를 초과하는 성과를 보여주는 최첨단 성능을 달성하였다. 모델에는 다양한 매개변수인 1.5B에서 70B까지 다양한 버전이 있으며, MIT라이센스를 사용하여 무료 사용 및 수정이 가능하다. DeepSeek R1은 온라인으로 무료로 사용 가능하며, WebGPU 가속 버전을 사용하여 브라우저 내에서 로컬에서 실행 할 수 있어야 한다. DeepSeek R1 모델의 주요 목적은 복잡한 문제 해결, 다언어 이해, 그리고 제한이 없는 코드 생상 기능을 제공하는 것입니다. 이 모델의 강점은 우수한 수학적 추론 기능, 코드 생상, 자연어 이해 능력을 보유하고 있습니다. 하지만 공개 소스 모델인만큼, 도배하고 세부적인 용도로 최적화하기 위해서는 전문적인 지식이 필요할 수 있습니다. 디프스EEK R1은 전 세계적으로 주력하는 AI 모델 가운데 가장 성과가 좋은 위치에 있다. 주요 비밀장치 솔루션과 견줄만한 성능이 있는 이 기술은 오픈 소스 특성으로 인해 커뮤니티에서 참여한 개발 및 지속적인 업그레이드를 통해, planned 멀티 모달 지원, 대화 증진, 분산 인퍼런스 최적화 등을 계획하고 있다. 모델은 pure reinforcement learning 개발 방식으로 GPT-4 수준의 수학적인 성능을 낮은 비용으로 달성할 수 있게 해준다. chain-of-thought 시각화 기능은 AI '검은 상자의' 도전 과제를 해결하면서, 모델이 가지고 있는 합리화 과정에 대한 통찰력을 제공한다. DeepSeek R1의 API는 OpenAI 호환 엔드포인트를 제공하며, 1 억의 토큰당 0.14 달러의 가격으로 통합할 수 있습니다. 모델의 가중치도 오픈 소스이기 때문에 상용 활용 및 변경이 가능합니다.
평가 기준 분해
- Expert들의 조합(Mixture of Experts) 아키텍처
- 강화학습 기법
- 자체 검증 및 다단계 반영 기능
- 인간 중심 논리 추론
- 128K 글자 길이의 컨텍스트 지원
- OpenAI 호환 API 엔드 포인트


Pixtral 12B 24..09은 Mistral AI에서 제공하는 멀티 모달 모델로 이미지와 텍스트를 포함한 단일 시퀀스에서 처리할 수 있습니다. 다양한 이미지 크기และสัดส조를 지원합니다. 그것은 12억 매개변수의 언어 디코더와 비전 인코더의 조합을 사용하여, 시각적인 질문 답변, 문서 이해, 막대 그래프 해석, 이미지 캡션화 등과 같은 작업이 가능합니다. 이 모델은 최대 128K 토큰 컨텍스트를 받을 수 있다. 여러 이미지를 긴 텍스트와 교차하여 한 번에 하나의 명령으로 전달할 수 있게 한다. opensource 라이센스 하에 출시되어, 로컬에서 또는 인퍼런스 프로바이더를 통해 배포할 수 있어서, 개발자들이 시각-언어 어플리케이션, 연구 워크플로우 및 멀티모달 에이전트를 빌드해야 하는 데 적합하다.
평가 기준 분해
- 12B 매개변수 비전-언어 모델
- 인터리브드 이미지와 텍스트 입력
- 128K 토큰 콘텍스트 길이
- ネ이티브 변수 사진 크기 지원
- 오픈 가중치 릴리스
- OCR, VQA 및 캡션을 위한 적합합니다.


DeepSeek V3는 DeepSeek AI가 개발한 대규모 혼합 전문가 (MoE)atural Language Model 이다._token당_only 특정 파라미터만 사용하여, 그것은 합리화, 수학, 프로그래밍 과제에서 강력한 성능을 제공하면서 유사한密집합 모델보다 추론 비용이_significantly 낮게抑制하는 기능을 갖추고 있다. DeepSeek V3으로 출시된 모델이 공개 가중치로 제공되었기 때문에 개발자 및 연구원이 자체 호스팅, 미세 조정, 또는 API를 통해 통합할 수 있는 훌륭한 기반 모델로 인기가 많은 편입니다. 벤치마크 결과 DeepSeek V3는 수학 및 논리적 사고 평가와 같은 특정 평가 기준에서 우수 성능을 보인 다른 소유권 모델들인 GPT-4o와 경쟁력을 보유하고 있습니다. DeepSeek V3 모델은 기술 보조자, 코드 생성 파이프라인, 연구 워크플로우, 그리고 합리성과 예산 효율성이 모두 중요하는 모든 애플리케이션들을 지원하기에 적절합니다.
평가 기준 분해
- Mixture-of-experts 구조
- 경쟁적 추론 및 수학 성능 벤치마크
- 오픈 소스 모델 가중치
- DeepSeek 플랫폼을 통한 API 액세스
- 장치 창에 대한 지원
- Fine-tuning 친화적


