지난 배틀 · 2026-08-01 UTC
LLM 대결 — 2026년 8월 1일
LLM 카테고리에서. 5개의 참가자에 걸쳐 14 표시가 배치되었습니다. DeepSeek R1이(가) 왕좌를 차지했습니다.
최종 순위
출전 라인업
참가자들
이 배틀에 참가한 모든 도구의 프로필, 최종 점수순으로 순위가 매겨졌습니다.

DeepSeek R1
논리 추론, 수학, 프로그래밍 업무에 있어서 전문성을 가지는 오픈 소스 인공지능 모델이며 MIT 라이선스 아래 자유롭게 사용 및 수정이 가능합니다.

DeepSeek R1은 추론, 수학 및 프로그래밍과 같은 과제에서 뛰어난 성능을 보이는 오픈 소스 언어 모델입니다. Mixture of Experts (MoE) 구조를 활용하여 37B의 활성 매개변수와 671B의 총 매개변수를 support 하여 128K의 컨텍스트 길이를 지지한다. 모델은 진화 적학습 기법을 사용하여 자가 검증, 다단계 반영 및 인간 중심 추론 기능을 포함한다. DeepSeek R1은 MATH-500에서 97.3%의 정확도를, AIME 2024에서 79.8%의 통과율을 달성하였으며, Codeforces 참여자가 96.3%를 초과하는 성과를 보여주는 최첨단 성능을 달성하였다. 모델에는 다양한 매개변수인 1.5B에서 70B까지 다양한 버전이 있으며, MIT라이센스를 사용하여 무료 사용 및 수정이 가능하다. DeepSeek R1은 온라인으로 무료로 사용 가능하며, WebGPU 가속 버전을 사용하여 브라우저 내에서 로컬에서 실행 할 수 있어야 한다. DeepSeek R1 모델의 주요 목적은 복잡한 문제 해결, 다언어 이해, 그리고 제한이 없는 코드 생상 기능을 제공하는 것입니다. 이 모델의 강점은 우수한 수학적 추론 기능, 코드 생상, 자연어 이해 능력을 보유하고 있습니다. 하지만 공개 소스 모델인만큼, 도배하고 세부적인 용도로 최적화하기 위해서는 전문적인 지식이 필요할 수 있습니다. 디프스EEK R1은 전 세계적으로 주력하는 AI 모델 가운데 가장 성과가 좋은 위치에 있다. 주요 비밀장치 솔루션과 견줄만한 성능이 있는 이 기술은 오픈 소스 특성으로 인해 커뮤니티에서 참여한 개발 및 지속적인 업그레이드를 통해, planned 멀티 모달 지원, 대화 증진, 분산 인퍼런스 최적화 등을 계획하고 있다. 모델은 pure reinforcement learning 개발 방식으로 GPT-4 수준의 수학적인 성능을 낮은 비용으로 달성할 수 있게 해준다. chain-of-thought 시각화 기능은 AI '검은 상자의' 도전 과제를 해결하면서, 모델이 가지고 있는 합리화 과정에 대한 통찰력을 제공한다. DeepSeek R1의 API는 OpenAI 호환 엔드포인트를 제공하며, 1 억의 토큰당 0.14 달러의 가격으로 통합할 수 있습니다. 모델의 가중치도 오픈 소스이기 때문에 상용 활용 및 변경이 가능합니다.
평가 기준 분해
- Expert들의 조합(Mixture of Experts) 아키텍처
- 강화학습 기법
- 자체 검증 및 다단계 반영 기능
- 인간 중심 논리 추론
- 128K 글자 길이의 컨텍스트 지원
- OpenAI 호환 API 엔드 포인트

Eye2.AI은 다수의 모델을 비교할 수 있는 다중 모델 AI 비교도구입니다. 사용자는 하나의 명령어를 여러 대 주류 자연어 처리 모델에 보낼 수 있으며, 모델의 대답을 서로 겸비하여 비교할 수 있습니다. 이 도구는 언어톤, 예측 정확도, 깊이 및 논리적인 설명에서 차이점을 노출함으로써 사용자가 지정된 작업에最佳 모델을 선택할 수 있도록 도와주며, 여러 구독료를 지불해야 하는 것을 피할 수 있습니다. 서비스는 무료이며 계정이 필요하지 않아, 모델 간의 빠른 실험, 연구 및 факт확인에 대한 장벽을 낮춰줍니다. 저자, 개발자, 학생 및 AI 시스템이 동일한 질문에 어떻게 접근하는지에 관심 있는 누구에게나 특히 유용합니다.
평가 기준 분해
- 단일 입력으로 다중 모델 질의
- 옆에 옆에 답변 레이아웃
- 하나의 장소에서 최고의 인공지능 모델에 접근
- 계정이나 로그인 필요없음
- 무료 사용
- 스피드 Prompt 실험 워크플로우

OpenAI o3는 미래의 추론 모델로, 반복적이고 점진적인 사소한 문제를 해결하는 데 특별히 적합하다. o-시리즈 접근법을 기반으로 계산을 인페런스 시간에 더 많이 사용하여 답안을 계획하고, 검증하고, 수정할 수 있는 OpenAI o3는 수학, 프로그래밍, 과학, 이론 논증과 같은 과학 및 논리적 분석과 같은 다양한 과제에 가장 잘 적합합니다. 일반-purpose 대화 모델과 비교すると o3에서는 깊이(depth)가 속도(speed)보다 중요시된다. 모호한 시도(request)을 분해하고 다차원적인 접근법(evaluate multiple approaches)을 수행하며, 사고력과 tool 사용을 강조하는 벤치마크(benchmarks)에서 신뢰할 수 있는 출력을 생산한다. 개발자들은 OpenAI API와 ChatGPT를 통해 접근할 수 있으며, 웹 브라우징, Python, 및 파일 분석 과 같은 도구와 통합되어있는데, o3의 API는 이러한 도구와 쉽게 결합할 수 있게한다. 모델은 연구원, 엔지니어, 고급 사용자들을 위해 설계되어 어려운 문제에서 더 높은 정확도를 필요로 하는 사람들을 위한 것으로, 낮은 대기 시간과 낮은 비용을 선택해서는 안 되는 결과의 좀 더 높은 품질을 선택하여야 한다고 명시한다.
평가 기준 분해
- 연쇄적 사고 모델 확장
- 기능도구 포함, 코드, 웹, 및 파일 입력
- 장기문서를 위한 커다란 문맥 윈도우
- API 및 ChatGPT 이용 가능성
- STEM 성능 향상
- 복잡한 에이전シー 워크 플로우 지원
Pronoia는 특정 언어에 최적화되어있는 대규모 자연어 처리 모델 중 하나입니다. 이는 일반 대다수 언어 모델보다 정확한 이해, 생성 및推론을 구현하여 아랍어의 이해력을 높이는 것을 목표로 합니다. Pronoia는 다언어 LLM의 선도적인 제품 중 하나이며, 방언, 고전적 형식 및 현대 표준 아랍어를 위한 최적화가 있습니다. 이 모델은 콘텐츠 생성, 요약, 번역, 고객 지원 및 대화형 AI를 위한 업무로 사용할 수 있습니다. 이를 위해 Arabic 데이터에 집중적인 훈련을 통해 Pronoia는 일반모델이 비일관적으로 다루는 형태학, 의문점, 그리고 문화적 맥락을 표적하고 있습니다.
평가 기준 분해
- 아랍어 최적화 언어 모델
- 텍스트 생성 및 요약
- 번역 지원
- 대화 및 챗봇 기능
- 기업용 아랍어 NLP를 위한 맞춤
- 공식 아랍어 및 방언에 대한 지원


Gemini 2.0 Flash는 구글 디프마인드가 속도, 규모 및 다채널적 사유를 위해 최적화한 다음세대 모델입니다. 텍스트, 이미지, 오디오 및 비디오로 입력을 받으며 텍스트, 이미지 및 오디오로 출력을 생성できる 것이므로, 풍부한 인터랙티브 애플리케이션에 적합합니다. 제 2세대 Gemini 플래시 모델은 에이전트 워크플로우를 위한 구축 목적으로 설계되었으며 1 million 토큰 컨텍스트 창은 대형 문서, 코드베이스 또는 로그인 세션을 다루기에 적합합니다. 저-latency는 가교 역할을 하는 보조 인공 지능, 실시간 분석 및 프로덕션 규모 의 배포에서 유용한 실용적인 선택입니다. _gemini 2.0 flash_ 개발자들은 _gemini API_, 구글 AI 스튜디오, 및 벡서스 아이( Vertex AI )를 통해 _gemini 2.0 flash_에 액세스할 수 있습니다. 주요 언어를 지원하는 SDK도 제공됩니다.
평가 기준 분해
- 1M-token 컨텍스트 window
- 다채널 입력: 문장, 이미지, 오디오, 비디오
- 원시 도구 호출 및 코드 실행
- 실시간 스트리밍 응답
- 이미지 및 오디오 생성
- Gemini API 및 Vertex AI를 통해 이용 가능





