지난 배틀 · 2026-08-01 UTC

LLM 대결 — 2026년 8월 1일

LLM 카테고리에서. 5개의 참가자에 걸쳐 14 표시가 배치되었습니다. DeepSeek R1이(가) 왕좌를 차지했습니다.

최종 순위

출전 라인업

참가자들

이 배틀에 참가한 모든 도구의 프로필, 최종 점수순으로 순위가 매겨졌습니다.

1DeepSeek R1 logo

DeepSeek R1

논리 추론, 수학, 프로그래밍 업무에 있어서 전문성을 가지는 오픈 소스 인공지능 모델이며 MIT 라이선스 아래 자유롭게 사용 및 수정이 가능합니다.

4.8 (4)
무료
DeepSeek R1의 스크린샷

DeepSeek R1은 추론, 수학 및 프로그래밍과 같은 과제에서 뛰어난 성능을 보이는 오픈 소스 언어 모델입니다. Mixture of Experts (MoE) 구조를 활용하여 37B의 활성 매개변수와 671B의 총 매개변수를 support 하여 128K의 컨텍스트 길이를 지지한다. 모델은 진화 적학습 기법을 사용하여 자가 검증, 다단계 반영 및 인간 중심 추론 기능을 포함한다. DeepSeek R1은 MATH-500에서 97.3%의 정확도를, AIME 2024에서 79.8%의 통과율을 달성하였으며, Codeforces 참여자가 96.3%를 초과하는 성과를 보여주는 최첨단 성능을 달성하였다. 모델에는 다양한 매개변수인 1.5B에서 70B까지 다양한 버전이 있으며, MIT라이센스를 사용하여 무료 사용 및 수정이 가능하다. DeepSeek R1은 온라인으로 무료로 사용 가능하며, WebGPU 가속 버전을 사용하여 브라우저 내에서 로컬에서 실행 할 수 있어야 한다. DeepSeek R1 모델의 주요 목적은 복잡한 문제 해결, 다언어 이해, 그리고 제한이 없는 코드 생상 기능을 제공하는 것입니다. 이 모델의 강점은 우수한 수학적 추론 기능, 코드 생상, 자연어 이해 능력을 보유하고 있습니다. 하지만 공개 소스 모델인만큼, 도배하고 세부적인 용도로 최적화하기 위해서는 전문적인 지식이 필요할 수 있습니다. 디프스EEK R1은 전 세계적으로 주력하는 AI 모델 가운데 가장 성과가 좋은 위치에 있다. 주요 비밀장치 솔루션과 견줄만한 성능이 있는 이 기술은 오픈 소스 특성으로 인해 커뮤니티에서 참여한 개발 및 지속적인 업그레이드를 통해, planned 멀티 모달 지원, 대화 증진, 분산 인퍼런스 최적화 등을 계획하고 있다. 모델은 pure reinforcement learning 개발 방식으로 GPT-4 수준의 수학적인 성능을 낮은 비용으로 달성할 수 있게 해준다. chain-of-thought 시각화 기능은 AI '검은 상자의' 도전 과제를 해결하면서, 모델이 가지고 있는 합리화 과정에 대한 통찰력을 제공한다. DeepSeek R1의 API는 OpenAI 호환 엔드포인트를 제공하며, 1 억의 토큰당 0.14 달러의 가격으로 통합할 수 있습니다. 모델의 가중치도 오픈 소스이기 때문에 상용 활용 및 변경이 가능합니다.

평가 기준 분해

Ease of use0
Value for money1
Features & power0
Integrations1
Support & docs0
Reliability1
  • Expert들의 조합(Mixture of Experts) 아키텍처
  • 강화학습 기법
  • 자체 검증 및 다단계 반영 기능
  • 인간 중심 논리 추론
  • 128K 글자 길이의 컨텍스트 지원
  • OpenAI 호환 API 엔드 포인트
2Eye2.AI logo

Eye2.AI

최고의 인공지능 모델들의 답변을 한 번의 입력으로 한 자리에서 비교해보세요—무료, 회원가입 없이.

4.5 (4)
무료
Eye2.AI의 스크린샷

Eye2.AI은 다수의 모델을 비교할 수 있는 다중 모델 AI 비교도구입니다. 사용자는 하나의 명령어를 여러 대 주류 자연어 처리 모델에 보낼 수 있으며, 모델의 대답을 서로 겸비하여 비교할 수 있습니다. 이 도구는 언어톤, 예측 정확도, 깊이 및 논리적인 설명에서 차이점을 노출함으로써 사용자가 지정된 작업에最佳 모델을 선택할 수 있도록 도와주며, 여러 구독료를 지불해야 하는 것을 피할 수 있습니다. 서비스는 무료이며 계정이 필요하지 않아, 모델 간의 빠른 실험, 연구 및 факт확인에 대한 장벽을 낮춰줍니다. 저자, 개발자, 학생 및 AI 시스템이 동일한 질문에 어떻게 접근하는지에 관심 있는 누구에게나 특히 유용합니다.

평가 기준 분해

Ease of use1
Value for money1
Features & power1
Integrations0
Support & docs0
Reliability0
  • 단일 입력으로 다중 모델 질의
  • 옆에 옆에 답변 레이아웃
  • 하나의 장소에서 최고의 인공지능 모델에 접근
  • 계정이나 로그인 필요없음
  • 무료 사용
  • 스피드 Prompt 실험 워크플로우
3OpenAI o3 logo

OpenAI o3

複잡한, 다단계 문제 해결을 위한 오픈 아이의 미들웨어 사고 모델

4.0 (4)
무료
OpenAI o3의 스크린샷

OpenAI o3는 미래의 추론 모델로, 반복적이고 점진적인 사소한 문제를 해결하는 데 특별히 적합하다. o-시리즈 접근법을 기반으로 계산을 인페런스 시간에 더 많이 사용하여 답안을 계획하고, 검증하고, 수정할 수 있는 OpenAI o3는 수학, 프로그래밍, 과학, 이론 논증과 같은 과학 및 논리적 분석과 같은 다양한 과제에 가장 잘 적합합니다. 일반-purpose 대화 모델과 비교すると o3에서는 깊이(depth)가 속도(speed)보다 중요시된다. 모호한 시도(request)을 분해하고 다차원적인 접근법(evaluate multiple approaches)을 수행하며, 사고력과 tool 사용을 강조하는 벤치마크(benchmarks)에서 신뢰할 수 있는 출력을 생산한다. 개발자들은 OpenAI API와 ChatGPT를 통해 접근할 수 있으며, 웹 브라우징, Python, 및 파일 분석 과 같은 도구와 통합되어있는데, o3의 API는 이러한 도구와 쉽게 결합할 수 있게한다. 모델은 연구원, 엔지니어, 고급 사용자들을 위해 설계되어 어려운 문제에서 더 높은 정확도를 필요로 하는 사람들을 위한 것으로, 낮은 대기 시간과 낮은 비용을 선택해서는 안 되는 결과의 좀 더 높은 품질을 선택하여야 한다고 명시한다.

평가 기준 분해

Ease of use0
Value for money1
Features & power0
Integrations1
Support & docs0
Reliability1
  • 연쇄적 사고 모델 확장
  • 기능도구 포함, 코드, 웹, 및 파일 입력
  • 장기문서를 위한 커다란 문맥 윈도우
  • API 및 ChatGPT 이용 가능성
  • STEM 성능 향상
  • 복잡한 에이전シー 워크 플로우 지원
4Pronoia logo

Pronoia

아랍어 최적화된 대용량 언어 모델의 이해와 생성을 위한 고난도 트레이닝

4.7 (6)
무료

Pronoia는 특정 언어에 최적화되어있는 대규모 자연어 처리 모델 중 하나입니다. 이는 일반 대다수 언어 모델보다 정확한 이해, 생성 및推론을 구현하여 아랍어의 이해력을 높이는 것을 목표로 합니다. Pronoia는 다언어 LLM의 선도적인 제품 중 하나이며, 방언, 고전적 형식 및 현대 표준 아랍어를 위한 최적화가 있습니다. 이 모델은 콘텐츠 생성, 요약, 번역, 고객 지원 및 대화형 AI를 위한 업무로 사용할 수 있습니다. 이를 위해 Arabic 데이터에 집중적인 훈련을 통해 Pronoia는 일반모델이 비일관적으로 다루는 형태학, 의문점, 그리고 문화적 맥락을 표적하고 있습니다.

평가 기준 분해

Ease of use1
Value for money0
Features & power1
Integrations0
Support & docs0
Reliability1
  • 아랍어 최적화 언어 모델
  • 텍스트 생성 및 요약
  • 번역 지원
  • 대화 및 챗봇 기능
  • 기업용 아랍어 NLP를 위한 맞춤
  • 공식 아랍어 및 방언에 대한 지원
5Gemini 2.0 Flash logo

Gemini 2.0 Flash

구글의 빠른, 다채널 기호 AI 모델은 실시간 행동 주체로 작성할 수 있는 1M-token 컨텍스트 window.

4.6 (5)
무료
Gemini 2.0 Flash의 스크린샷

Gemini 2.0 Flash는 구글 디프마인드가 속도, 규모 및 다채널적 사유를 위해 최적화한 다음세대 모델입니다. 텍스트, 이미지, 오디오 및 비디오로 입력을 받으며 텍스트, 이미지 및 오디오로 출력을 생성できる 것이므로, 풍부한 인터랙티브 애플리케이션에 적합합니다. 제 2세대 Gemini 플래시 모델은 에이전트 워크플로우를 위한 구축 목적으로 설계되었으며 1 million 토큰 컨텍스트 창은 대형 문서, 코드베이스 또는 로그인 세션을 다루기에 적합합니다. 저-latency는 가교 역할을 하는 보조 인공 지능, 실시간 분석 및 프로덕션 규모 의 배포에서 유용한 실용적인 선택입니다. _gemini 2.0 flash_ 개발자들은 _gemini API_, 구글 AI 스튜디오, 및 벡서스 아이( Vertex AI )를 통해 _gemini 2.0 flash_에 액세스할 수 있습니다. 주요 언어를 지원하는 SDK도 제공됩니다.

평가 기준 분해

Ease of use0
Value for money1
Features & power1
Integrations0
Support & docs0
Reliability0
  • 1M-token 컨텍스트 window
  • 다채널 입력: 문장, 이미지, 오디오, 비디오
  • 원시 도구 호출 및 코드 실행
  • 실시간 스트리밍 응답
  • 이미지 및 오디오 생성
  • Gemini API 및 Vertex AI를 통해 이용 가능