지난 배틀 · 2025-08-08 UTC

LLM 대결 — 2025년 8월 8일

LLM 카테고리에서. 6개의 참가자에 걸쳐 28 표시가 배치되었습니다. DeepSeek V3이(가) 왕좌를 차지했습니다.

최종 순위

출전 라인업

참가자들

이 배틀에 참가한 모든 도구의 프로필, 최종 점수순으로 순위가 매겨졌습니다.

1DeepSeek V3 logo

DeepSeek V3

오픈 소스 mixture-of-experts 모델로 GPT-4 단계의 주관호적 사고 능력 1/4의 비용만 내면 됩니다.

4.8 (6)
무료
DeepSeek V3의 스크린샷

DeepSeek V3는 DeepSeek AI가 개발한 대규모 혼합 전문가 (MoE)atural Language Model 이다._token당_only 특정 파라미터만 사용하여, 그것은 합리화, 수학, 프로그래밍 과제에서 강력한 성능을 제공하면서 유사한密집합 모델보다 추론 비용이_significantly 낮게抑制하는 기능을 갖추고 있다. DeepSeek V3으로 출시된 모델이 공개 가중치로 제공되었기 때문에 개발자 및 연구원이 자체 호스팅, 미세 조정, 또는 API를 통해 통합할 수 있는 훌륭한 기반 모델로 인기가 많은 편입니다. 벤치마크 결과 DeepSeek V3는 수학 및 논리적 사고 평가와 같은 특정 평가 기준에서 우수 성능을 보인 다른 소유권 모델들인 GPT-4o와 경쟁력을 보유하고 있습니다. DeepSeek V3 모델은 기술 보조자, 코드 생성 파이프라인, 연구 워크플로우, 그리고 합리성과 예산 효율성이 모두 중요하는 모든 애플리케이션들을 지원하기에 적절합니다.

평가 기준 분해

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Mixture-of-experts 구조
  • 경쟁적 추론 및 수학 성능 벤치마크
  • 오픈 소스 모델 가중치
  • DeepSeek 플랫폼을 통한 API 액세스
  • 장치 창에 대한 지원
  • Fine-tuning 친화적
2Janus pro logo

Janus pro

멀티모달 모델을 위한 오픈한 이미지 생성 및 시각적 이해의 통합 구조 : DeepSeek

4.8 (4)
무료
Janus pro의 스크린샷

Janus Pro는 DeepSeek에서 제공하는 오픈 소스 다모달 AI 모델입니다. 매개 변수 버전은 1B와 7B이 있습니다. 시각 understands와 이미지를 생성하는 것을 통합 framework에 넣고, 시각 encoding pathways를 분리하여 모델을 이미지를 해석하고 text prompts로 이미지를 만드는 데 사용합니다. 7B 변형은 텍스트로부터 이미지 생성 및 시각적 질문 처리 성능을 위한 벤치마크에서 경쟁적인 결과를 제공한다. 더 큰 특화 모델의 성능을 매칭하거나 넘어서는 경우가 있기도 하다. MIT 라이선스로 출시된 제니스 프로는 사용 제한 없이 자기 호스트, 튜닝, 프로덕션 및 연구 파이프 라인에 통합이 가능하다. 개발자, 연구원 및 enthusiats를 위한 일련의 멀티모달 기초 모델이 필요한 경우, Janus pro가 유연성 및 실험, 프로젝트 빌딩, 또는 이미지 생성과 이미지 이해를 결합하는 응용 프로그램 만들기와 같은 용도로 적합합니다.

평가 기준 분해

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • 텍스트-to-이미지 생성
  • 시각 질문을 받는 및 이미지 분석
  • 통합 변환기 구조
  • 1B 및 7B 매개변수 옵션
  • MIT-라이선스 오픈 가중치
  • 다중 모드 입력 및 출력 지원
3DeepSeek R1 logo

DeepSeek R1

논리 추론, 수학, 프로그래밍 업무에 있어서 전문성을 가지는 오픈 소스 인공지능 모델이며 MIT 라이선스 아래 자유롭게 사용 및 수정이 가능합니다.

4.8 (4)
무료
DeepSeek R1의 스크린샷

DeepSeek R1은 추론, 수학 및 프로그래밍과 같은 과제에서 뛰어난 성능을 보이는 오픈 소스 언어 모델입니다. Mixture of Experts (MoE) 구조를 활용하여 37B의 활성 매개변수와 671B의 총 매개변수를 support 하여 128K의 컨텍스트 길이를 지지한다. 모델은 진화 적학습 기법을 사용하여 자가 검증, 다단계 반영 및 인간 중심 추론 기능을 포함한다. DeepSeek R1은 MATH-500에서 97.3%의 정확도를, AIME 2024에서 79.8%의 통과율을 달성하였으며, Codeforces 참여자가 96.3%를 초과하는 성과를 보여주는 최첨단 성능을 달성하였다. 모델에는 다양한 매개변수인 1.5B에서 70B까지 다양한 버전이 있으며, MIT라이센스를 사용하여 무료 사용 및 수정이 가능하다. DeepSeek R1은 온라인으로 무료로 사용 가능하며, WebGPU 가속 버전을 사용하여 브라우저 내에서 로컬에서 실행 할 수 있어야 한다. DeepSeek R1 모델의 주요 목적은 복잡한 문제 해결, 다언어 이해, 그리고 제한이 없는 코드 생상 기능을 제공하는 것입니다. 이 모델의 강점은 우수한 수학적 추론 기능, 코드 생상, 자연어 이해 능력을 보유하고 있습니다. 하지만 공개 소스 모델인만큼, 도배하고 세부적인 용도로 최적화하기 위해서는 전문적인 지식이 필요할 수 있습니다. 디프스EEK R1은 전 세계적으로 주력하는 AI 모델 가운데 가장 성과가 좋은 위치에 있다. 주요 비밀장치 솔루션과 견줄만한 성능이 있는 이 기술은 오픈 소스 특성으로 인해 커뮤니티에서 참여한 개발 및 지속적인 업그레이드를 통해, planned 멀티 모달 지원, 대화 증진, 분산 인퍼런스 최적화 등을 계획하고 있다. 모델은 pure reinforcement learning 개발 방식으로 GPT-4 수준의 수학적인 성능을 낮은 비용으로 달성할 수 있게 해준다. chain-of-thought 시각화 기능은 AI '검은 상자의' 도전 과제를 해결하면서, 모델이 가지고 있는 합리화 과정에 대한 통찰력을 제공한다. DeepSeek R1의 API는 OpenAI 호환 엔드포인트를 제공하며, 1 억의 토큰당 0.14 달러의 가격으로 통합할 수 있습니다. 모델의 가중치도 오픈 소스이기 때문에 상용 활용 및 변경이 가능합니다.

평가 기준 분해

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability0
  • Expert들의 조합(Mixture of Experts) 아키텍처
  • 강화학습 기법
  • 자체 검증 및 다단계 반영 기능
  • 인간 중심 논리 추론
  • 128K 글자 길이의 컨텍스트 지원
  • OpenAI 호환 API 엔드 포인트
4ASI:One logo

ASI:One

자율성 있는 AI 보조工具이 다단계 작업을 수행하기 위해 자율주체를 조정하는 에이전트

4.5 (4)
무료
ASI:One의 스크린샷

ASI:One은 기관적 지능(gnostic intelligence)이라는 개념을 중심으로 구축한 인공지능(AI)_assistant이다. 이는 자연어 인터페이스(natural language interface)가 복잡한 요청을 처리하기 위해 dispatch하고 specialize autonomous agent를 coordinate하고, 사용자 대신 workflows를 planning, calling, executing할 수 있게 해준다. ASI:One은 인자Artificial Superintelligence Alliance 생태계에서 개발된 개인용 AI 에이전트로, 분권화된 에이전트 네트워크와 통합할 수 있습니다. 사용자는 일상적인 질문에 답하거나, 연관된 서비스에 걸쳐서 연구, 비교, 일정 관리, 데이터 검색 등의 긴 과제를 위임하여 대화할 수 있습니다.

평가 기준 분해

Ease of use0
Value for money0
Features & power1
Integrations1
Support & docs1
Reliability1
  • 대화식 채팅 인터페이스
  • 자율주체 오케스트레이션
  • 다단계 작업 계획 및 실행
  • 외부 에이전트 및 서비스와의 연결성
  • 개인용 보조工具 스타일 메모리 및 컨텍스트
  • ASI 앨라이언스 에이전트 스택으로 구축됨
5Latest DeepSeek R2 logo

Latest DeepSeek R2

다음세대 사고를 중심으로 한 인공지능 모델: DeepSeek

4.8 (6)
무료
Latest DeepSeek R2의 스크린샷

최신 DeepSeek R2은 지능형 문제 해결을 위한 DeepSeek의 R1 사유 모델의 후속 제품으로, 수학, 프로그래밍, 분석적 작업에 걸쳐 강화된 단계별 문제 해결을 제공하고 있습니다. 개발자와 연구원이 이전 DeepSeek 릴리즈의 개방형 연구 접근 방식을 사용해 사랑했던 것을 확장하는 것을 목표로합니다. "최신 DeepSeek R2 모델은 기존 버전보다 정확성 향상, 긴맥처 처리, 그리고 inference 효율성을 향상시킵니다. 이로 인해 기술적인 보조 프로그램, 에이젼트 워크 플로우, 및 사용자 정의 애플리케이션에 내장되는 데 적합합니다. DeepSeek의 공식 릴리즈 채널에 따라 제공 및 정확한 사양은 릴리즈의 의존됩니다." 사용자는 일반적으로 API를 통해, 채팅 인터페이스, 또는 open weights가 제공될 때 모델을 실행하여, individal 실험 및 프로덕션 배포에 필요한 유연성을 제공합니다.

평가 기준 분해

Ease of use1
Value for money1
Features & power1
Integrations0
Support & docs0
Reliability1
  • 상계 사고 사슬
  • 확장된 맥락 창
  • 코드 생성 및 디버깅 지원
  • 다언어 이해
  • API 및 채팅 기반 액세스
  • 전담적 애플리케이션에 적합
6Pronoia logo

Pronoia

아랍어 최적화된 대용량 언어 모델의 이해와 생성을 위한 고난도 트레이닝

4.7 (6)
무료

Pronoia는 특정 언어에 최적화되어있는 대규모 자연어 처리 모델 중 하나입니다. 이는 일반 대다수 언어 모델보다 정확한 이해, 생성 및推론을 구현하여 아랍어의 이해력을 높이는 것을 목표로 합니다. Pronoia는 다언어 LLM의 선도적인 제품 중 하나이며, 방언, 고전적 형식 및 현대 표준 아랍어를 위한 최적화가 있습니다. 이 모델은 콘텐츠 생성, 요약, 번역, 고객 지원 및 대화형 AI를 위한 업무로 사용할 수 있습니다. 이를 위해 Arabic 데이터에 집중적인 훈련을 통해 Pronoia는 일반모델이 비일관적으로 다루는 형태학, 의문점, 그리고 문화적 맥락을 표적하고 있습니다.

평가 기준 분해

Ease of use1
Value for money0
Features & power1
Integrations1
Support & docs0
Reliability0
  • 아랍어 최적화 언어 모델
  • 텍스트 생성 및 요약
  • 번역 지원
  • 대화 및 챗봇 기능
  • 기업용 아랍어 NLP를 위한 맞춤
  • 공식 아랍어 및 방언에 대한 지원