지난 배틀 · 2024-01-17 UTC

LLM 대결 — 2024년 1월 17일

LLM 카테고리에서. 8개의 참가자에 걸쳐 37 표시가 배치되었습니다. ASI:One이(가) 왕좌를 차지했습니다.

최종 순위

출전 라인업

참가자들

이 배틀에 참가한 모든 도구의 프로필, 최종 점수순으로 순위가 매겨졌습니다.

1ASI:One logo

ASI:One

자율성 있는 AI 보조工具이 다단계 작업을 수행하기 위해 자율주체를 조정하는 에이전트

4.5 (4)
무료
ASI:One의 스크린샷

ASI:One은 기관적 지능(gnostic intelligence)이라는 개념을 중심으로 구축한 인공지능(AI)_assistant이다. 이는 자연어 인터페이스(natural language interface)가 복잡한 요청을 처리하기 위해 dispatch하고 specialize autonomous agent를 coordinate하고, 사용자 대신 workflows를 planning, calling, executing할 수 있게 해준다. ASI:One은 인자Artificial Superintelligence Alliance 생태계에서 개발된 개인용 AI 에이전트로, 분권화된 에이전트 네트워크와 통합할 수 있습니다. 사용자는 일상적인 질문에 답하거나, 연관된 서비스에 걸쳐서 연구, 비교, 일정 관리, 데이터 검색 등의 긴 과제를 위임하여 대화할 수 있습니다.

평가 기준 분해

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • 대화식 채팅 인터페이스
  • 자율주체 오케스트레이션
  • 다단계 작업 계획 및 실행
  • 외부 에이전트 및 서비스와의 연결성
  • 개인용 보조工具 스타일 메모리 및 컨텍스트
  • ASI 앨라이언스 에이전트 스택으로 구축됨
2Gemini 2.0 Flash logo

Gemini 2.0 Flash

구글의 빠른, 다채널 기호 AI 모델은 실시간 행동 주체로 작성할 수 있는 1M-token 컨텍스트 window.

4.6 (5)
무료
Gemini 2.0 Flash의 스크린샷

Gemini 2.0 Flash는 구글 디프마인드가 속도, 규모 및 다채널적 사유를 위해 최적화한 다음세대 모델입니다. 텍스트, 이미지, 오디오 및 비디오로 입력을 받으며 텍스트, 이미지 및 오디오로 출력을 생성できる 것이므로, 풍부한 인터랙티브 애플리케이션에 적합합니다. 제 2세대 Gemini 플래시 모델은 에이전트 워크플로우를 위한 구축 목적으로 설계되었으며 1 million 토큰 컨텍스트 창은 대형 문서, 코드베이스 또는 로그인 세션을 다루기에 적합합니다. 저-latency는 가교 역할을 하는 보조 인공 지능, 실시간 분석 및 프로덕션 규모 의 배포에서 유용한 실용적인 선택입니다. _gemini 2.0 flash_ 개발자들은 _gemini API_, 구글 AI 스튜디오, 및 벡서스 아이( Vertex AI )를 통해 _gemini 2.0 flash_에 액세스할 수 있습니다. 주요 언어를 지원하는 SDK도 제공됩니다.

평가 기준 분해

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • 1M-token 컨텍스트 window
  • 다채널 입력: 문장, 이미지, 오디오, 비디오
  • 원시 도구 호출 및 코드 실행
  • 실시간 스트리밍 응답
  • 이미지 및 오디오 생성
  • Gemini API 및 Vertex AI를 통해 이용 가능
3Mistral Small 3 logo

Mistral Small 3

작은 규모의 오픈 소스 LLM으로 낮은 컴퓨팅 요구량과 함께 경쟁 우위를 자랑합니다.

4.5 (4)
무료
Mistral Small 3의 스크린샷

Mistral Small 3는 경량화된 미래 시대 규모 언어 모델(Mistral AI)입니다. 효율적으로 중저비용 하드웨어에서 작동하며, 강력한 추론 및 생성 기능을 제공합니다. FRONTIER급 모델의 인프라 비용 없이도 강력한 AI를 필요한 개발자 및 조직에게 제공합니다. 오픈 라이선스 하에서 출시된 모델은 자체 호스팅,fine-tuning, 그리고 상업적 애플리케이션에 통합할 수 있습니다. 속도, 정밀도 및 리소스 효율의 적절한 균형으로 채팅 보조자, 콘텐츠 생성, 코드 작업, 그리고 latency 또는 개인정보 보호에 중요성이 높은 온프레미스 배포에 적합합니다.

평가 기준 분해

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • 오픈 가중치 모델 릴리스
  • -efficient inference를 위한 최적화
  • 경쟁 우위의 벤치마크 결과
  • fine-tuning 및 맞춤 설정을 지원합니다
  • 온프레미스 배포를 위한 적합
  • 다국어 텍스트 생성
4OpenAI o3 logo

OpenAI o3

複잡한, 다단계 문제 해결을 위한 오픈 아이의 미들웨어 사고 모델

4.0 (4)
무료
OpenAI o3의 스크린샷

OpenAI o3는 미래의 추론 모델로, 반복적이고 점진적인 사소한 문제를 해결하는 데 특별히 적합하다. o-시리즈 접근법을 기반으로 계산을 인페런스 시간에 더 많이 사용하여 답안을 계획하고, 검증하고, 수정할 수 있는 OpenAI o3는 수학, 프로그래밍, 과학, 이론 논증과 같은 과학 및 논리적 분석과 같은 다양한 과제에 가장 잘 적합합니다. 일반-purpose 대화 모델과 비교すると o3에서는 깊이(depth)가 속도(speed)보다 중요시된다. 모호한 시도(request)을 분해하고 다차원적인 접근법(evaluate multiple approaches)을 수행하며, 사고력과 tool 사용을 강조하는 벤치마크(benchmarks)에서 신뢰할 수 있는 출력을 생산한다. 개발자들은 OpenAI API와 ChatGPT를 통해 접근할 수 있으며, 웹 브라우징, Python, 및 파일 분석 과 같은 도구와 통합되어있는데, o3의 API는 이러한 도구와 쉽게 결합할 수 있게한다. 모델은 연구원, 엔지니어, 고급 사용자들을 위해 설계되어 어려운 문제에서 더 높은 정확도를 필요로 하는 사람들을 위한 것으로, 낮은 대기 시간과 낮은 비용을 선택해서는 안 되는 결과의 좀 더 높은 품질을 선택하여야 한다고 명시한다.

평가 기준 분해

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • 연쇄적 사고 모델 확장
  • 기능도구 포함, 코드, 웹, 및 파일 입력
  • 장기문서를 위한 커다란 문맥 윈도우
  • API 및 ChatGPT 이용 가능성
  • STEM 성능 향상
  • 복잡한 에이전シー 워크 플로우 지원
5DeepSeek R1 logo

DeepSeek R1

논리 추론, 수학, 프로그래밍 업무에 있어서 전문성을 가지는 오픈 소스 인공지능 모델이며 MIT 라이선스 아래 자유롭게 사용 및 수정이 가능합니다.

4.8 (4)
무료
DeepSeek R1의 스크린샷

DeepSeek R1은 추론, 수학 및 프로그래밍과 같은 과제에서 뛰어난 성능을 보이는 오픈 소스 언어 모델입니다. Mixture of Experts (MoE) 구조를 활용하여 37B의 활성 매개변수와 671B의 총 매개변수를 support 하여 128K의 컨텍스트 길이를 지지한다. 모델은 진화 적학습 기법을 사용하여 자가 검증, 다단계 반영 및 인간 중심 추론 기능을 포함한다. DeepSeek R1은 MATH-500에서 97.3%의 정확도를, AIME 2024에서 79.8%의 통과율을 달성하였으며, Codeforces 참여자가 96.3%를 초과하는 성과를 보여주는 최첨단 성능을 달성하였다. 모델에는 다양한 매개변수인 1.5B에서 70B까지 다양한 버전이 있으며, MIT라이센스를 사용하여 무료 사용 및 수정이 가능하다. DeepSeek R1은 온라인으로 무료로 사용 가능하며, WebGPU 가속 버전을 사용하여 브라우저 내에서 로컬에서 실행 할 수 있어야 한다. DeepSeek R1 모델의 주요 목적은 복잡한 문제 해결, 다언어 이해, 그리고 제한이 없는 코드 생상 기능을 제공하는 것입니다. 이 모델의 강점은 우수한 수학적 추론 기능, 코드 생상, 자연어 이해 능력을 보유하고 있습니다. 하지만 공개 소스 모델인만큼, 도배하고 세부적인 용도로 최적화하기 위해서는 전문적인 지식이 필요할 수 있습니다. 디프스EEK R1은 전 세계적으로 주력하는 AI 모델 가운데 가장 성과가 좋은 위치에 있다. 주요 비밀장치 솔루션과 견줄만한 성능이 있는 이 기술은 오픈 소스 특성으로 인해 커뮤니티에서 참여한 개발 및 지속적인 업그레이드를 통해, planned 멀티 모달 지원, 대화 증진, 분산 인퍼런스 최적화 등을 계획하고 있다. 모델은 pure reinforcement learning 개발 방식으로 GPT-4 수준의 수학적인 성능을 낮은 비용으로 달성할 수 있게 해준다. chain-of-thought 시각화 기능은 AI '검은 상자의' 도전 과제를 해결하면서, 모델이 가지고 있는 합리화 과정에 대한 통찰력을 제공한다. DeepSeek R1의 API는 OpenAI 호환 엔드포인트를 제공하며, 1 억의 토큰당 0.14 달러의 가격으로 통합할 수 있습니다. 모델의 가중치도 오픈 소스이기 때문에 상용 활용 및 변경이 가능합니다.

평가 기준 분해

Ease of use0
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Expert들의 조합(Mixture of Experts) 아키텍처
  • 강화학습 기법
  • 자체 검증 및 다단계 반영 기능
  • 인간 중심 논리 추론
  • 128K 글자 길이의 컨텍스트 지원
  • OpenAI 호환 API 엔드 포인트
6DeepSeek V3 logo

DeepSeek V3

오픈 소스 mixture-of-experts 모델로 GPT-4 단계의 주관호적 사고 능력 1/4의 비용만 내면 됩니다.

4.8 (6)
무료
DeepSeek V3의 스크린샷

DeepSeek V3는 DeepSeek AI가 개발한 대규모 혼합 전문가 (MoE)atural Language Model 이다._token당_only 특정 파라미터만 사용하여, 그것은 합리화, 수학, 프로그래밍 과제에서 강력한 성능을 제공하면서 유사한密집합 모델보다 추론 비용이_significantly 낮게抑制하는 기능을 갖추고 있다. DeepSeek V3으로 출시된 모델이 공개 가중치로 제공되었기 때문에 개발자 및 연구원이 자체 호스팅, 미세 조정, 또는 API를 통해 통합할 수 있는 훌륭한 기반 모델로 인기가 많은 편입니다. 벤치마크 결과 DeepSeek V3는 수학 및 논리적 사고 평가와 같은 특정 평가 기준에서 우수 성능을 보인 다른 소유권 모델들인 GPT-4o와 경쟁력을 보유하고 있습니다. DeepSeek V3 모델은 기술 보조자, 코드 생성 파이프라인, 연구 워크플로우, 그리고 합리성과 예산 효율성이 모두 중요하는 모든 애플리케이션들을 지원하기에 적절합니다.

평가 기준 분해

Ease of use1
Value for money1
Features & power0
Integrations0
Support & docs1
Reliability0
  • Mixture-of-experts 구조
  • 경쟁적 추론 및 수학 성능 벤치마크
  • 오픈 소스 모델 가중치
  • DeepSeek 플랫폼을 통한 API 액세스
  • 장치 창에 대한 지원
  • Fine-tuning 친화적
7Llama 3.3 logo

Llama 3.3

효율적이고 고품질의 텍스트 생성을 위한 멀티 언어 개방 가중치의 LLM

4.8 (5)
무료
Llama 3.3의 스크린샷

Llama 3.3은 Meta에서 개발한 큰 언어 모델로, 강력한 추론, 프로그래밍 및 다언어 능력을 제공하는 반면 earlier flagship 모델보다 더 효율적인 실행을 가능하게합니다. 그것은 다양한 언어를 지원하며 채팅 보조기, 콘텐츠 생성, 요약, 및 개발자 툴잉과 같은 다양한 활용을 위한 적합합니다. 나열된 가중치를 통해 공개된 것을 가지고 있어 기업의 자부담 설치와 클라우드 및 추론 제공사에 의한 설치가 자유롭습니다. 이를 통해 팀은 비용, 지연시간 및 데이터 처리에 대한 유연성을 가지게 됩니다. 명령어를 위한 최적화를 거친 변형은 명령어에 대한 정확한 반응과 도움이 되는 대화의 반응을 제공합니다. 개발자들은 Llama 3.3을 주로 도메인별 특화된 애플리케이션, 수집-augmentation 전달 시스템, 그리고 주체적 워크플로우 등에 대한 fine-tuning 목적으로 사용합니다.

평가 기준 분해

Ease of use0
Value for money0
Features & power1
Integrations1
Support & docs1
Reliability0
  • 다언어 텍스트 생성
  • instruction 튼 챗 버전
  • 장기문맥 지원
  • 코딩 및 사유 능력
  • [LMM] 개방 가중치
  • 주요 추론 프레임워크와 호환
8Pronoia logo

Pronoia

아랍어 최적화된 대용량 언어 모델의 이해와 생성을 위한 고난도 트레이닝

4.7 (6)
무료

Pronoia는 특정 언어에 최적화되어있는 대규모 자연어 처리 모델 중 하나입니다. 이는 일반 대다수 언어 모델보다 정확한 이해, 생성 및推론을 구현하여 아랍어의 이해력을 높이는 것을 목표로 합니다. Pronoia는 다언어 LLM의 선도적인 제품 중 하나이며, 방언, 고전적 형식 및 현대 표준 아랍어를 위한 최적화가 있습니다. 이 모델은 콘텐츠 생성, 요약, 번역, 고객 지원 및 대화형 AI를 위한 업무로 사용할 수 있습니다. 이를 위해 Arabic 데이터에 집중적인 훈련을 통해 Pronoia는 일반모델이 비일관적으로 다루는 형태학, 의문점, 그리고 문화적 맥락을 표적하고 있습니다.

평가 기준 분해

Ease of use0
Value for money1
Features & power0
Integrations1
Support & docs0
Reliability0
  • 아랍어 최적화 언어 모델
  • 텍스트 생성 및 요약
  • 번역 지원
  • 대화 및 챗봇 기능
  • 기업용 아랍어 NLP를 위한 맞춤
  • 공식 아랍어 및 방언에 대한 지원