지난 배틀 · 2024-01-17 UTC
LLM 대결 — 2024년 1월 17일
LLM 카테고리에서. 8개의 참가자에 걸쳐 37 표시가 배치되었습니다. ASI:One이(가) 왕좌를 차지했습니다.
최종 순위
출전 라인업
참가자들
이 배틀에 참가한 모든 도구의 프로필, 최종 점수순으로 순위가 매겨졌습니다.

ASI:One은 기관적 지능(gnostic intelligence)이라는 개념을 중심으로 구축한 인공지능(AI)_assistant이다. 이는 자연어 인터페이스(natural language interface)가 복잡한 요청을 처리하기 위해 dispatch하고 specialize autonomous agent를 coordinate하고, 사용자 대신 workflows를 planning, calling, executing할 수 있게 해준다. ASI:One은 인자Artificial Superintelligence Alliance 생태계에서 개발된 개인용 AI 에이전트로, 분권화된 에이전트 네트워크와 통합할 수 있습니다. 사용자는 일상적인 질문에 답하거나, 연관된 서비스에 걸쳐서 연구, 비교, 일정 관리, 데이터 검색 등의 긴 과제를 위임하여 대화할 수 있습니다.
평가 기준 분해
- 대화식 채팅 인터페이스
- 자율주체 오케스트레이션
- 다단계 작업 계획 및 실행
- 외부 에이전트 및 서비스와의 연결성
- 개인용 보조工具 스타일 메모리 및 컨텍스트
- ASI 앨라이언스 에이전트 스택으로 구축됨


Gemini 2.0 Flash는 구글 디프마인드가 속도, 규모 및 다채널적 사유를 위해 최적화한 다음세대 모델입니다. 텍스트, 이미지, 오디오 및 비디오로 입력을 받으며 텍스트, 이미지 및 오디오로 출력을 생성できる 것이므로, 풍부한 인터랙티브 애플리케이션에 적합합니다. 제 2세대 Gemini 플래시 모델은 에이전트 워크플로우를 위한 구축 목적으로 설계되었으며 1 million 토큰 컨텍스트 창은 대형 문서, 코드베이스 또는 로그인 세션을 다루기에 적합합니다. 저-latency는 가교 역할을 하는 보조 인공 지능, 실시간 분석 및 프로덕션 규모 의 배포에서 유용한 실용적인 선택입니다. _gemini 2.0 flash_ 개발자들은 _gemini API_, 구글 AI 스튜디오, 및 벡서스 아이( Vertex AI )를 통해 _gemini 2.0 flash_에 액세스할 수 있습니다. 주요 언어를 지원하는 SDK도 제공됩니다.
평가 기준 분해
- 1M-token 컨텍스트 window
- 다채널 입력: 문장, 이미지, 오디오, 비디오
- 원시 도구 호출 및 코드 실행
- 실시간 스트리밍 응답
- 이미지 및 오디오 생성
- Gemini API 및 Vertex AI를 통해 이용 가능


Mistral Small 3는 경량화된 미래 시대 규모 언어 모델(Mistral AI)입니다. 효율적으로 중저비용 하드웨어에서 작동하며, 강력한 추론 및 생성 기능을 제공합니다. FRONTIER급 모델의 인프라 비용 없이도 강력한 AI를 필요한 개발자 및 조직에게 제공합니다. 오픈 라이선스 하에서 출시된 모델은 자체 호스팅,fine-tuning, 그리고 상업적 애플리케이션에 통합할 수 있습니다. 속도, 정밀도 및 리소스 효율의 적절한 균형으로 채팅 보조자, 콘텐츠 생성, 코드 작업, 그리고 latency 또는 개인정보 보호에 중요성이 높은 온프레미스 배포에 적합합니다.
평가 기준 분해
- 오픈 가중치 모델 릴리스
- -efficient inference를 위한 최적화
- 경쟁 우위의 벤치마크 결과
- fine-tuning 및 맞춤 설정을 지원합니다
- 온프레미스 배포를 위한 적합
- 다국어 텍스트 생성

OpenAI o3는 미래의 추론 모델로, 반복적이고 점진적인 사소한 문제를 해결하는 데 특별히 적합하다. o-시리즈 접근법을 기반으로 계산을 인페런스 시간에 더 많이 사용하여 답안을 계획하고, 검증하고, 수정할 수 있는 OpenAI o3는 수학, 프로그래밍, 과학, 이론 논증과 같은 과학 및 논리적 분석과 같은 다양한 과제에 가장 잘 적합합니다. 일반-purpose 대화 모델과 비교すると o3에서는 깊이(depth)가 속도(speed)보다 중요시된다. 모호한 시도(request)을 분해하고 다차원적인 접근법(evaluate multiple approaches)을 수행하며, 사고력과 tool 사용을 강조하는 벤치마크(benchmarks)에서 신뢰할 수 있는 출력을 생산한다. 개발자들은 OpenAI API와 ChatGPT를 통해 접근할 수 있으며, 웹 브라우징, Python, 및 파일 분석 과 같은 도구와 통합되어있는데, o3의 API는 이러한 도구와 쉽게 결합할 수 있게한다. 모델은 연구원, 엔지니어, 고급 사용자들을 위해 설계되어 어려운 문제에서 더 높은 정확도를 필요로 하는 사람들을 위한 것으로, 낮은 대기 시간과 낮은 비용을 선택해서는 안 되는 결과의 좀 더 높은 품질을 선택하여야 한다고 명시한다.
평가 기준 분해
- 연쇄적 사고 모델 확장
- 기능도구 포함, 코드, 웹, 및 파일 입력
- 장기문서를 위한 커다란 문맥 윈도우
- API 및 ChatGPT 이용 가능성
- STEM 성능 향상
- 복잡한 에이전シー 워크 플로우 지원

DeepSeek R1
논리 추론, 수학, 프로그래밍 업무에 있어서 전문성을 가지는 오픈 소스 인공지능 모델이며 MIT 라이선스 아래 자유롭게 사용 및 수정이 가능합니다.

DeepSeek R1은 추론, 수학 및 프로그래밍과 같은 과제에서 뛰어난 성능을 보이는 오픈 소스 언어 모델입니다. Mixture of Experts (MoE) 구조를 활용하여 37B의 활성 매개변수와 671B의 총 매개변수를 support 하여 128K의 컨텍스트 길이를 지지한다. 모델은 진화 적학습 기법을 사용하여 자가 검증, 다단계 반영 및 인간 중심 추론 기능을 포함한다. DeepSeek R1은 MATH-500에서 97.3%의 정확도를, AIME 2024에서 79.8%의 통과율을 달성하였으며, Codeforces 참여자가 96.3%를 초과하는 성과를 보여주는 최첨단 성능을 달성하였다. 모델에는 다양한 매개변수인 1.5B에서 70B까지 다양한 버전이 있으며, MIT라이센스를 사용하여 무료 사용 및 수정이 가능하다. DeepSeek R1은 온라인으로 무료로 사용 가능하며, WebGPU 가속 버전을 사용하여 브라우저 내에서 로컬에서 실행 할 수 있어야 한다. DeepSeek R1 모델의 주요 목적은 복잡한 문제 해결, 다언어 이해, 그리고 제한이 없는 코드 생상 기능을 제공하는 것입니다. 이 모델의 강점은 우수한 수학적 추론 기능, 코드 생상, 자연어 이해 능력을 보유하고 있습니다. 하지만 공개 소스 모델인만큼, 도배하고 세부적인 용도로 최적화하기 위해서는 전문적인 지식이 필요할 수 있습니다. 디프스EEK R1은 전 세계적으로 주력하는 AI 모델 가운데 가장 성과가 좋은 위치에 있다. 주요 비밀장치 솔루션과 견줄만한 성능이 있는 이 기술은 오픈 소스 특성으로 인해 커뮤니티에서 참여한 개발 및 지속적인 업그레이드를 통해, planned 멀티 모달 지원, 대화 증진, 분산 인퍼런스 최적화 등을 계획하고 있다. 모델은 pure reinforcement learning 개발 방식으로 GPT-4 수준의 수학적인 성능을 낮은 비용으로 달성할 수 있게 해준다. chain-of-thought 시각화 기능은 AI '검은 상자의' 도전 과제를 해결하면서, 모델이 가지고 있는 합리화 과정에 대한 통찰력을 제공한다. DeepSeek R1의 API는 OpenAI 호환 엔드포인트를 제공하며, 1 억의 토큰당 0.14 달러의 가격으로 통합할 수 있습니다. 모델의 가중치도 오픈 소스이기 때문에 상용 활용 및 변경이 가능합니다.
평가 기준 분해
- Expert들의 조합(Mixture of Experts) 아키텍처
- 강화학습 기법
- 자체 검증 및 다단계 반영 기능
- 인간 중심 논리 추론
- 128K 글자 길이의 컨텍스트 지원
- OpenAI 호환 API 엔드 포인트


DeepSeek V3는 DeepSeek AI가 개발한 대규모 혼합 전문가 (MoE)atural Language Model 이다._token당_only 특정 파라미터만 사용하여, 그것은 합리화, 수학, 프로그래밍 과제에서 강력한 성능을 제공하면서 유사한密집합 모델보다 추론 비용이_significantly 낮게抑制하는 기능을 갖추고 있다. DeepSeek V3으로 출시된 모델이 공개 가중치로 제공되었기 때문에 개발자 및 연구원이 자체 호스팅, 미세 조정, 또는 API를 통해 통합할 수 있는 훌륭한 기반 모델로 인기가 많은 편입니다. 벤치마크 결과 DeepSeek V3는 수학 및 논리적 사고 평가와 같은 특정 평가 기준에서 우수 성능을 보인 다른 소유권 모델들인 GPT-4o와 경쟁력을 보유하고 있습니다. DeepSeek V3 모델은 기술 보조자, 코드 생성 파이프라인, 연구 워크플로우, 그리고 합리성과 예산 효율성이 모두 중요하는 모든 애플리케이션들을 지원하기에 적절합니다.
평가 기준 분해
- Mixture-of-experts 구조
- 경쟁적 추론 및 수학 성능 벤치마크
- 오픈 소스 모델 가중치
- DeepSeek 플랫폼을 통한 API 액세스
- 장치 창에 대한 지원
- Fine-tuning 친화적

Llama 3.3은 Meta에서 개발한 큰 언어 모델로, 강력한 추론, 프로그래밍 및 다언어 능력을 제공하는 반면 earlier flagship 모델보다 더 효율적인 실행을 가능하게합니다. 그것은 다양한 언어를 지원하며 채팅 보조기, 콘텐츠 생성, 요약, 및 개발자 툴잉과 같은 다양한 활용을 위한 적합합니다. 나열된 가중치를 통해 공개된 것을 가지고 있어 기업의 자부담 설치와 클라우드 및 추론 제공사에 의한 설치가 자유롭습니다. 이를 통해 팀은 비용, 지연시간 및 데이터 처리에 대한 유연성을 가지게 됩니다. 명령어를 위한 최적화를 거친 변형은 명령어에 대한 정확한 반응과 도움이 되는 대화의 반응을 제공합니다. 개발자들은 Llama 3.3을 주로 도메인별 특화된 애플리케이션, 수집-augmentation 전달 시스템, 그리고 주체적 워크플로우 등에 대한 fine-tuning 목적으로 사용합니다.
평가 기준 분해
- 다언어 텍스트 생성
- instruction 튼 챗 버전
- 장기문맥 지원
- 코딩 및 사유 능력
- [LMM] 개방 가중치
- 주요 추론 프레임워크와 호환
Pronoia는 특정 언어에 최적화되어있는 대규모 자연어 처리 모델 중 하나입니다. 이는 일반 대다수 언어 모델보다 정확한 이해, 생성 및推론을 구현하여 아랍어의 이해력을 높이는 것을 목표로 합니다. Pronoia는 다언어 LLM의 선도적인 제품 중 하나이며, 방언, 고전적 형식 및 현대 표준 아랍어를 위한 최적화가 있습니다. 이 모델은 콘텐츠 생성, 요약, 번역, 고객 지원 및 대화형 AI를 위한 업무로 사용할 수 있습니다. 이를 위해 Arabic 데이터에 집중적인 훈련을 통해 Pronoia는 일반모델이 비일관적으로 다루는 형태학, 의문점, 그리고 문화적 맥락을 표적하고 있습니다.
평가 기준 분해
- 아랍어 최적화 언어 모델
- 텍스트 생성 및 요약
- 번역 지원
- 대화 및 챗봇 기능
- 기업용 아랍어 NLP를 위한 맞춤
- 공식 아랍어 및 방언에 대한 지원







