最終結果
ラインナップ
参戦ツール
このバトルに参戦したすべてのツールの紹介。最終スコア順。


DeepSeek R1は、推論、数学、コーディングタスクで優秀なオープンソースの大規模言語モデルです。 Mixture of Experts (MoE)アーキテクチャを使用し、37億の活性パラメータと671億のパラメータで構成されており、128Kのコンテキスト長をサポートしています。このモデルには、自己検証、多ステップ反射、人間に指向した推論能力を実現するために高度な強化学習技術が組み込まれています。 DeepSeek R1は、MATH-500で97.3%の精度を実現したり、AIME 2024で79.8%の合格率を達成したりしたり、Codeforcesの99.7%のパートicipantを上回るなどのベンチマークでベストパフォーマンスを達成しました。 本モデルは、1.5Bから70Bパラメータまでの多様なバリエーションで利用可能であり、MITライセンス下で無償利用および変更が可能です。DeepSeek R1はオンラインで利用可能で、WebGPU加速版はブラウザでローカルに実行できます。 このモデルは、複雑な問題解決、多言語理解、および生産性で使えるコード生成に設計されています。また、優れた数学的推論、コード生成、自然言語理解の能力もあります。しかし、オープンソースモデルであるため、特定の用途向けに配置およびフィンガープリントしなければならないため、技術的専門知識が必要になる場合があります。 DeepSeek R1は、グローバルでトップパフォーマンスのAIモデルに位置付けられており、リーディングのパブリックなソリューションと比較して優れた機能を備えています。オープンソースの性質により、コミュニティ ドライブの開発が実現し、計画的なマルチモーダルサポート、会話の向上、分散的推論最適化などの継続的なアップグレードが可能になります。 DeepSeek R1 では、強化学習による純粋な開発が行われることで、GPT-4 レベルの学術的演算性能を、コストが格段に低く実現できる。 チェーンオブサーストVisualization機能は、AI "暗闇箱"(black box)の課題に対処し、モデルがどのように推論しているかについての洞察を提供する。 DeepSeek R1のAPIでは、OpenAIとの互換性はあるがAPIエンドポイントが用意されており、価格は1000万単語あたり0.14ドルです。モデルの重みはオープンソースであり、商用利用や変更が可能になります。
評価基準の詳細
- Mixture of Experts (MoE)アーキテクチャ
- Advanced強化学習手法
- 自己検証と多ステップ反映
- 人間に合致する推論
- 128Kコンテキスト長へのサポート
- OpenAI互換APIエンドポイント


Pixtral 12B 24.09はMistral AIから提供されるマルチモーダルモデルで、1つのシーケンス内で画像とテキストの両方を処理し、可変画像サイズとアスペクト比をサポートしています。 12億パラメータの言語デコーダを視覚エンコーダと組み合わせて使用すると、視覚質問応答、ドキュメント理解、チャート解釈、画像キャプションのタスクなどの機能が実現されます。 モデルは最大128Kトークンコンテキストを受け入れ、多数の画像を長文テキストと交互に提示したワードプромプを使うことを許可します。これにより、モデルは開発者が視覚言語アプリケーション、研究ワークフロー、および多モーダルエージェントを開発する際に、利用できるデータを幅広く拡大できます。 本モデルはオープンライセンスで提供され、ローカルにインストールできるほか、インファレンスプロバイダーを介したデプロイも可能です。
評価基準の詳細
- 12Bパラメータのビジョン言語モデル
- インターリーブ写真とテキスト入力
- 128Kトークンコンテキスト長
- ネイティブ変数画像サイズサポート
- オープンウェイトリリース
- OCR、VQA、キャプションツール用に適したもの


DeepSeek V3は、大規模 mixture-of-experts (MoE) 言語モデルであり、DeepSeek AIによって開発されました。 DeepSeek V3では、 1トークンあたっても、その総パラメータのサブセットだけが動作します。これにより、推論コストが類似する密集モデルに比べて、推論コストが大幅に下がって、論理、数学、プログラミングタスクで強力なパフォーマンスを達成できます。 Open_weightsでリリースされたDeepSeek V3は、開発者や研究者など、サーバー上でホストしたり、自社でトレーニングしたり、またはAPI経由で組み込んだりすることができる能力あるベースモデルとして人気を博しています。ベンチマークでは、数学的論理的推論評価でも含むトレードマークのある大手ベースモデルGPT-4oと競争力を発揮するようによく評価されています。 DeepSeek V3 は、技術アシスタント、コード生成パイプライン、研究ワークフロー、論理精度と予算効率の両方が重要となるアプリケーションのために適していると考えられています。
評価基準の詳細
- Mixture-of-experts architecture
- 競争的な推論と数学評価
- オープンソースのモデルウェイト
- DIPアクセスを介してDeepSeek プラットフォーム
- 長いコンテキストウィンドウサポート
- チューニングに友好的


