最終結果
ラインナップ
参戦ツール
このバトルに参戦したすべてのツールの紹介。最終スコア順。


DeepSeek V3は、大規模 mixture-of-experts (MoE) 言語モデルであり、DeepSeek AIによって開発されました。 DeepSeek V3では、 1トークンあたっても、その総パラメータのサブセットだけが動作します。これにより、推論コストが類似する密集モデルに比べて、推論コストが大幅に下がって、論理、数学、プログラミングタスクで強力なパフォーマンスを達成できます。 Open_weightsでリリースされたDeepSeek V3は、開発者や研究者など、サーバー上でホストしたり、自社でトレーニングしたり、またはAPI経由で組み込んだりすることができる能力あるベースモデルとして人気を博しています。ベンチマークでは、数学的論理的推論評価でも含むトレードマークのある大手ベースモデルGPT-4oと競争力を発揮するようによく評価されています。 DeepSeek V3 は、技術アシスタント、コード生成パイプライン、研究ワークフロー、論理精度と予算効率の両方が重要となるアプリケーションのために適していると考えられています。
評価基準の詳細
- Mixture-of-experts architecture
- 競争的な推論と数学評価
- オープンソースのモデルウェイト
- DIPアクセスを介してDeepSeek プラットフォーム
- 長いコンテキストウィンドウサポート
- チューニングに友好的


Mistral Large 24.11は、Mistral AIのトップクラスの大規模言語モデルである11月2024年のリリースです。このモデルは、複数の言語で進化した推論 capability、コード生成、数学的問題解決、そして複雑なインストラクション フォローングを目指しています。これにより、研究から生産的利用まで幅広い分野で利用可能になります。 このモデルはエンタープライズワークフローに適しており、関数呼出し、構造化された出力、および長いコンテキストタスクへのサポートが強化されています。このモデルは、パートナークロウドプラットフォームおよびMistralの_API を介して利用可能であり、チームがこのモデルをどのように展開および統合するかについての柔軟性を提供します。 エンジニアは一般的には Mistral Large 24.11 をコード アシスタント、多言語 チャット ボット、文書分析パイプライン、言語間で信頼できる推論が重要なリトランスフォーム アプリケーションに使用します。
評価基準の詳細
- 高度な推論と実行の指示
- ネイティブマルチ言語サポート
- コード生成とデバッグ
- 関数コールとJSONでの出力
- 長テキストハンドリング
- 企業向け展開オプション


Simple MP3 to Text は、講義、ポッドキャスト、インタビュー、そしてボイスノートなどのオーディオ ファイルをテキストに変換する転criptionツールです。このツールは、手動入力や特殊なハードウエアなどを必要とせずに読み取り可能なトランスクリプトを作成するために、AI 話し言葉認識技術(Speech Recognition, LLM)を使用します。 利用者は迅速かつ低抵抗でspokenコンテンツからテキストを抽出できるサービスを探していることが多いです。このサービスでは、업ロードしたMP3ファイルが自動的に処理され、結果のテキストをコピー、編集、またはノート、記事、스터디・マテリアル、コンテンツの再利用などの目的で保存することができます。 SimpleなMP3からテキストエクスポートツールは、音声録音を頻繁に取り扱い、より簡素的なワークフローを好む学生、ジャーナリスト、ポッドキャスター、研究者などに適しています。
評価基準の詳細
- MP3の音声からテキストへの変換
- AIパワーで音声認識
- 講義、ポッドキャスト、ヴォイスノートをサポート
- きれいなコピー可能なテキスト
- ブラウザベースで手軽なワークフロー
- アップロードしたものがすぐに結果が得られる


Gemma 4 Local Hardware マッチャーは、ユーザーに、GoogleのGemmal 4 モデルファミリーのバージョンを、そのユーザーの特定のハードウェアで効果的に実行できるように支援するユーティリティです。GPU VRAM、システム RAM、CPU capability、および利用可能なストレージを分析して、互換性があり、適切なモデルサイズおよび量化レベルをおすすめします。 このツールは、Gemma 4をローカルに実行するために試行錯誤のテストを避ける開発者、趣味愛好者、研究者向けに設計されています。 このツールは、メモリの要件やパフォーマンスの期待の曖昧さを排除し、ユーザーが機器に最適なモデルバリアントを選択できるようにすることで、品質と高速性のバランスをとったモデルバリアントを選択することをサポートしています。
評価基準の詳細
- ハードウェアの検出と分析
- モデルサイズと量子化レコメンド
- VRAMとRAMの要件推定
- バリエーションごとのパフォーマンス期待値
- 複数のGemma 4バージョンに対応
- CPUとGPUのインフェレンスのヒント


DeepSeek R1は、推論、数学、コーディングタスクで優秀なオープンソースの大規模言語モデルです。 Mixture of Experts (MoE)アーキテクチャを使用し、37億の活性パラメータと671億のパラメータで構成されており、128Kのコンテキスト長をサポートしています。このモデルには、自己検証、多ステップ反射、人間に指向した推論能力を実現するために高度な強化学習技術が組み込まれています。 DeepSeek R1は、MATH-500で97.3%の精度を実現したり、AIME 2024で79.8%の合格率を達成したりしたり、Codeforcesの99.7%のパートicipantを上回るなどのベンチマークでベストパフォーマンスを達成しました。 本モデルは、1.5Bから70Bパラメータまでの多様なバリエーションで利用可能であり、MITライセンス下で無償利用および変更が可能です。DeepSeek R1はオンラインで利用可能で、WebGPU加速版はブラウザでローカルに実行できます。 このモデルは、複雑な問題解決、多言語理解、および生産性で使えるコード生成に設計されています。また、優れた数学的推論、コード生成、自然言語理解の能力もあります。しかし、オープンソースモデルであるため、特定の用途向けに配置およびフィンガープリントしなければならないため、技術的専門知識が必要になる場合があります。 DeepSeek R1は、グローバルでトップパフォーマンスのAIモデルに位置付けられており、リーディングのパブリックなソリューションと比較して優れた機能を備えています。オープンソースの性質により、コミュニティ ドライブの開発が実現し、計画的なマルチモーダルサポート、会話の向上、分散的推論最適化などの継続的なアップグレードが可能になります。 DeepSeek R1 では、強化学習による純粋な開発が行われることで、GPT-4 レベルの学術的演算性能を、コストが格段に低く実現できる。 チェーンオブサーストVisualization機能は、AI "暗闇箱"(black box)の課題に対処し、モデルがどのように推論しているかについての洞察を提供する。 DeepSeek R1のAPIでは、OpenAIとの互換性はあるがAPIエンドポイントが用意されており、価格は1000万単語あたり0.14ドルです。モデルの重みはオープンソースであり、商用利用や変更が可能になります。
評価基準の詳細
- Mixture of Experts (MoE)アーキテクチャ
- Advanced強化学習手法
- 自己検証と多ステップ反映
- 人間に合致する推論
- 128Kコンテキスト長へのサポート
- OpenAI互換APIエンドポイント

Gemma 4は、Googleが開発したオープンウェイトの大規模言語モデルの一員で、開発者と研究者が、自社インフラストラクチャ上で実行、微調整、展開可能な有能な基盤モデルに直接アクセスできるようにするために設計されています。EarlierのGemmaリリースの系譜を引き継がしつつ、推論能力、指示の遂行能力そして多言語のハンドリング能力を改善してます。 モデルはオープンなウェイトで配布されており、ホストされる API に依存せずに試験、オフデバイスインフラ、カスタムアプリに統合できるため、エクスペリメント、オンデバイスインフラ、カスタムアプリの統合に向いています。Hugging Face Transformers、llama.cpp、Ollama、JAX などの人気フレームワークを介して利用でき、選ばれたバリアントによって GPU、TPU、コンシューマハードウェアにまたがって実行できます。 Gemma 4は、チームに柔軟性、透明性、AIスタックに対するコントロールを必要とするチームを対象としています。私たちのAIスタックにおける私的なアシスタント、リサーチ・プロトタイプ、または特別化されたドメインモデルをFine-Tuningするチームにも対象です。
評価基準の詳細
- オープンソースのモデル重量
- パラメータサイズのバリアントを複数提供
- 指示を調整したバージョンとベース版
- Hugging Face と Ollama に互換性がある
- ローカルおよびクラウドの両方でのデプロイ対応
- 軽量化と LoRA の適応性


Gemini 2.0 Flashは、速度、スケール、そして多モーダル推論のためのGoogle DeepMindの次世代モデルです。このモデルでは、テキスト、画像、音声、ビデオというさまざまな入力モードを受け取り、テキスト、画像、音声というさまざまな出力モードを生成することができ、豊富なインタラクティブなアプリケーションに適しています。 агェンティブ ワークフローを考慮した独自の設計で、モデルはネイティブツールの使い方、関数のコール、1,000万トークンのコンテキストのウィンドウをサポートし、大規模な文書、コードベース、長時間のセッションに対応することができます。低遅延は、サポートアシスタント、リアルタイム分析、およびビッグデータ処理のための実用的な選択肢となります。 開発者はGemini 2.0 Flashにアクセスするには、Gemini API、Google AI Studio、Vertex AIを介し、主要言語でのSDKが利用可能です。
評価基準の詳細
- 1Mトークンのコンテキストウィンドウ
- マルチモーダル入力:テキスト、画像、音声、ビデオ
- ネイティブツールコールとコード実行
- リアルタイムストリーミングレスポンス
- イメージと音声の生成
- Gemini APIおよびVertex AI経由で利用
プルノイアは、大規模な言語モデルで、アラビア語に特にフィードバックすることで、一般的な多言語モデルよりも精度の高い理解、生成、推論を提供することを目指しています。 それは、方言、古典形式、アラビア語の現代標準への最適化を備えた指向性の高いアラビア語言語モデル (LLM) として、市場で導入されました。 モデルの使用は、コンテンツ作成、要約、翻訳、カスタマー・サポート、会話型AIのタスクなど、アラビア語話者の市場に適しています。アラビア語データの訓練を集中することで、普遍的なモデルがインコンベンショナルに扱うことが多い形態論、音点、文化的背景などの微妙なニュアンスの対象が、Pranoiaではより適切に扱えます。
評価基準の詳細
- アラビア語最適化言語モデル
- テキスト生成と要約
- 翻訳のサポート
- 会話型およびチャットボット機能
- 企業向けアラビア語NLP向け
- 現代標準アラビア語と方言のカバー







