最終結果
ラインナップ
参戦ツール
このバトルに参戦したすべてのツールの紹介。最終スコア順。

ASI:Oneは、会話型インターフェイスが複雑な要求を処理するために特殊化された自律エージェントを起動して調整できる、意思のあるAIアシスタントです。ユーザーの代わりに、プラン、ツールを呼び出し、ワークフローを実行するのではなく、これまでにないテキスト以外の情報を返すことができます。 ASI:Oneはアーティフィシャル・スーパーアイト・エコシステム内で開発されている、デセントラル アージェント ネットワークと統合される、個人用のAIエージェントとして位置付けられています。このエージェントは、ユーザが毎日利用する質問や、リサーチ,比較,スケジューリング,データ ラックアップなどが含まれる長いタスクのデリゲートにもご利用いただけます。
評価基準の詳細
- 会話型チャットインターフェイス
- 自律エージェントのオーケストレーション
- マルチステップタスクの計画と実行
- 外部エージェントやサービスと接続
- 個人アシスタントスタイルのメモリーコンテキスト
- ASIアライアンスエージェントスタックに構築


Gemini 2.0 Flashは、速度、スケール、そして多モーダル推論のためのGoogle DeepMindの次世代モデルです。このモデルでは、テキスト、画像、音声、ビデオというさまざまな入力モードを受け取り、テキスト、画像、音声というさまざまな出力モードを生成することができ、豊富なインタラクティブなアプリケーションに適しています。 агェンティブ ワークフローを考慮した独自の設計で、モデルはネイティブツールの使い方、関数のコール、1,000万トークンのコンテキストのウィンドウをサポートし、大規模な文書、コードベース、長時間のセッションに対応することができます。低遅延は、サポートアシスタント、リアルタイム分析、およびビッグデータ処理のための実用的な選択肢となります。 開発者はGemini 2.0 Flashにアクセスするには、Gemini API、Google AI Studio、Vertex AIを介し、主要言語でのSDKが利用可能です。
評価基準の詳細
- 1Mトークンのコンテキストウィンドウ
- マルチモーダル入力:テキスト、画像、音声、ビデオ
- ネイティブツールコールとコード実行
- リアルタイムストリーミングレスポンス
- イメージと音声の生成
- Gemini APIおよびVertex AI経由で利用


Mistral Small 3は、主に開発者や組織向けの、高度な計算能力が必要なAIアプリケーションを実現できる軽量の大規模言語モデルです。Mistral AI社が開発したこのモデルは、フロンティア規模のモデルと比較して、設備コストが高くないハードウェア上で効率良く動作する大きな推論と生成能力を備えています。 オープン ライセンスで公開されているモデルは、自社ホスティング、ファインチューニング、商用アプリケーションの一部として組み込むことができる。これが高速・精度・リソース効率のバランスを持ち、チャット アシスタント、コンテンツ生成、コードタスク、オン プレミス デプロイメントでは、レイテンシー又はプライバシーに関心がある場合に適したモデルである。
評価基準の詳細
- オープンウェイトモデルリリース
- 効率的な推論に対して最適化
- 競合他社とのベンチマーク比較で優れたパフォーマンスを示す
- ファインチューニングとカスタマイズをサポート
- オン プレミス デプロイメントに対応
- 対話型テキスト生成

フロンティア推論モデルであるOpenAI o3は、手順に気をつけて、ステップバイステップの考え方が必要な問題に取り組むことに特化しています。推論時にはコンピュートをさらに使うことの利点を活かした「oシリーズアプローチ」に基づいて、これで回答の計画、検証、洗練を実現しています。このアプローチは、数学、プログラミング、科学、論理的分析など、さまざまな分野で利用できることを意味します。 一般的なチャットモデルと比較して、お3はスピードよりも深さを重視しています。曖昧な指示を分解したり、複数のアプローチを評価し、推論とツール使用を強くストレスするベンチマークで信頼性の高い出力をプロデュースすることができます。開発者は、このAPI、およびChatGPTを介してアクセスすることができ、webブラウジング、アナリティクス、Python、ファイル分析などのツールと統合することができます。 このモデルは、研究者、エンジニア、および高精度な結果を得るために、待ち時間やコストの一部を犠牲にすべきである困難な問題に関する強い正確さを必要とするユーザーを対象としています。
評価基準の詳細
- 拡張されたチェーンの推論
- ツールの使用、コード、Web、ファイル入力
- 大きなコンテキストのウィンドウが長いドキュメントに適している
- API と ChatGPT の使用が可能
- STEM ベンチマーク上の精度の向上
- 複雑なアジェンティクワークフローをサポート


DeepSeek R1は、推論、数学、コーディングタスクで優秀なオープンソースの大規模言語モデルです。 Mixture of Experts (MoE)アーキテクチャを使用し、37億の活性パラメータと671億のパラメータで構成されており、128Kのコンテキスト長をサポートしています。このモデルには、自己検証、多ステップ反射、人間に指向した推論能力を実現するために高度な強化学習技術が組み込まれています。 DeepSeek R1は、MATH-500で97.3%の精度を実現したり、AIME 2024で79.8%の合格率を達成したりしたり、Codeforcesの99.7%のパートicipantを上回るなどのベンチマークでベストパフォーマンスを達成しました。 本モデルは、1.5Bから70Bパラメータまでの多様なバリエーションで利用可能であり、MITライセンス下で無償利用および変更が可能です。DeepSeek R1はオンラインで利用可能で、WebGPU加速版はブラウザでローカルに実行できます。 このモデルは、複雑な問題解決、多言語理解、および生産性で使えるコード生成に設計されています。また、優れた数学的推論、コード生成、自然言語理解の能力もあります。しかし、オープンソースモデルであるため、特定の用途向けに配置およびフィンガープリントしなければならないため、技術的専門知識が必要になる場合があります。 DeepSeek R1は、グローバルでトップパフォーマンスのAIモデルに位置付けられており、リーディングのパブリックなソリューションと比較して優れた機能を備えています。オープンソースの性質により、コミュニティ ドライブの開発が実現し、計画的なマルチモーダルサポート、会話の向上、分散的推論最適化などの継続的なアップグレードが可能になります。 DeepSeek R1 では、強化学習による純粋な開発が行われることで、GPT-4 レベルの学術的演算性能を、コストが格段に低く実現できる。 チェーンオブサーストVisualization機能は、AI "暗闇箱"(black box)の課題に対処し、モデルがどのように推論しているかについての洞察を提供する。 DeepSeek R1のAPIでは、OpenAIとの互換性はあるがAPIエンドポイントが用意されており、価格は1000万単語あたり0.14ドルです。モデルの重みはオープンソースであり、商用利用や変更が可能になります。
評価基準の詳細
- Mixture of Experts (MoE)アーキテクチャ
- Advanced強化学習手法
- 自己検証と多ステップ反映
- 人間に合致する推論
- 128Kコンテキスト長へのサポート
- OpenAI互換APIエンドポイント


DeepSeek V3は、大規模 mixture-of-experts (MoE) 言語モデルであり、DeepSeek AIによって開発されました。 DeepSeek V3では、 1トークンあたっても、その総パラメータのサブセットだけが動作します。これにより、推論コストが類似する密集モデルに比べて、推論コストが大幅に下がって、論理、数学、プログラミングタスクで強力なパフォーマンスを達成できます。 Open_weightsでリリースされたDeepSeek V3は、開発者や研究者など、サーバー上でホストしたり、自社でトレーニングしたり、またはAPI経由で組み込んだりすることができる能力あるベースモデルとして人気を博しています。ベンチマークでは、数学的論理的推論評価でも含むトレードマークのある大手ベースモデルGPT-4oと競争力を発揮するようによく評価されています。 DeepSeek V3 は、技術アシスタント、コード生成パイプライン、研究ワークフロー、論理精度と予算効率の両方が重要となるアプリケーションのために適していると考えられています。
評価基準の詳細
- Mixture-of-experts architecture
- 競争的な推論と数学評価
- オープンソースのモデルウェイト
- DIPアクセスを介してDeepSeek プラットフォーム
- 長いコンテキストウィンドウサポート
- チューニングに友好的

エレ・トイペ 3.3は、Metaが設計した大規模な自然言語処理モデルとして、強力な推論、プログラミング、多言語コーパスの処理を実現する上で、高品質な前提モデルとは比較的効率が高い。さまざまな言語をサポートし、チャットアシスタント、コンテンツの生成、要約、開発者ツールの活用に適している。 オープンウェイトでリリースされ、カスタマー プレミアム サービスを通じてまたは主要なクラウドと推論プロバイダーで展開することができるため、コスト、レイテンシー、およびデータハンドリングについてチームは選択の幅を持つ。 指示トゥーンされたバリアントは、正確にプロンプトに従うように最適化されており、helpfulな会話的な回答を生成します。 開発者は一般的に、ドメイン・スパシファックなアプリケーション、再取得生成システム、あるいはエージェントワークフローの開発に、LLM (Large Language Model) 3.3をベースにフィーントゥーニングすることが多い。
評価基準の詳細
- 多言語テキスト生成
- プッシュコマンドチューニングチャット変種
- 長時間サポート
- コーディング推論能力
- オープンウェイト
- 主なインフリメントフレームワークと互換性があります
プルノイアは、大規模な言語モデルで、アラビア語に特にフィードバックすることで、一般的な多言語モデルよりも精度の高い理解、生成、推論を提供することを目指しています。 それは、方言、古典形式、アラビア語の現代標準への最適化を備えた指向性の高いアラビア語言語モデル (LLM) として、市場で導入されました。 モデルの使用は、コンテンツ作成、要約、翻訳、カスタマー・サポート、会話型AIのタスクなど、アラビア語話者の市場に適しています。アラビア語データの訓練を集中することで、普遍的なモデルがインコンベンショナルに扱うことが多い形態論、音点、文化的背景などの微妙なニュアンスの対象が、Pranoiaではより適切に扱えます。
評価基準の詳細
- アラビア語最適化言語モデル
- テキスト生成と要約
- 翻訳のサポート
- 会話型およびチャットボット機能
- 企業向けアラビア語NLP向け
- 現代標準アラビア語と方言のカバー







