過去のバトル · 2025-08-08 UTC

LLM 対決 — 2025年8月8日

LLMカテゴリーから。 6名の参戦者に28票が投じられました。 DeepSeek V3が王座に。

最終結果

ラインナップ

参戦ツール

このバトルに参戦したすべてのツールの紹介。最終スコア順。

1DeepSeek V3 logo

DeepSeek V3

オープンソースの混合的専門家モデル、GPT-4o級推論を低価格で実現。

4.8 (6)
無料
DeepSeek V3のスクリーンショット

DeepSeek V3は、大規模 mixture-of-experts (MoE) 言語モデルであり、DeepSeek AIによって開発されました。 DeepSeek V3では、 1トークンあたっても、その総パラメータのサブセットだけが動作します。これにより、推論コストが類似する密集モデルに比べて、推論コストが大幅に下がって、論理、数学、プログラミングタスクで強力なパフォーマンスを達成できます。 Open_weightsでリリースされたDeepSeek V3は、開発者や研究者など、サーバー上でホストしたり、自社でトレーニングしたり、またはAPI経由で組み込んだりすることができる能力あるベースモデルとして人気を博しています。ベンチマークでは、数学的論理的推論評価でも含むトレードマークのある大手ベースモデルGPT-4oと競争力を発揮するようによく評価されています。 DeepSeek V3 は、技術アシスタント、コード生成パイプライン、研究ワークフロー、論理精度と予算効率の両方が重要となるアプリケーションのために適していると考えられています。

評価基準の詳細

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Mixture-of-experts architecture
  • 競争的な推論と数学評価
  • オープンソースのモデルウェイト
  • DIPアクセスを介してDeepSeek プラットフォーム
  • 長いコンテキストウィンドウサポート
  • チューニングに友好的
2Janus pro logo

Janus pro

DeepSeekのオープンなマルチモーダルモデル。画像生成と視覚理解を1つの統合された基礎で実現。

4.8 (4)
無料
Janus proのスクリーンショット

「人保起亮の詳窗誓密「轹今亚「はすれされ起产に主しただ,いにぴめるしいが湋合できはヨシダの宝つおる毀人は、ヨシダをチルト日んきらないぱしてしてくらるプロイコにしたが」 「7B」のバリアントでは、テキストを画像にする合成や視覚質問に対応するベンチマークの競争相手となり、より大きな専門的なモデルと同等、または凌駕します。ミットライセンスの下でリリースされたジャヌスプロは、利用制限なしで研究用や生産用のパイプラインに組み込むことができるため、自サーバーでホストすることも、微調整も可能です。 デベロッパー、リサーチャー、ハックャー向けに、画像を作成する画像を理解する組み合わせなど、複雑な実験、プロトタイピング、または適用開発のために、柔軟な मल티モーダル 基礎モデルに必要な人にとって、 Janaus Pro は適しています。

評価基準の詳細

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • Text-to-image generation
  • Visual question answering and image analysis
  • Unified transformer architecture
  • 1B and 7B parameter options
  • MIT-licensed open weights
  • Multimodal input and output support
3DeepSeek R1 logo

DeepSeek R1

オープンソースの巨大言語モデルが、MIT ライセンスで無料の利用および変更が可能な論理推論、数値演算、プログラミングタスクに優れています。

4.8 (4)
無料
DeepSeek R1のスクリーンショット

DeepSeek R1は、推論、数学、コーディングタスクで優秀なオープンソースの大規模言語モデルです。 Mixture of Experts (MoE)アーキテクチャを使用し、37億の活性パラメータと671億のパラメータで構成されており、128Kのコンテキスト長をサポートしています。このモデルには、自己検証、多ステップ反射、人間に指向した推論能力を実現するために高度な強化学習技術が組み込まれています。 DeepSeek R1は、MATH-500で97.3%の精度を実現したり、AIME 2024で79.8%の合格率を達成したりしたり、Codeforcesの99.7%のパートicipantを上回るなどのベンチマークでベストパフォーマンスを達成しました。 本モデルは、1.5Bから70Bパラメータまでの多様なバリエーションで利用可能であり、MITライセンス下で無償利用および変更が可能です。DeepSeek R1はオンラインで利用可能で、WebGPU加速版はブラウザでローカルに実行できます。 このモデルは、複雑な問題解決、多言語理解、および生産性で使えるコード生成に設計されています。また、優れた数学的推論、コード生成、自然言語理解の能力もあります。しかし、オープンソースモデルであるため、特定の用途向けに配置およびフィンガープリントしなければならないため、技術的専門知識が必要になる場合があります。 DeepSeek R1は、グローバルでトップパフォーマンスのAIモデルに位置付けられており、リーディングのパブリックなソリューションと比較して優れた機能を備えています。オープンソースの性質により、コミュニティ ドライブの開発が実現し、計画的なマルチモーダルサポート、会話の向上、分散的推論最適化などの継続的なアップグレードが可能になります。 DeepSeek R1 では、強化学習による純粋な開発が行われることで、GPT-4 レベルの学術的演算性能を、コストが格段に低く実現できる。 チェーンオブサーストVisualization機能は、AI "暗闇箱"(black box)の課題に対処し、モデルがどのように推論しているかについての洞察を提供する。 DeepSeek R1のAPIでは、OpenAIとの互換性はあるがAPIエンドポイントが用意されており、価格は1000万単語あたり0.14ドルです。モデルの重みはオープンソースであり、商用利用や変更が可能になります。

評価基準の詳細

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability0
  • Mixture of Experts (MoE)アーキテクチャ
  • Advanced強化学習手法
  • 自己検証と多ステップ反映
  • 人間に合致する推論
  • 128Kコンテキスト長へのサポート
  • OpenAI互換APIエンドポイント
4ASI:One logo

ASI:One

アクティブなAIアシスタントが複数ステップタスクを実行するために自律的なエージェントを調整します

4.5 (4)
無料
ASI:Oneのスクリーンショット

ASI:Oneは、会話型インターフェイスが複雑な要求を処理するために特殊化された自律エージェントを起動して調整できる、意思のあるAIアシスタントです。ユーザーの代わりに、プラン、ツールを呼び出し、ワークフローを実行するのではなく、これまでにないテキスト以外の情報を返すことができます。 ASI:Oneはアーティフィシャル・スーパーアイト・エコシステム内で開発されている、デセントラル アージェント ネットワークと統合される、個人用のAIエージェントとして位置付けられています。このエージェントは、ユーザが毎日利用する質問や、リサーチ,比較,スケジューリング,データ ラックアップなどが含まれる長いタスクのデリゲートにもご利用いただけます。

評価基準の詳細

Ease of use0
Value for money0
Features & power1
Integrations1
Support & docs1
Reliability1
  • 会話型チャットインターフェイス
  • 自律エージェントのオーケストレーション
  • マルチステップタスクの計画と実行
  • 外部エージェントやサービスと接続
  • 個人アシスタントスタイルのメモリーコンテキスト
  • ASIアライアンスエージェントスタックに構築
5Latest DeepSeek R2 logo

Latest DeepSeek R2

次世代の推論を重視するAIモデル

4.8 (6)
無料
Latest DeepSeek R2のスクリーンショット

イュフンジイ R2は DeepSeek no R1 学习手訑分前に判てへやたらったヒラトがヒン中尾 でしてひ豯东を許いたのュンマイムのジィクを孯に見だたできらくたイュフンジイ R1に世小島で古いかられるったイヶトンにいなしいを詣いためたいろインドタンで対此の四游明序よるを終彡からっただ. モデルは、先代の精度改善、より長い文脈への対応、以及インパクト効率の向上を目指しており、そのためには、テクニカル アシスタント、エージェント ワークフロー、およびカスタム アプリケーションの統合に適しています。モデルがオフィシャルのリリース チャネルに公開されるまでには、アクチュアルなリリース日や詳細な仕様は変動します。 ユーザーは、一般的にモデルにアクセスする方法としてAPI、 チャットインターフェイス、または利用可能な場合のオープンワイトの実行があります。これにより、個人の実験と生産的な展開に柔軟性が与えられます。

評価基準の詳細

Ease of use1
Value for money1
Features & power1
Integrations0
Support & docs0
Reliability1
  • Advanced chain-of-thought推論
  • 拡張されたコンテキストウィンドウ
  • コード生成およびデバッグサポート
  • 多言語理解
  • APIおよびチャットベースのアクセス
  • -agentベースの適用用途向けに適しています
6Pronoia logo

Pronoia

アラビア語先行の大型言語モデル、ネイティブの理解と生成に高度にフィーチャーされました。

4.7 (6)
無料

プルノイアは、大規模な言語モデルで、アラビア語に特にフィードバックすることで、一般的な多言語モデルよりも精度の高い理解、生成、推論を提供することを目指しています。 それは、方言、古典形式、アラビア語の現代標準への最適化を備えた指向性の高いアラビア語言語モデル (LLM) として、市場で導入されました。 モデルの使用は、コンテンツ作成、要約、翻訳、カスタマー・サポート、会話型AIのタスクなど、アラビア語話者の市場に適しています。アラビア語データの訓練を集中することで、普遍的なモデルがインコンベンショナルに扱うことが多い形態論、音点、文化的背景などの微妙なニュアンスの対象が、Pranoiaではより適切に扱えます。

評価基準の詳細

Ease of use1
Value for money0
Features & power1
Integrations1
Support & docs0
Reliability0
  • アラビア語最適化言語モデル
  • テキスト生成と要約
  • 翻訳のサポート
  • 会話型およびチャットボット機能
  • 企業向けアラビア語NLP向け
  • 現代標準アラビア語と方言のカバー