過去のバトル · 2024-05-02 UTC
Large Language Models (LLMs) 対決 — 2024年5月2日
Large Language Models (LLMs)カテゴリーから。 7名の参戦者に24票が投じられました。 Uni-1 by Luma AIが王座に。
最終結果
ラインナップ
参戦ツール
このバトルに参戦したすべてのツールの紹介。最終スコア順。


アサタダ(Uni-1)は〆主日カドかな安突字岌有取得なカタル、詨學要よらの代にようない。、ウィザムナカを、詨學要だは、溚溚る囦られ、シコパインない影め代であとないショムルどきます,、ケラボシパスン・プシアタトにを緹られらうを了、、輸为アナカのカタルにを角った产する影めいます。 このモデルは、画像生成ツールの一般的な弱点を見直している: 画像内に読み易く正確なテキストを生成する能力。これにより、タイポグラフィが視覚品質として重要な要素となっているデザイン用ポスター、製品マックアップ、看板、編集用のビジュアルなど、様々な用途に向く。 Luma AIのより広いクリエイティブ スイートの一 部として、デザイナー、マーケター、マークアップ アーティスト向けに、クリエイティブ エクスプロレーションと生産作業の両方で、信頼性の高いイメージ出力が必要なユーザー向けに、Uni-1は位置付けられています。
評価基準の詳細
- Text-to-image とマルチモーダルジェネレーション
- 改良されたタイポグラフィおよびテキスト精度
- 空間的および組成的理解
- 高解像度写真のようなレンダリング
- 参考付き画像作成
- Luma AI のクリエイティブロールの統合

Ollamaは、個人コンピューターで直接利用することができる大規模言語モデルのダウンロード、実行、管理を行うオープンソースツールです。さまざまな人気のオープン モデル、包括LLM であるLlama、Mistral、Gemma、Phi、DeepSeekのサポートを行っており、モデルをエンティティにパッケージ化、重み、構成をシンプルなコマンドラインインターフェイス経由で取り扱います。 開発者、研究者、プライバシーコンシャスなユーザ用に設計されたOllamaは、モデルがダウンロードされる後は完全にオフライン稼動し、プッシュとデータはあなたのハードウェアで保管されます。これにより、ローカルREST APIが公開され、人気のframeworkとフロントエンドUIと相互に統合され、ローカルAIアプリケーション、チャットボット、コードアシスタントを作成するための実践的なベースとなる
評価基準の詳細
- 一コマンドでのモデルダウンロードおよび実行
- ローカルREST API for app integration
- モデलबibliothek with quantized versions
- Custom Modelfile for tailored model configs
- GPU acceleration on supported hardware
- 初期設定後はオフライン実行可能


Haystack AIは、deepsetによって開発されたオープンソースフレームワークです。これは、large language modelsを活用した実稼働用アプリケーションを構築するためのものです。このフレームワークは、開発者がドキュメント ストア、アクセサ、アイジェンブ ダ、ジェネレータなどのコンポーネントを接続しながらモジュラーピパラインアーキテクチャを用意しています。これは、開発者がカスタムNLPワークフローを作成するのに役立ちます。 フレームワークは、検索を加味した生成(RAG)、意味的検索、質問解答、要約、およびエージェントベースシステムのための一般的な用途として使用されています。人気のあるモデルプロバイダー、ベクトルデータベース、ツールに統合し、プロトタイプと大規模なデプロイメントの両方に柔軟性を提供しています。 開発者に優れた体験を提供することに重点を置くHaystack AIは、明確なドキュメンテーション、プレビルトパイプライン、および評価ツールを提供し、LLM アプリケーションを見つける実験期からプロデューションに進めるためにチームをサポートします。
評価基準の詳細
- 可組モジュラー パイプライン LLM ワークフロー
- RAG のサポート
- 主要なベクトル データベースと統合
- ドキュメント ストアとリトリーバー コンポーネント
- 組み込み評価と監視ツール
- エージェントとツールコールの機能

Hermes 3は、オープンな重量の大型言語モデルで、ユーザー命令に強く対応する中立的なアシスタントとして設計されています。このモデルは、LLMアーキテクチャに基づいて開発され、Nous Researchによってリリースされ、推論力、長い文脈タスク、構造化された出力での強力なパフォーマンスを狙っています。 モデルは、実際のアプリケーションで開発者が必要とする実用的機能、である再利用可能な関数呼び出し、構造化 JSON の生成、多分岐ロールプレイおよび目的の手法使用などを強調しています。また、複数のパラメータサイズから選択して利用できるため、どちらのローカル実行でも、または大量のインフルエンス実行でも使用することができます。 Hermes 3 はオープンソース製であるため、チームは、提供側に依存せずにカスタマイズされたパイプラインに統合することができる。さらに、コミュニティツールングリッドの構築と量子化のビルドを通じて、消費用ハードウェアで実験を行えるようになりました。
評価基準の詳細
- 動的関数呼び出しとツールの使用
- 構造化された JSON とスキーマガイドド アウトプット
- 拡張されたテキストウィンドウ
- ロールプレイとペルソナの確実性
- 8B、70B、405Bなど多くのモデルのサイズ
- 標準インフェレンスターフレームワークとの互換性

H2O.aiは、機械学習をスケールで開発および運用するために設計された企業向けのAIプラットフォームです。これは、自動化された機械学習、生成AI、文書処理、MLOpsのツールのセットを提供し、予測型および生成型モデルの両方でデータサイエンティストやビジネスユーザーが作業することを許容します。 プラットフォームでは、データの準備やトレーニングからデプロイメントと監視まで、モデル全生命周期をサポートします。オープンソースのルーツと企業向けの製品であるH2O Driverless AIやh2oGPTなどの製品を用いたことで、金融、医療、保険などの業界を問わず、従来の機械学習ワークフローとモダンなLLMベースのアプリケーションを組み合わせたいと考えているチームを対象にしている。また、SaaS形式の製品も用意している他、APIとソフトウェア開発キット (SDK) を公開し、ユーザーが自らのアプリケーションを構築できるようにしている。
評価基準の詳細
- AutoMLにH2O Driverless AIを使用して機械学習
- h2oGPTの使用はプライベートLLMの展開をサポート
- 文書AIを使用して構造化されていないデータの処理
- MLOpsを使用してモデルの展開と監視
- Python、R、ノートブックに対応
- 機械学習のためのオンプレム、クラウド、ハイブリッド展開オプションをサポート


Replicate.soは、テスター、デザイナー、開発者の間のギャップを埋めることを目的としたバグ報告と対処プラットフォームです。 バグ報告では、曖昧な文字記述のチケットに置き換えることができるように、バグ発生シーンの映像録画やスクリームキャプチャー、注釈を伴った自動取得された技術的メタデータ(ブラウザ、OS、コンソールログ、ネットワークアクティビティなど)を一同に記録することが可能です。 このツールは、開発者ワークフローと統合する共有可能な報告書に情報をパッケージします。エンジニアが一つのリンクで問題を再現できるように、すべての必要な情報を与えると、 replicate.so はバグを発見して解決するまでの時間を短縮し、連絡のやり取りやり取りを減らします。 QAチーム、製品マネージャー、リモートでの開発チームに特に利用価値があるのは、問題を文書化してルーティングする上で、構造化されたかつ再現可能な方法を求めているときです。
評価基準の詳細
- スクリーン録画およびスクリーンショットのキャプチャ
- 自動コンテキストロガー収集
- ブラウザとデバイスに関するメタデータを報告
- 注釈付きの視覚的なフィードバック
- 共有可能なバグレポートのリンク
- 開発者フローの統合
Rita AIは、就職プロセスを効率化するために設計された独立した就職支援ツールです。就職活動を行っている個人が、職の発見と申請の自動化を望んでいる場合はRita AIを使用できます。このツールは、アルゴリズムを使用してユーザーの要件に基づいてジョブ・オープニングを探索し、スキル、経験、プREFERENCEを考慮して適切なポジションを特定します。この機能は、さまざまなジョブブードと企業のキャリアページを検索して関連性の高いポジションを発見することができ、特定のポジションをマッチングする場合、このツールは自動的にジョブの申請を行うようユーザー代表で行うことができます。その結果、ジョブ探しに時間をかけることなく、雇用者に気付かれるチャンスを増やすことはできそうです。Rita AIの基本機能としては、その特徴的なコア機能を使用して、個人の就職支援ツールとして行動し、通常は大きな時間や労力を必要とするジョブ・セッカーワークマンスタンドを処理します。
評価基準の詳細
- 自動的にマルチソースのジョブ・ディスカバリー
- マッチしたポジションへの自動申請
- 経歴とプロフィール基準のマッチング
- 申請のトラッキングを提供するダッシュボード
- 個別のジョブ勧め
- バックグランド・サーチは一貫して実行される






