過去のバトル · 2024-12-22 UTC
Agent Development 対決 — 2024年12月22日
Agent Developmentカテゴリーから。 4名の参戦者に15票が投じられました。 Vocodeが王座に。
最終結果
ラインナップ
参戦ツール
このバトルに参戦したすべてのツールの紹介。最終スコア順。

Vocodeは、声質問応答式AIアプリケーションを構築するためのオープンソースライブラリです。 それが提供するパイプラインにより、音声認識、巨大言語モデル、音声合成等をリアルタイムでつながれ、 開発者は電話コール、Webソケット、またはローカルアウディオを介して、聞き、推論、そして話すことができるエージェントを開発できます。 フレームワークは主にPython SDKとして配布され、対話が反応性のあるものであるのではなく、長い待ち時間の中でのターン別のものではなく、ストリーミングオーディオに焦点を当てています。 voicesジェンシィは、声のエージェントを素から作る難しい点である、切断を管理する (barge-in)、バッファリングとストリーミングトランスクリプション、そして、トランスクリプター、アジェントロジック、およびシンセシイザーの間の順序付けを取ることの取りまとめなどのオーケストレーション関心を取り扱います。 Vocodeはモジュラーかつサービスプラットフォームに依存しない設計で、各ステージのパイプラインに適合する3rdパーティサービスとの統合をサポートしています。例えば、DeepgramやAssembly AIなどの音声認識サービス、OpenAIのような言語モデル、ElevenLabs、Azureなどの音源エンジンなどが含まれます。開発者はコスト、遅延、音声質のニーズに基づいてコンポーネントを入れ替えることができます。 一般的な使用例は電話に関係しています。VoCodeは、Twilioなどのプロバイダーを通じて、電話の着信・発信をサポートします。これにより、アウトバウンドおよびインバウンドの自動コールエージェント、ボイスアシスタント、および顧客に対する電話ボットを作成するのに適したものになります。これには、ブラウザベースおよびローカルマイク会話が対応しているため、インアプリボイスエクスペリエンスを構築できます。 Vocodeは、オープンソースで自社ホスティング可能なため、自分のシステム構成を制御しエージェントの動作をカスタマイズしたいチームを対象としている。ただし、その欠点は製品化された音声エージェントを作るには、サードパーティのトランスクリプション、LLM、TTSサービスを組み合わせてコストで運営しなければならないこと、そして、遅延や会話の仕草の調整を必要としたりするということである。 このツールは、マネージド プラットフォームや他のフレームワークとともに、声エージェント ツールの新興分野に立っています。 主要な差別化点は、開発者の方がパイプラインの内部構造に直接アクセスできるオープンソースで組成可能なアプローチです。
評価基準の詳細
- リアルタイムストリーミング声エージェントパイプライン
- 複数のSTT、LLM、そしてTTSプロバイダーとの組み込み
- Twilioや類似した電話サービスを介して電話サポート
- インタループット(入力中断)のハンドリング
- Python SDKによるカスタムエージェント構築
- ブラウザーとローカルマ이크による会話サポート

MemGPTは、機械学習研究者から発展した、LARGE LANGUAGE MODEL (LLM)の固定コンテキスト窮迫を解決するオープンソースフレームワークである。その起源はバークレイ大学カリフォルニア校にある研究グループで、このプロジェクトは、LLMの限られたコンテキストを、オペレーティングシステムが物理メモリに限られた制約を管理するように、ページングと階層的メモリテイアリングを使用することを提案した。このアプローチにより、モデルは、物理メモリとは無関係の、より大きな持続的なメモリの存在を得る 私子でいなすに合前にからがおされますがにけなは、いますしもぎ、当き子しできおすといますと、本代よっていますれべがあだた。使子でいますと島いたぼちや遊为、定为り晎閙カーロクゃちたべがあだた、しったたた。フォタイクがエールータムパであだたプーディンを激强んださい。はをおなしたいますにがそる一代でおけいアシェナを上いだた。一代かみぬ室るからが島いたできますれべがあだた。 このフレームワークは、ユーザーと前回の相互作用の記憶を永続化する必要がある話し手エージェントを作成する開発者、またコンテキストに収まることができない大規模なコーパス上でドキュメント分析を行っている開発者向けに設計されています。メモリの回復・アーカイブストレージ、およびワークコンテキストの管理を行うことで、MemGPTはエージェントを設計するために、開発者が個々のケースごとにリテリバルパイプラインを手動で実装することなく、対話のいかなる時点にも詳細を参照できるようにします。 MemGPTは、OpenAIから提供されている独自のモデルやローカルにホストされているオープンモデルと、セッション間でメモリを保管するためのベクトル データベースやその他のストレージバックエンドとの統合をサポートしています。後にプロジェクトは発展し、Lettaという企業およびプラットフォームと強固な結びつきを構築し、その下位レベルのステートフルエージェントコンセプトの開発を継続していきます。Lettaによってオールドアイデアを元にサーバーおよびツールングアウンドを提供しています。 主な強みは、概念的な明確さと、長期的な記憶を超え、単純な取得拡張生成を超える再利用可能なパターンです。 代替には、エージェントフレームワークの典型的なトレードオフです。 自己編集の記憶ループは、モデルがコール関数の信頼性に強く依存しており、より小規模なモデルではその信頼性が低下し、追加の記憶管理ステップは遅延とトークンオーバーヘッドの増加につながります。 これは、名前、API、および周りのエコシステムは時間の経過とともに変化し、ドキュメントとバージョニングは目的に追いやされるという特性を持つ、発展途上にあるオープンソースプロジェクトです。
評価基準の詳細
- 階層的コンテキストと外部メモリ管理
- 関数呼び出しを用いたコアメモリーの自己編集
- アーカイバルとリクールメモリのストレージ
- ベクターデータベースの統合により、参照
- 複数のLLMバックエンドをサポート
- ステートフルな会話エージェント

Letta AI は、オープンソース プラットフォームで作成できる、長期認識能力を備えた状態の AI エージェントを目的としたものです。このようなエージェントは、過去の相互作用を記憶し、複雑で文脈的によほど意思決定プロセスを実現します。 これは、エージェントが経験から時間をかけて学び、対応する応答を適応させる必要があるアプリケーションには特に便利である。 Letta AI は、客層サービスから、より複雑な問題解決タスクに至るまで、さまざまでいる開発者や研究者を対象としている。 長期記憶と高度な推論能力を提供することで、Letta AI は、より高度の自律性と知性を持つエージェントを構築しうるように助け、幅広いタスクに対処することができる。
評価基準の詳細
- 状態エージェント
- 長期記憶
- 高度な推論方法

mosaiaはコミュニティ駆動型のプラットフォームで、オープンな環境でAIエージェントやアプリケーションを構築することを目的としています。 開発者にAI解決策を作成、カスタマイズ、展開するためのツールを提供し、同時にプロジェクト間でコラボレーションや透明性を促進します。 このプラットフォームでは、ユーザーが作品を共有し、他のユーザーのエージェントをリミックスする、AIコンポーネントの共有する共同体が成長する環境を提供しています。このアプローチは、AI開発の障壁を下げ、作成者間の知識の交換を促進することを目指しています。 複雑なAIワークフローを組み立てるか、単一のエージェントをプロトタイプ化するか、Mosaiaは改良型、オープンで協力的な開発をサポートする基盤とコミュニティを提供します。
評価基準の詳細
- AIエージェント作成ツール提供
- オープンの共有と共同作業
- コミュニティドライブのマーケットプレイス
- カスタマイズ可能なエージェントワークフロー
- 開発者にフォーカスしたプラットフォーム
- 展開インフラストラクチャ







