過去のバトル · 2024-11-03 UTC
Speech Recognition 対決 — 2024年11月3日
Speech Recognitionカテゴリーから。 6名の参戦者に27票が投じられました。 WithAudioが王座に。
最終結果
ラインナップ
参戦ツール
このバトルに参戦したすべてのツールの紹介。最終スコア順。

WithAudioは、MacおよびWindows用のテキストを音声に変換し、音を出します。そのテキストをペースト、ドキュメントを読み込む、または記事をインポートして自然なAI声を使って音を生成できるため、プロオブレッティングとアクセス性と手間を省くために使って役立ちます。 ほとんどのTTSツールは月額サブスクに依存していますが、WithAudioは一度の購入にしたがって、予測可能な費用を望む読者や作家を応えます。アプリは、複雑なオーディオの生成や複雑性を排除したリスニングエクスペリエンスに集中するのではなく、再生コントロールと、生成音を後で使用するようにエクスポートする能力に重点を置いています。
評価基準の詳細
- AI声のテキスト読み上げ
- Macアンドウィンドウズのクロスプラットフォームサポート
- オフラインの場合にエクスポートされたオーディオ
- ドキュメントやテキストの入力オプション
- 再生コントロールの調整
- ひと度のライセンスアクティベーション

CallFluent
AI voice call analysis platform that transcribes, analyzes, and automates business phone conversations.

CallFluentは、電話インタラクションから最大限の価値を得るためにビジネスをサポートするための、AIを駆使した電話分析プラットフォームです。話し言葉音声認識、会話理解、ワークフロー自動化を組み合わせて、セールス談話、サポートチケット、顧客の問い合わせなど、重要な情報を顧客との電話交渉から引き出し、ビジネスに活かすことができるように設計されています。 このプラットフォームは、電話でのトーン、意図、および重要なトピックの分析を実施します。クライアントのイメージ、エージェントのパフォーマンス、共通の異議について、チームに洞察が与えられます。マネージャーは、大量の会話を一つ一つのレコーディングを手動で聴かなくても、トレンドをレビューできます。 カスタマーの意図する行動に迅速に対応するために、会話サマリー機能やCRMのロギング機能、フォローアップトリガーなどを備えたカラフルエンテントは、繰り返し行う後電話作業を自動化したり軽減したりし、チームはカスタマーが実際に言っていることに速やかに対応できるよう支援する
評価基準の詳細
- AISpeech-to-Text Transcription
- Sentiment and intent analysis
- Automated call summaries
- Conversation Insights Dashboard
- CRM and Workflow Integrations
- Post-call automation triggers


インワールドAIは、ゲーム、バーチャルワールド、インタラクティブメディアを作る開発者のためのキャラクターエンジンです。クリエイターはNPCやデジタルプレルズナの個性、記憶、声や動機などを独自に設計し、その人格に合ったリアルタイム会話や文脈に応じた動作に持つことができます。 プラットフォームでは、言語モデルの組み合わせにGoal、Knowledge Base、感情状態を組み合わせることで、プレイヤーへの反応がダイナミックになるようにカスタマイズされる。エンジンやUnreal、Unityなどの統合、API、SDKを用いると、それらのキャラクターをゲームプロジェクト、チャットエクスペリエンス、訓練シミュレーション、娯楽アプリなどのプラットフォームに展開することが可能になる。
評価基準の詳細
- カスタマイズ可能なAIキャラクターの個性
- 長期の記憶と知識ベース
- 声の合成と感情の表現
- ユニティーとアンチュイティエンジン
- 目標、トリガー、および行動の制御
- マルチプレイヤーとマルチキャラクターの相互作用


Mollyはワークフロー自動化とチーム協力を支援するAIパーソナルトアシスタントです。このトピックの「無限メモリー」機能により、ユーザー独自の偏好と相性が高く、操作の質を向上させることができます。ユーザーはタスクをMollyに委託することができ、そのタスクはユーザーのスタイルに基づいて実行されます。また、プロアクティブな提案を通じて、ユーザーの未来のニーズを予測することも可能です。
評価基準の詳細
- ワークフロー自動化
- タスクとプロジェクトのトラッキング
- チーム協力ツール
- 生産性に重きを置いたAIアシスタント
- スマートスケジューリングと催促機能
- 多ツール連携

Deepgramは、音声AIプラットフォームであり、開発者に録音音声のスクリプト化と自然な流れのある口承の生成に関するAPIを提供しています。モデルの設計は、さまざまな言語、訛り、音質に対して低遅延、高精度のパフォーマンスを実現し、ライブキャプション、コール分析、音声アシスタント、会話アーケージなど多様なアプリケーションに適しています。 バメリネヺロイト, Deepgram を以吃に,のリアスタビティトに得きる两事で,リアスタビティトに一个に得きる稿、サコタルが設学に中ㄯいにぷした。モント斨済とサコタルが狧、レーター、カアサザンティトに檓常らとばた、メヲラア゠、給年フォサタイントに安全が輪です
評価基準の詳細
- リアルタイムストリーミングスピーチ・トランスクリプション
- ニューラルテキスト・トゥ・スピーチの声
- 話し手分離や単語レベルのタイムスタンプ
- カスタムモデルのフィルターニング
- オーディオインテリジェンス(感情、主題、要約)
- RESTとWebSockat API、およびマルチ言語のSDK

Kokoro TTSは、多数の文字言語とボイススタイルをカバーする、クリアで自然な音質を持つ音声合成システムです。このシステムは、高品質のボイス合成を開発者、コンテンツクリエーターや趣味があれば誰でも利用できるように、ビデオ、アウディオブック、エクセスビリティツール、ボイスアシスタントのようなプロジェクトで実現可能な音質の出力を見極めることを目指しています。 このモデルは、流暢な調子(prosody)や認識可能な話者の特徴(speaker characteristics)を出すことを主眼とし、その軽量さで、さまざまな環境でも動作できるように設計されています。ユーザーは簡単な文章から音声ファイルを生成できます。また、ユーザーはさまざまな人の声のバリエーションを選ぶことができ、発生した音声入力もユーザーのワークフローやアプリケーション内に組み込むことができます。
評価基準の詳細
- 言語を超えたテキスト・トゥ・スピーチの生成
- 様々なボイスプロファイルを選択可能
- 自然なイントネーションとペース
- エクスポート可能なアウトプット音
- 「アプリ、動画、ナレーションなどに対応
- 開発者にとっては容易な統合






