معركة سابقة · 2024-11-03 UTC
Speech Recognition مواجهة — 3 نوفمبر 2024
من فئة Speech Recognition. 27 علامات موزعة على 6 متنافسين. WithAudio نال التاج.
الترتيب النهائي
التشكيلة
المتنافسون
ملفات تعريف كل أداة تنافست في هذه المعركة، مرتبة حسب الدرجة النهائية.


هو معالج نص إلى صوت موضعي على نظامي ماك ونظام ويندوز يقوم باتخاذ النص المكتوب إلى صوت صوتي. يمكن للمستخدمين قص النص، تشغيل الملفات، أو importing المضامین واستخدامها للقراءة الصوتية باستخدام خيارات الصوتين التي تم توليدها اصطناعياً بالذكاء البشري، مما يجعلها مفيدة للتصحيح، التواصل الفعّال و القراءة بحرّية. معظم أدوات الصوت الصوتية تعتمد على الإشتراك الشهري، بينما توفر WithAudio بيعًا متميزًا من النوع واحد، وذلك يلائم الكتاب وأصحاب المقالات الذين يرغبون في أن يبقى تكاليفهم ثابتة. تُمكّن التطبيق من تجربة استماع مباشرة دون الحاجة إلى إنتاج صوتي مُطوّلاً، وتحتوي على وسائل تحكم بالسماعة مع إمكانية تصدير الصوت generado لاستخضامه في وقت لاحق.
تفصيل المعايير
- تحويل النص إلى 声 إلى صوتusing أجهزة الصوت الألي
- دعم متعدد اللغات لنظامي macOS و Windows
- ت.export المرفقات الصوتیة لممارسة الاستماع دون اتصال
- خيارات إدخال الملفات النصية والسجلات
- نظريات التحرير المتنوعة
- تفعيل الترخيص الواحد

CallFluent
منصة تحليلات المكالمات الذكاء الاصطناعي التي تنسخ، تحلل، وتأتمن مكالمات تجارية.

يُعتبر CallFluent منصة تحليلات مكالمات تُحركت بموارد الذكاء الحاسوبي لتحقيق فوائد أكثر من خلال التفاعلات الهاتفية في الأعمال. وهي تدمج الترجمة الصوتية للنص, والمعرفيَّة المحادثاتيَّة, وتحكم الإجراءات التصنيفيَّة لاستكشاف الآراء من المكالمات التجاريَّة, وجنوبات الدعم, ومشروعات التواصل مع العملاء. تمَّتلك المنصة القدرة على تحليل المزاج و المبدأ والمواضيع الرئيسية خلال المكالمات، مما يعطي الفريق مرآة عن_SENTIMENT المشتركين وأداء الوكلاء ومقاطع التعريف الشائعة. يمكن للمديرين المراجعة للتوجهات عبر مراحل عديدة من المحادثات على الرغم من مرور كميات كبيرة، دون الحاجة إلى سماع كل Bản تسجيل بصوت معين. باستخدام واجهات برمجة تطبيقات automation مثل ملخصات المكالمات وقوائم المتابعة وقوائم اتصالات CRM، وحوافز متابعة التكرارية، تهدف CallFluent إلى الحد من العمل التكراري بعد المكالمة ومنح الفرق القدرة على اتخاذ الإجراء بشكل أسرع وفق ما يقوله العملاء بالفعل.
تفصيل المعايير
- تحويل الكلمات النطقية إلى النص
- تحليل المoods و الهدف
- التحليل αυτόمال لللقاءات
- لوحة التحليلات لللقاءات
- التركيز و المتكاملات بالكلاسيك
- تفعيلات الأتمتاتة بعد اللقاء


Inworld AI هو محرك شخصيات مصمم للمطورين الذين يبنين ألعابًا وعوالم افتراضية ووسائط تفاعلية. يسمح للمبدعين بتصميم NPCs وشخصيات رقمية مع شخصيات مميزة وذكريات وأصوات ودوافع، ثم إعطائهم الحياة من خلال محادثة وقت実 و سلوك سياقي. تجمع المنصة نماذج اللغة مع الأهداف وقواعد البيانات والحالات العاطفية بحيث يمكن للشخصيات الاستجابة بشكل ديناميكي للاعبين بدلاً من اتباع السطور المكتوبة. يتم تعزيز هذه القدرات من خلال التكامل مع محركات مثل Unreal و Unity، بالإضافة إلى SDKs و APIs، مما يجعل من الممكن نشر الشخصيات عبر مشاريع الألعاب وتجارب المحادثة وبرامج المحاكاة وتطبيقات الترفيه.
تفصيل المعايير
- شخصيات الذكاء الاصطناعي قابلة للتخصيص
- الذاكرة والقواعد المعرفية على المدى الطويل
- ت合성 الصوت والتعبير العاطفي
- Unity و Unreal Engine SDKs
- أهداف وأusan والسيطرة على السلوك
- التفاعلات المتعددة اللاعبين والشخصيات المتعددة


مولي هو مساعد شخصي ذكي مصمم لأتمتة سير العمل وتحسين التعاون الجماعي. يهدف إلى توفير تجربة شخصية عميقة من خلال ميزة 'الذاكرة اللانهائية'، التي تسمح له بتذكر تفضيلات المستخدم وتخصيص التفاعلات وفقًا لذلك. يمكن للمستخدمين تفويض المهام إلى مولى، الذي ينفذها بطريقة تتوافق مع أسلوب المستخدم. يقدم المساعد أيضًا اقتراحات استباقية لإبقاء المستخدمين في الطليعة من خلال توقع احتياجاتهم المستقبلية. مولى حاليًا في مرحلة تجريبية خاصة محدودة، ويمكن للمستخدمين المهتمين الانضمام إلى قائمة الانتظار لتجربة قدراته.
تفصيل المعايير
- أتمتة سير العمل
- تتبع المهام والمشاريع
- أدوات التعاون الجماعي
- مساعد ذكاء اصطناعي يركز على الإنتاجية
- الجدولة الذكية والتذكيرات
- تكامل عبر الأدوات


Deepgram هي منصة ذكاء اصطناعي للصوت توفر للمطورين واجهات برمجة تطبيقات (APIs) لترجمة الصوت وتوليد کلام自然ي الصوت. تم設計 نماذجها لأداء منخفض الخطورة وضبط висок الدقة عبر مجموعة واسعة من اللغات واللهجات وضروف الصوت، مما يجعلها مناسبة لتعليمات حية وتحليل المكالمات والمساعدين الصوتيين ووكلاء المحادثة. إضافة إلى النصوص الأساسية، يقدم Deepgram ميزات مثل تحديد المتكلم، وتحليل المشاعر والمواضيع، وتنظيف النماذج المخصصة، ودعم البث. يستهدف المنصة فرق الهندسة التي تحتاج إلى دمج قدرات الصوت في المنتجات دون بناء بنية الكلام من الصفر.
تفصيل المعايير
- ترجمة خطية للكلام إلى نص في الوقت الفعلي
- أصوات نص- إلى-كلام عصبونية
- تجزئة المتحدثين وتوقيتات على مستوى الكلمة
- تعديل الطرازات المخصصة
- ذكاء الصوت (المزاج، المواضيع، تلخيص)
- ويب REST و WebSocket APIs مع SDKs متعددة اللغات

Kokoro TTS هو نظام текст-إلى-كلام مصمم لتحويل الإدخال المكتوب إلى كلام واضح وطبيعي الصوت عبر مجموعة من اللغات وأساليب الصوت. ويهدف إلى جعل 합성 الصوت عالي الجودة متاحة للمطورين و创建 المحتوى والحرفيين الذين يحتاجون إلى إخراج صوتي واقعي لمشاريع مثل الفيديوهات والكتب الصوتية وأدوات سهولة الوصول والمساعدين الصوتيين. يركز النموذج على إنتاج نطق مُنتَظم وسمات متكلم قابلة للتعرف مع البقاء خفيفًا بدرجة كافية للتشغيل في مجموعة متنوعة من البيئات. يمكن للمستخدمين إنشاء صوت مُتَكَلَّم من مقاطع النص، واختيار الصوت بين أصوات مختلفة، ودمج الإخراج في عمليات العمل أو التطبيقات الخاصة بهم.
تفصيل المعايير
- حوكي تهتسي سهرف متعددو لغو فيكا تكزديت
- كوجو ييهكو فيكا وفوكا تهتسي سهرف ياني
- كيوكت توكتو تهتسي سهرف وقوفو تهتسي هوفر نغوفوه تسوجيس فهفر تهتسي سهرف كوسوهو
- كوفي تسوبوت تهتسي سهرف كوكودو نغوفو تكزديت كيكوتمي نوغو
- كوجو نغوفت سهرف ووكتو تهتسي سهرف كوكوداو فيكا تكزديت
- كوفي تسوبوت تهتسي سهرف يسوفوه تهتسي كيكوقوأ يهفوك تيسوقوأ فيكا تكزديت كيوكت سهرف




