წარსული ბრძოლა · 2024-11-03 UTC
Speech Recognition შერკინება — 3 ნოემბერი, 2024
Speech Recognition კატეგორიიდან. 27 ნიშნები განთავსებული 6 მებრძოლზე. WithAudio-მა აიღო გვირგვინი.
საბოლოო შედეგები
შემადგენლობა
მებრძოლები
ამ ბრძოლაში მონაწილე ყველა ხელსაწყოს პროფილი, დალაგებული მათი საბოლოო ქულის მიხედვით.

WithAudio
ერთჯერადი შესყიდვის ტექსტ-ხმა რედაქტორი Mac-სა და Windows-ისთვის ბუნებრივი AI ხმებით

WithAudio არის desktop ტექსტ-ხმა აპლიკაცია Mac-სა და Windows-ისთვის, რომელიც წერილობით კონტენტს გადაჰყავს ხმოვან აუდიოში. მომხმარებლებს შეუძლიათ ტექსტის ჩასმა, დოკუმენტების ჩატვირთვა ან სტატიების იმპორტი და მათი გაგება AI-ის მიერ გენერირებული ხმების გამოყენებით, რითაც ის გამოსაყენებელია ტექსტის შემოწმების, ხელმისაწვდომობისა და ხელის გარეშე კითხვისთვის. გამონაკლისია იმ უმეტეს ხმის სინთეზის ინსტრუმენტებისგან, რომლებიც ყოველთვიურ აბონემენტებზე დამოკიდებულია, WithAudio ერთჯერადი შესყიდვის სახით გამოიყურება, რაც მკითხველებსა და მწერლებს უფრო მეტად მოახერხებულ ხარჯებს სთავაზობს. აპლიკაცია უფრო მეტად მარტივ მოსმენის გამოცდილებაზე იყენებს ვიდრე რთულ აუდიო წარმოებაზე, რეპროდუქციის კონტროლებით და შესაძლებლობით გენერირებული აუდიოს მოგვიანო გამოყენებისთვის ექსპორტისთვის.
კრიტერიუმების დაყოფა
- ტექსტ-ხმა კონვერტაცია AI ხმებით
- კროს-პლატფორმული მხარდაჭერა macOS-სა და Windows-ისთვის
- აუდიო ექსპორტი ოფლაინ მსმენელობისთვის
- დოკუმენტისა და ტექსტის შესაყვანი პარამეტრები
- რეგულირებადი გაშვების კონტროლები
- ერთჯერადი ლიცენზიის აქტივაცია

CallFluent
AI ზCalling analytics platform, რომელიც ტრანსცირებს, ანალიზს აკეთებს და ავტომატიზირებს ბიზნეს ტელეფონურ საუბრებს.

CallFluent არის AI‑დრაივნული ზარის ანალიზის პლატფორმა, რომელიც შექმნილია, რათა ბიზნესებს მეტი ღირებულება მიიპოვონ მათი ტელეფონური ურთიერთობებიდან. იგი აერთიანებს speech-to-text transcription, conversation intelligence და workflow automation‑ს, რათა გამოიცინოს შეხედულებები გაყიდვების ზარებიდან, მხარდაჭერის ბილეთებიდან და მომხმარებელთა შეკითხვებიდან. პლატფორმა ანალიზებს ზარის დროს ტონს, დანიშნულებას და ძირითადი თემებს, რაც გუნდებს აძლევს ხედვას მომხმარებლის ემოციურ მდგომარეობაზე, აგენტის შესრულებაზე და საერთო უარყოფებზე. მენეჯერებს შეუძლიათ ტრენდების გადახედვა დიდი რაოდენობის საუბრების შუალედში, ყოველ ჩანაწერის ხელით მოსმენით გარეშე. CallFluent‑ს ავტომატიზაციის ფუნქციებით, როგორიცაა ზარის შეჯამება, CRM‑ჟურნალი და შემდგომი მოქმედებების ტრიგერები, მიზნად ისახავს შემცირებას განმეორებითი ზარის შემდგომი სამუშაოს და გუნდებს დაეხმარება უფრო სწრაფად მოქმედებაში იმაზე, რაც მომხმარებლები ნამდვილი რამე ამბობს.
კრიტერიუმების დაყოფა
- AI ხმის-ტექსტის ტრანსცირაცია
- გრძნობებისა და намерების ანალიზი
- ავტომატური ზარის შეჯამება
- საუბრის ინსაიტების დაფა
- CRM‑სა და სამუშაო პროცესის ინტეგრაციები
- ზარის შემდეგი ავტომატიზაციის ტრიგერები

Inworld AI
შექმენით ინტერაქტიული AI-შეწეული პერსონაჟები თამაშებისა და ინტუიციურ ვირტუალურ გამოცდილებებისთვის.

Inworld AI არის პერსონაჟის ძრავა, რომელიც შექმნილია დეველოპერებისთვის, რომლებიც თამაშებს, ვირტუალურ სამყარებებსა და ინტერაქტიულ მედიას ქმნიან. იგი აძლევს შემქმნელებს შესაძლებლობას, შექმნან NPC‑ები და ციფრულ პერსონაჟებს უნიკალური პერსონალით, მეხსიერებით, ხმებით და მოზღევებით, შემდეგ კი ისინი რეალურ დროში საუბრისა და კონტექსტუალური ქცევის საშუალებით ცხოვრებისაკენ მიძახონ. პლატფორმა ენის მოდელებს აერთიანებს მიზნებთან, ცოდნის ბაზებთან და ემოციურ მდგომარეობებთან, რათა პერსონაჟები შეძლონ დინამიკურად პასუხის გაცემა მოთამაშეებს, არა სკრიპტირებულ ტექსტებზე დაყრდნობით. ინტეგრაციები, როგორიცაა Unreal და Unity, ასევე SDK-ებით და API-ებით, ქმნის შესაძლებლობას, პერსონაჟების განთავსება თამაშის პროექტებში, საუბრის გამოცდილებაში, ტრენინგის სიმულაციებში და განაცილებლური აპლიკაციებში.
კრიტერიუმების დაყოფა
- მორგებადი AI პერსონაჟის პიროვნებები
- გრძელვადიანი მეხსიერება და ცოდნის ბაზები
- ხმის სინთეზი და ემოციური გამოსახვა
- Unity და Unreal Engine SDK-ები
- მიზნები, ტრიგერები და ქცევის კონტროლები
- მულტიპლერი და მრავალპერსონაჟიანი ურთიერთქმედება

Molly Personal Assistant
AI‑асისტენტი სამუშაო პროცესების ავტომატიზაციისა და გუნდის თანამშრომლობის გამარტივებისთვის.

Molly არის AI პირადი ასისტენტი, რომელიც შექმნილია სამუშაო ნაკადების ავტომატიზაციისთვის და გუნდური თანამშრომლობის გამარტივებისთვის. ის მიზნად ისახავს ღრმა პერსონალიზებულ გამოცდილებას თავისი 'უსასრულო მეხსიერება' ფუნქციის საშუალებით, რომელიც საშუალებას მისცემს დამხმარე მომხმარებლის პარამეტრების დამახსოვრება და ურთიერთობების შესაბამისი მორგება. მომხმარებლებს შეუძლიათ დავალებების მიცემა Molly‑ს, რომელიც მათ შეასრულებს, შეესაბამება მომხმარებლის სტილს. ასისტენტი ასევე წინასწარ შემოთავაზებს, რათა მომხმარებლები წინასწარ იმუშაონ, მათი მომავალი საჭიროებები წინასწარ განვსაზღვროს. Molly ამჟამად შეზღუდულ კერძო ბეტაშიაა და დაინტერესებული მომხმარებლები შემოგვიერთდებიან ლოდინის სიაში მისი შესაძლებლობების გამოსაცდელად.
კრიტერიუმების დაყოფა
- სამუშაო პროცესების ავტომატიზაცია
- ამოცანებისა და პროექტების ტრეკინგი
- გუნდის თანამშრომლობის ინსტრუმენტები
- პროდუქტივიტეზე ორიენტირებული AI‑асისტენტი
- ჭკვიანი დაგეგმვა და შეხსენებები
- ხელსაწყოთა შერევა

Deepgram
საუბრის-ტექსტში და ტექსტის-საუბარში API-ები რეალურ დროში ხმის აპლიკაციების შესაქმნელად.

Deepgram არის ხმის AI პლატფორმა, რომელიც დეველოპერებს API-ები გაწვდით აუდიოს ტრანსკრიპციასა და ბუნებრივად მოსმენადი ხმის გენერაციისთვის. მისი მოდელები შექმნილია დაბალი ლატენსიით და მაღალი სიზუსტით, სხვადასხვა ენებზე, აქცენტებზე და აუდიო პირობებზე, რაც მას შესაფერისს ხდის პირდაპირი წარწერისთვის, ზარის ანალიზისთვის, ხმის ასისტენტებისთვის და კონვერსაციურ აგენტებისთვის. ძირითადი ტრანსქრიპციის მიღმა, Deepgram უზრუნველყოფს ფუნქციებს, როგორიცაა საუბრის დიარიზაცია, ემოციური და თემატური ამოცნობა, მორგებული მოდელის სწავლება და ნაკადის მხარდაჭერა. პლატფორმა მიმართულია ინჟინერიული გუნდებისთვის, რომლებიც საჭიროებენ ხმის შესაძლებლობების პროდუქტებში ჩასმა, არ ააშენონ ხმის ინფრასტრუქტურა ნულიდან.
კრიტერიუმების დაყოფა
- რეალურ დროში ნაკადის აუდიო-ტექსტში გადაყვანა
- ნეირალური ტექსტის-საუბრის ხმები
- საუბრობელის დიაარიზაცია და სიტყვების დონეზე დროის შტამპები
- მორგებული მოდელის დეტალური კორექტირება
- აუდიო ინტელექტი (სენტიმენტი, თემები, შეჯამება)
- REST და WebSocket API-ები მრავალენოვანი SDK-ებით
Kokoro TTS
ღია წყაროს მქონე მრავალენოვანი ტექსტ‑ტუ‑სპიჩ, რომელიც დაწერილი ტექსტს ბუნებრივად ხმის სახით გადმოდის.

Kokoro TTS არის ტექსტიდან-ხმის სისტემა, რომელიც შექმნილია წერის შეყვანის ცხად, ბუნებრივი ხმის გადაყვანისთვის მრავალენოვან და ხმოვანი სტილებს შორის. მისი მიზანი არის მაღალი ხარისხის ხმის სინთეზის ხელმისაწვდომობა პროგრამისტებისთვის, კონტენტის შემქმნელებისთვის და ჰობიებისთვის, რომლებსაც რეალისტური აუდიო გამოტანის საჭიროება აქვთ ვიდეოებისთვის, აუდიოწიგნებისთვის, ხელმისაწვდომობის ხელსაწყოებისთვის და ხმის ასისტენტებისთვის. Kokoro TTS მოდელი აქცენტს აკეთებს მდიდარი პროსოდიზე და ამომხრეის მახასიათებლების აღიქვაზე, ამავე დროს კი დარჩება საკმარისად მსუბუქი, რათა სხვადასხვა გარემოში გაშვდეს. მომხმარებლებს შეუძლიათ ტექსტიდან ხმოვანი აუდიოს გენერირება, სხვადასხვა ხმებს შორის არჩევა და შედეგების საკუთარი სამუშაო ნაკადებში ან აპლიკაციებში ინტეგრირება.
კრიტერიუმების დაყოფა
- მრავალენოვანი ტექსტის‑ტუ‑სპიჩ გენერაცია
- მრავალი არჩევადი ხმის პროფილი
- ბუნებრივი ინტონაცია და რითმი
- გატანადი აუდიო გამოსავალი
- შესაფერისია აპლიკაციებისთვის, ვიდეოებისთვის და ნარაციონირებისთვის
- პროგრამისტებისთვის მოსახერხებელი ინტეგრაცია




