지난 배틀 · 2024-11-03 UTC

Speech Recognition 대결 — 2024년 11월 3일

Speech Recognition 카테고리에서. 6개의 참가자에 걸쳐 27 표시가 배치되었습니다. WithAudio이(가) 왕좌를 차지했습니다.

최종 순위

출전 라인업

참가자들

이 배틀에 참가한 모든 도구의 프로필, 최종 점수순으로 순위가 매겨졌습니다.

1WithAudio logo

WithAudio

맥 OS 및 윈도우의 한 번의 구매 Text-to-Speech 리더 AI 자연 목소리와

4.8 (6)
프리미엄
WithAudio의 스크린샷

WithAudio는 macOS와 Windows용 데스크톱 텍스트-스피치 애플리케이션으로, 쓰여진 콘텐츠를 말하는 오디오로 변환합니다. 사용자는 텍스트를 붙여넣을 수 있습니다. 문서를 로드하거나 기사를 임포트하여 유사 인공지능 voices의 선택 목록을 이용하여 읽어낼 수 있습니다. 이는 검사, 접근성, 및 무지퍼 읽기 용도로 유용합니다. 대부분의 TTS 툴이 월간 구독에 의존하는 것과 달리, WithAudio는 단한 번의 구매만으로 이용할 수 있습니다. 이는 예측 가능한 비용을 원하는 독자와 작가들에게 호감을 이룹니다. 이 툴은 정교한 오디오 제작보다는 단순한 듣기 경험이 주요 목표인 것으로 보여집니다. 이는 내보내기 기능과 음성 플레이백의 간단한 제어기능을 갖추고 있습니다.

평가 기준 분해

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs1
Reliability1
  • 기계 학습 음성 기반 Text-to-Speech 변환
  • mac OS 및 Windows를 위한 크로스 플랫폼 지원
  • 오프라인 듣기 위해 오디오 내보내기
  • 문서 및 텍스트 입력 옵션
  • 재생 제어의 조절
  • 한 번의 라이센스 활성화
2CallFluent logo

CallFluent

AI

4.4 (5)
프리미엄
CallFluent의 스크린샷

CallFluent은 기업의 전화 인터렉션에서 더 많은 가치를 얻는데 도움이되는 AI-드라이븐 콜 애널리틱스 플랫폼으로 설계되었습니다. 그들은 음성-to-텍스트 전사, 대화 지능력, 그리고 워크플로우 자동화와 같은 기능을 결합했으며 판매 콜, 지원 티켓, 그리고 고객 질의에서 유익한洞察를 구경할 수 있게 해줍니다. 플랫폼은 통화를 분석하여 톤, 의도 및 주요 주제를 파악하여 팀이 고객의 감성, 에이전트의 성과 및 일반적인 항의를 파악할 수 있게됩니다. 매니저는 매뉴얼하게 녹음파일을 들을 것 없이 높은 대용량의 대화에 대한 추이를 검토할 수 있습니다. _CallFluent_은 콜 요약, CRM 로깅 및 추적 조건과 같은 자동화 기능을 제공함으로써 팀들이 고객이 실제로 말한 대로 더 속도롭게 행동할 수 있도록 도와주는 반복적_POST_CALL_ 작업을 감소시키기 위해 목표를 잡았습니다.

평가 기준 분해

Ease of use1
Value for money1
Features & power0
Integrations1
Support & docs1
Reliability1
  • AI
  • AI
  • CRM
  • API
3Inworld AI logo

Inworld AI

게임 및 가상 현실 경험에 참여하는 IA 기반 캐릭터를 만들기 위한 플랫폼입니다.

4.6 (5)
프리미엄
Inworld AI의 스크린샷

인월드 AI(Inworld AI)는 게임, 가상 세계 및 인터랙티브 미디어를 개발하는 개발자들이 설계할 수 있도록 설계된 캐릭터 엔진입니다. 이 엔진은 크리에이터들이 특정 성격, 기억, 목소리 및 동기를 가진 NPC와 디지털 인물에 대해 디자인 할 수 있게 해주고, 실시간 대화와 콘텍스트에 의한 행동을 통해 그들을 삶에 데려옵니다. 플랫폼은 목표, 지식庫, emocional 상태와 같은 요소들을 언어 모델과 결합하여 캐릭터가 플레이어에 반응하는 방식을 동적으로 변형시킬 수 있게 합니다. 실용 엔진과 Unreal, Unity와 같은 엔진, plus SDK, API를 통한 연동을 통해 게임 프로젝트, 채팅 경험, 양육 시뮬레이션 그리고Entertainment 앱과 같은 여러 플랫폼에 캐릭터를 배치할 수 있습니다.

평가 기준 분해

Ease of use1
Value for money1
Features & power1
Integrations0
Support & docs1
Reliability1
  • 사용자의 맞춤 AI 캐릭터 특성
  • 장기 기억 기능과 지식 베이스
  • 음성 합성 및 감정 표현
  • 유니티 및 언리얼 엔진 SDK
  • 목표, 트리거 및 행동 제어
  • 멀티 플레이어 및 멀티 캐릭터 상호작용
4Molly Personal Assistant logo

Molly Personal Assistant

워크플로우 자동화 및 팀 협업을streamlining하는 AI 보조 프로그램

4.5 (6)
프리미엄
Molly Personal Assistant의 스크린샷

몰리(Molly)는 워크플로우를 자동화하고 팀 조직 협업을 간소화하는 인공지능(AI) 개인 보조 기기를 설계합니다. 무한记忆(infinite memory) 기능을통해 사용자 선호도와 상호 작용을 맞춰 personalize한 경험을 제공하고자 합니다. 사용자는 몰리에게 업무를 위임할 수 있고, 몰리는 사용자 스타일에 맞춰 실행합니다. 보조 기기도 미래의 사용자 요구를 예측하여 능동적으로 제안을 제공합니다. 몰리는 현재 제한된 사내 베타 버전입니다. 관심있는 사용자는 몰리의 기능을 경험하기위해 대기 목록에 가입할 수 있습니다.

평가 기준 분해

Ease of use1
Value for money0
Features & power1
Integrations1
Support & docs1
Reliability1
  • 워크플로우 자동화
  • 과제 및 پروژه 추적
  • 팀 협업 도구
  • 생산성에 초점 맞춘 AI 보조 프로그램
  • 지능형 스케줄링 및 알람
  • 크로스 도구 통합
5Deepgram logo

Deepgram

실시간 음성 응용 프로그램을 위한 기계음성 인식 및 기계음성 출력 API

4.6 (5)
프리미엄
Deepgram의 스크린샷

Deepgram은 음성 인공지능 플랫폼으로 개발자에게 오디오 변환 및 자연스러운 연설을 생성하는 API를 제공합니다. 모델의 성능은 낮은 지연 시간, 높은 정확도를 제공하며 다양한 언어, 악센트 및 오디오 조건에 걸쳐 설계되어实시간 캡션 기능, 통화 분석, 음성 대화 인터페이스 및 대화 에이전트와 같은 다양한 응용 분야에 적합합니다. Deepgram의 주요 음성 기록 기능 외에도 화자 식별,感情 및 주제 감지, 커스터마이즈 모델 훈련 및 스트리밍 지원과 같은 다양한 기능을 제공합니다. 이 πλα랫폼은 제품의 음성 기능을 포함시키기 위해 음성 인프라를 처음부터 구축하지 않고도 엔지니İng 팀에게 목적을 둡니다.

평가 기준 분해

Ease of use1
Value for money1
Features & power1
Integrations1
Support & docs0
Reliability0
  • 실시간 스트리밍 음성 인식
  • 신경망 Text-to-Speech 보이스
  • 음성 자리화와 단어 수준 타임스탬프
  • 고유 모델 tinh 다듬기
  • 음성 지능(감정, 주제, 요약)
  • REST 및 WebSocket API와 다언어 SDK
6K

Kokoro TTS

"열려있는-source 다언어 텍스트-음성인식이 탁월한 음성으로 텍스트를 변환합니다."

4.3 (6)
프리미엄
Kokoro TTS의 스크린샷

코코로 TTS는 작성된 입력을 다양한 언어 및 음성 스타일에서 명료하고 자연스러운 음성으로 변환하기 위한 텍스트- 음성 합성 시스템입니다. 개발자, 콘텐츠 생성가 및 취미가있는 사용자를 위한 높은 품질의 음성 합성이 가능한 음성 합성 기능을 개발자, 콘텐츠 생성가 및 취미가있는 사용자에게 제공하려는 목적입니다. 비디오, 오디오북, 액세스성 도구 및 보이스 애플리케이션 등 프로젝트의 경우에 사실적인 오디오 출력이 필요한 사용자에게 제공됩니다. 이 모델은 유연하고 가볍게 환경에 구현 할 수있는 다양한 환경에서 운용되도록 하면서도 음성 특징이 인식되는 구문에 중점을 둡니다. 사용자는 텍스트 조각에서 스피크 인 오디오를 생성하고 다양한 목소리 중에서 선택할 수 있으며, 출력을 자신들의 워크 플로우나 애플리케이션에 통합 할 수 있습니다.

평가 기준 분해

Ease of use1
Value for money0
Features & power0
Integrations0
Support & docs1
Reliability0
  • "다언어 텍스트-음성인식 기능"
  • "다수의 음향 프로파일이 선택할 수 있습니다"
  • "자연적인 인조니션이션과 빠르기"
  • "나열할 수 있는 오디오 출력"
  • "앱, 비디오, 연기용에 맞습니다"
  • "개발자 친화적인 통합"