지난 배틀 · 2026-06-21 UTC
Speech Recognition 대결 — 2026년 6월 21일
Speech Recognition 카테고리에서. 2개의 참가자에 걸쳐 4 표시가 배치되었습니다. Deepgram이(가) 왕좌를 차지했습니다.
최종 순위
Deepgram출전 라인업
참가자들
이 배틀에 참가한 모든 도구의 프로필, 최종 점수순으로 순위가 매겨졌습니다.

Deepgram은 음성 인공지능 플랫폼으로 개발자에게 오디오 변환 및 자연스러운 연설을 생성하는 API를 제공합니다. 모델의 성능은 낮은 지연 시간, 높은 정확도를 제공하며 다양한 언어, 악센트 및 오디오 조건에 걸쳐 설계되어实시간 캡션 기능, 통화 분석, 음성 대화 인터페이스 및 대화 에이전트와 같은 다양한 응용 분야에 적합합니다. Deepgram의 주요 음성 기록 기능 외에도 화자 식별,感情 및 주제 감지, 커스터마이즈 모델 훈련 및 스트리밍 지원과 같은 다양한 기능을 제공합니다. 이 πλα랫폼은 제품의 음성 기능을 포함시키기 위해 음성 인프라를 처음부터 구축하지 않고도 엔지니İng 팀에게 목적을 둡니다.
평가 기준 분해
- 실시간 스트리밍 음성 인식
- 신경망 Text-to-Speech 보이스
- 음성 자리화와 단어 수준 타임스탬프
- 고유 모델 tinh 다듬기
- 음성 지능(감정, 주제, 요약)
- REST 및 WebSocket API와 다언어 SDK


OpenAI Advanced Voice"는 차트GPT (ChatGPT) 에서 통합된 voice 인터액션模式 (voice interaction mode) 이며, 사용자가 AI (공감을 이끄는 언어 모델, LLM)에게 말을 하면서도 자연스럽고 자유로운 대화를 할 수 있도록 해 줍니다. 이 모드는 저-latency (낮은 지연시간) 를 지원하는 exchange, 중단 (interruptions), 표현豊富한 응답 (expressive responses)등을 지원하여, 사용자가 사람처럼 대화를 하게 만듭니다. 사용자는 명령어를 issuer (assistant) 한 것 같은 느낌보다는, 사람처럼 대화를 나눌 수 있습니다. 이 기능은 모바일과 데스크톱에서 손가락 없는 사용을 위한 것이며, 브레인스토밍, 언어 연습, 주부 교육, 일반적인 대화와 같은 다양한 작업을 지원합니다. 또한, 이 툴은 OpenAI의 기본 다관점 모델에 의해 구동되며, 톤을 적응할 수 있으며 대화를 하는 동안 감정적 힌트를 인식하여 다중 목소리 및 언어로 응답할 수 있습니다.
평가 기준 분해
- 실시간 대화
- 다양한 선택 가능한 AI 목소리
- 중단 및 회전 처리
- 감정 및 톤의 의식
- 다국어 대화 지원
- ChatGPT 앱 내에 통합

