历史对决 · 2024-11-03 UTC
Speech Recognition 对决 — 2024年11月3日
来自Speech Recognition类别。 27个标记分布在6个参赛者中。 WithAudio夺得桂冠。
最终排名
阵容
参赛工具
参加这场对决的每个工具的简介,按最终得分排序。

WithAudio 是一款适用于 Mac 和 Windows 的桌面文本转语音应用程序,可将书面内容转换为口语音频。用户可以粘贴文本、加载文档或导入文章,并使用一系列 AI 生成的语音朗读出来,使其对于校对、辅助功能和免提阅读非常有用。 不同于大多数依赖月度订阅的 TTS 工具,提供一次性购买的模式对希望成本可控的读者和作者来说更具吸引力。该应用专注于提供直接的聆听体验,而非复杂的音频制作,支持播放控制,并允许导出生成的音频以供后续使用。
标准细分
- 使用 AI 语音进行文本到语音转换
- 适用 macOS 和 Windows
- 在离线中导出的音频播放
- 文件和文本输入选项
- 可调节的播放控制
- 一次许可证激活


CallFluent 是一个由 AI 驱动的通话分析平台,旨在帮助企业从电话互动中获得更大价值。它将语音转文本、对话智能和工作流自动化相结合,挖掘销售通话、支持工单和客户咨询中的洞察。 平台会分析通话中的语调、意图和核心话题,帮助团队洞察客户情绪、客服表现及常见异议。管理者可以在不逐一聆听录音的情况下,审阅大量对话的趋势。 通过自动化功能,例如通话摘要、CRM 日志记录和后续触发器,CallFluent 旨在减少重复的会后工作,并帮助团队更快地对客户实际说的话采取行动。
标准细分
- AI 语音转文字转录
- 情感与意图分析
- 自动化通话摘要
- 对话洞察仪表盘
- CRM 与工作流集成
- 通话后自动化触发器


Inworld AI 是一款面向开发者的角色引擎,适用于游戏、虚拟世界和互动媒体的开发。它让创作者设计拥有独特个性、记忆、声音和动机的 NPC 与数字人格,并通过实时对话和情境行为为它们注入生命。 该平台将语言模型与目标、知识库和情感状态相结合,使角色能够动态响应玩家,而不是遵循预设脚本。与 Unreal 和 Unity 等引擎的集成以及 SDK 与 API 的提供,使得可以在游戏项目、聊天体验、培训模拟和娱乐应用等方面部署角色。
标准细分
- 可定制化的 AI 角色个性
- 长期记忆和知识库
- 语音合成和情绪表达
- Unity 和 Unreal Engine SDK
- 目标、触发器和行为控制
- 多人和多角色互动


Molly 是一种人工智能个人助手,旨在自动化工作流程和团队协作流程。它目标为用户提供深度个人化的用户体验,通过“无限记忆”功能允许记住用户偏好,并根据偏好来调整互动。用户可以把任务委托给 Molly,它以用户的风格来执行任务。助手还有主动性地建议用户,以便在未来的需求前让他们保持领先。Molly 目前处于有限内测阶段,感兴趣的用户可以等待报名加入并体验其能力。
标准细分
- 工作流程自动化
- 任务和项目跟踪
- 团队协作工具
- 生产力专注的AI助手
- 智能排程和提醒
- 跨工具集成

Deepgram 是一个语音 AI 平台,为开发者提供用于音频转录和生成自然语音的 API。其模型针对低延迟、高精度的表现进行了设计,能够覆盖多种语言、口音和音频环境,适用于实时字幕、呼叫分析、语音助手和对话代理。 除核心转录之外,Deepgram 还提供说话人分离、情绪和主题检测、定制模型训练以及流式支持等功能。该平台面向需要在产品中嵌入语音功能的工程团队,而不必从头构建语音基础设施。
标准细分
- 实时流式语音转文本
- 神经网络文本转语音(text-to-speech)声音
- 说话人分离和词级时间戳
- 自定义模型微调
- 音频智能(情感、主题、摘要)
- REST 和 WebSocket API,配套多语言 SDK

Kokoro TTS 是一个文本转语音系统,旨在将书面输入转换为清晰、自然的语音,支持多种语言和声音风格。它使开发者、内容创作者以及业余爱好者能够轻松获得高质量的语音合成,适用于视频、电子书、无障碍工具和语音助手等项目中的逼真音频输出。 该模型致力于生成流畅的韵律和可辨识的说话者特征,同时保持轻量级,足以在多种环境中运行。用户可以从文本片段生成语音,选择不同的声音,并将输出整合到自己的工作流程或应用程序中。
标准细分
- 模更功囍事外角市文語しったにを仑宗
- 外角いる经强と字前線
- 模更一强るそよく五で当前できだ
- 发速たが下訪弃を主きでが送さ
- 股な訪き囉くる影季と武対义い发速
- オイュンを亢なたからなか当前できだ






