人工智能生成的语音模型的市场巨大。
创意用例要求人工智能语音模型更具表现力,而寻求自动化客户支持和销售运营的企业则需要它们更具可操纵性。
位于帕洛阿尔托的 Fish Audio 希望通过其包含 15,000 多个自然语言控件的库来满足所有这些用例。
自去年成立以来,该初创公司目前已有超过 800 万人使用其模型的开源或托管版本,每年产生经常性收入 2100 万美元。
为了继续巩固这一势头,这家初创公司周二表示,已在由 Coreline Ventures 和 Capital Today 领投的种子轮融资中筹集了 5200 万美元。
359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners 和 HF0 也参与了本轮融资。
Fish Audio 最初是 Nvidia 前研究员 Shijia Liao 的一个小项目,他对市场上缺乏表达力的合成声音感到沮丧,在单个 GPU 上训练了一个语音生成模型,然后将其开源。
GitHub 上的 Fish Speech 存储库现已拥有超过 31,000 颗星,被独立开发者、视频游戏设计师和创作者使用。
该公司去年推出了五种模型:四种语音生成模型和一种语音转文本模型。
它开源了三个语音生成模型,但其最新的 S2.1 Pro 模型只能通过其付费 API 获得。
Fish Audio 提供适合创作者和团队的付费月度计划,可解锁一定分钟的生成时间以及语音克隆功能。
该公司还提供其 API 和平台的企业版,并表示 HeyGen 和 Sanas 等组织已经在使用它。
“每个企业都有不同的用例和不同的偏好。
例如,像HeyGen这样的公司,使用我们的声音来为人工智能化身提供动力,希望声音真实;游戏工作室希望他们的角色有富有表现力的声音;而像LiveKit这样的语音代理公司则希望声音更自然、低延迟,足以表达通话的声音,”Fish Audio的首席执行官兼联合创始人曹瑞莎说。
该初创公司建立语音库的一种方法是要求用户提交自己的声音来训练其模型,如果他们的声音被使用,则向他们提供补偿。
然而,几个月前这导致了一些麻烦,因为 一些 创造者
🔗 原始来源
如果你要核对细节,可以再看原文: TechCrunch AI原文链接
AI热榜