654视图
4.7评级
访问网站

概览

鱼声

鱼声神经网络简介.

Fish Audio是一个多功能的AI平台,用于与声音合作,提供从文字到语音的合成,从短音频样本中进行语音克隆,语音识别,声音效果生成,以及音频轨道编辑. 服务将文字转换为有精致的情感控制——愤怒,低语,取笑,流泣,叹息,暂停,更是使合成的声音接近演员的表演.

该平台的核心是开源"鱼语"技术,培训了超过70万小时的音频数据. 这保证了自然音速和高出产速度:实时的后置能小于200ms. Fish Audio作为网络服务提供,通过Python和JavaScript的有SDKs的API,并通过WebSocket进行流线.

该平台拥有200多万个社区上载用户声音的图书馆,支持30多种语言,并提供无需录音工作室即可创建表达式语音的工具.

有声音

特性数值
类型语音生成、语音克隆、语音识别和语音API平台
类别语音和语音转换、语音克隆、语音生成、语音识别、音频编辑、开放源码
支持的语言30岁以上(包括俄语、英语、日语等)
语音模型数量2 000 000多个用户声音
平台网络、Android、iOS、Linux、Mac、Windows
免费计划是(供个人使用)
分发模式自由ium
API 密码是(REST API、 WebSocket、 Python 和 JavaScript 的 SDK)
技术Fish Speech(接受700 000+小时音频培训的开源技术)
俄语
俄罗斯界面
需要VPN否(有些区域可能要求使用VPN)
用户评级4.7 5 (韩语)
编辑评级9.4/10 (中文(简体) ).

鱼声适合谁?

内容创建者和视频制作者

Fish Audio适合YouTube的创作者,播客,音频书作者,以及任何经常出声,音频片段,或人物视频的人. 这个平台让你得到一个表达性的声音,而不为每次编辑录制一个旁白——只要粘贴文字,选择情感色彩,并生成音频.

开发者和工作室

该平台面向语音代理的开发者,团队与音频书合作,以及需要可控语音合成的演播室. 低纬度的API,SDKs,和流源生成使得将语音能力嵌入应用程序,聊天器,和交互产品成为可能. 该服务也适合游戏开发者,音频工程师,以及AI研究人员.

销售商和小企业

Fish Audio可以被市场营销者、团队和小企业代表用来制作广告,为培训材料配音,以及公司项目,在不雇用旁白的情况下需要快速的演讲生成。

如何使用鱼声?

文本语音

要从文本中生成语音,将文本粘贴到平台编辑器中,从库中选择一个声音(或使用被克隆的声音),用情感标记(例如愤怒,低语,笑声,暂停)设定演讲风格,并获得已完成的音频文件. 限制为每代最多可有3万个字符,这足以作完整的音书章节.

语音克隆

要创建语音的数字拷贝,上传一个或数个音频样本,从几秒(15-30秒为最佳)起,选择隐私设置,并开始处理. 完成后,可使用被克隆的语音进行多种语言的语音转换.

与API的发展

开发者可以通过REST API和WebSocket将Fish Audio集成到他们的应用中,用于实时流媒体语音生成. Python和JavaScript的SDK是可用的. API支持语音合成,用扬声器和情感标记标记识别语音,并创建语音代理. API的使用按现收现付制计费.

鱼声的主要特点

文本对语音( TTS)

Fish Audio将文本转换为带有情绪控制和特殊标记的语音. 编辑提供数十种快递风格:愤怒,低语,取笑,泣,叹,暂停——使合成的声音接近于演员的表演. 多语种语音支持使用30+语言.

语音克隆

语音克隆工作来自短音频样本(从10秒起,15-30秒为最佳). 上传样本后,用户可以得到能够说多种语言的数字拷贝. 拥有200多万个社区上载用户声音的图书馆。

其他音频工具

该平台包括语音识别和转录(Speech-to-Text),从文字描述生成声音效果,将音频分解为相声,乐器等来源,实时语音变化(Voice Changer),以及"故事工作室"(Story Studio)——在时间范围内多轨地集合音频场景. 对于开发者,API,SDK,和通过WebSocket的流出生成,都可以使用.

鱼声的优点

在一个平台上建立一套广泛的工具

Fish Audio结合了TTS,语音克隆,语音识别,声音效果生成,音频分离,故事工作室,和语音变换器. 这使得您可以处理大多数与声音有关的任务,而不在不同的服务间切换.

高速和自然

实时延迟还不到200ms,比许多竞争对手更快(ElevenLabs拥有300–400ms). 语音克隆从几秒钟的样本中工作,开源的"鱼语"技术经过了70万多小时的音频培训,确保了自然的声音. 免费计划让你不付费地测试一代人.

灵活的定制化和发展

情感和特殊标记对语音的发送给予精细的控制. 语音模型的创建通过网络界面和API支持,而SDKs和WebSocket流线套接字实时语音应用. API按实际使用方式计费,对于负载可变的项目来说方便.

鱼声的缺点

自由计划限制

免费计划仅供个人非商业性使用。 商业货币化需要付费的计划. 未使用的月配额不转至下个月。 不同的出处具体规定了不同的限制:从每月7分钟的生成到1小时,限制为每段500个字符或3分钟.

对来源材料质量的依赖

语音克隆的质量直接取决于原始录音和对语音的权利. 专业的音频制作仍然需要人工控制:编辑,正常化,选取,并检查文物. 该服务最适合快速草稿,原型和短格式.

区域和法律限制

一些地区可能需要一个虚拟网络。 此外,在克隆他人声音时,必须拥有原声录音的权利并征得个人同意. 如果违反规则,服务可删除内容或账户。

鱼声有什么问题?

内容语音

该平台适合视频配音(YouTube视频,广告),播客,音频(包括ACX/Audible格式),游戏,培训材料,以及角色视频. 使用情感标记,可以产生具有不同内涵的表达式合成声音.

创建语音代理和记录

Fish Audio让你用像人一样的入声来创建语音代理和聊天机,用扬声器和情感标记来将音频转换成文字. 互动解决方案可采用实时模式。

音频制作

该平台包括从文本描述中产生声音效果,将一出已存在的音轨分出为相声和乐器,以及编组"故事工作室"中的多轨音频项目(故事,场景). 语音变换器允许您实时为角色或其他目的改变自己的声音.

音频定价

免费计划

免费计划为个人非商业用途. 不同来源明确了不同的限制:最多7分的生成,每代500个字符,3个公共语音插槽,以及每月8000个入分——或每个月最多1小时的语音生成,每段可达3分钟. 免费计划不需要信用卡.

已付款计划

Fish Audio采用了Freemium模型. 已支付的计划包括:

  • ium (Plus):每月从9.99元到11元,每年计费——某些型号的无限生成,最长可达200分,有10个私人语音插槽,商业使用,API每月预付10元.
  • 赞成:每月从75元到99.99元——最多1,620分,3个座位,200万入分,参考音频增强,优先接入新模式.
  • 马克斯:每月749美元——最多6250分钟,10个座位,2500万入分.

API按实际使用量计价: TTS-每百万UTF-8字节15美元,ASR-每小时0.36美元音频. 具体计划价格可有变动;当期价格应在官方网站上检查.

鱼类音频的使用条款

登记和权利

使用Fish音频需要在网站上注册. 免费计划只允许用于个人非商业项目. 有偿计划提供商业用途。 用户对克隆语音的权利负责,必须征得语音所有人同意. 要复制别人的声音,你必须拥有原声录音的权利,并征得个人同意.

服务规则

如果违反使用规则,服务可以删除内容或账户。 有一个单独的附属方案,有申请程序,通过PayPal或Wise付款,以及伙伴支持。 未使用的月配额不转至下个月。

音频可用性

平台

Fish Audio作为网络服务(WEB)并通过API提供. 所支持的平台:Web,Android,iOS,Linux,Mac,Windows. 访问网页版本只需要浏览器,没有额外的软件安装. 为Android和iOS提供移动应用程序.

语文和区域

该平台支持俄语,并设有俄语接口. 用于语音生成的支持语言数量超过30个(有的资料来源指定了13个语言). 区域可用性是全球性的。 在大多数地区,这种服务并不需要VPN;在有些地区,可能需要VPN。

鱼声如何与替代品不同

与"十一实验室"相比

Fish Audio在生成速度上获胜(低于200 ms对11Labs300–400 ms),使用起来容易,在基本水平上更便宜. 然而,"十一实验室"提供了更多的情感环境. 在语音量(超过200万个)方面,"鱼音"超过了"11Lab".

与其他服务相比

与"Narakeet"不同,"Fish Audio"提供了更宽泛的工具,包括语音克隆,语音识别和音频编辑等. 与Speechify相比,Fish Audio支持较少的语言(30+对60+),但在克隆和生成速度上获胜. 为了清理完成的音频,Fish Audio可以和Auphoonic进行比较;然而,该平台提供了额外的合成和克隆功能. 其他提到的替代品包括:Google Text to-Speech,IBM Watson Text to Speak,Description,和微软Azure Speech.

结论

Fish Audio是一个多功能的AI平台,用于与声音合作,特别是在表达式语音合成和语音克隆方面很强. 多亏了对多种语言的支持,高生成速度,广泛的语音库,以及免费计划,服务套接字播客的创建,视频语音,音频书,游戏,聊天器,以及互动解决方案. 该平台最适合快速草稿,原型和短格式;然而,专业最终制作仍然需要人工控制. Fish Audio被推荐给内容创建者,应用程序开发者,以及不需要录音室的活生生的声音的小企业.

视频和广告
音频创建
游戏和动画的声音
语音助理和聊天员
教材和播客

定价

计划价格特征限制
免费免费个人非商业用途,3个公共语音插槽,每月8 000个信贷每代最多7分钟,每代500个字符,每个月最多1小时的语音生成,每个片段最多3分钟,未使用的月配额不会结转到下个月
Ium( Plus)每年计费从9.99美元到11美元某些型号的无限生成, 10个私人语音插槽, 商业用途, API, 每月预付10美元的信贷最多200分钟
赞成:每月75美元至99.99美元3个座位,200万信贷,参考音效增强,优先进入新模式最多1620分钟
马克斯每月749美元10个席位,2 500万信贷最长6250分钟

常问问题

类似的人工智能工具

另见

Fish Audio——审查语音合成和语音克隆神经网络