Fish Audio 推出 S2:开源模型实现词级情感控制

Fish Audio 已正式推出其全新的文本转语音模型 S2,这标志着开源 TTS 技术在表现力和可控性方面取得了重大飞跃。
这款名为 Fish Audio S2 的模型重点强化了情感控制能力。用户可通过自然语言指令对语调和情感进行精细调整。无论是插入 [laugh]、[whisper] 或 [super happy] 等标签,还是使用 [专业播音语气] 或 [提高音调] 等自由描述,该模型都能实现精准的单词级控制,从而生成极具表现力且自然生动的语音。
主要特点包括:
完全开源:模型权重、微调代码以及基于 SGLang 的流式推理引擎均已在 GitHub 和 Hugging Face 上公开发布。 S2-Pro 是旗舰版本,拥有约 44 亿个参数。超低延迟:推理延迟低于 150 毫秒,非常适合聊天机器人和虚拟主播等实时应用。原生多说话人支持:它可以在单次推理中处理多个说话人,处理对话轮次、插话和自然的情感表达,同时保持一致的语音质量,无需额外处理。Fish Audio 表示,S2 基于涵盖近 50 种语言的约 1000 万小时音频数据进行训练。通过利用强化学习对齐和双自回归架构,它在多个基准测试中展现出领先的自然度和表现力。它被认为是目前最富情感智能的 TTS 系统之一,无论开源还是专有。"真正的语言自由从现在开始,"Fish Audio 宣布,标志着具有真实情感和个性的 AI 语音时代的到来。
GitHub:https://github.com/fishaudio/fish-speech/
HuggingFace:https://huggingface.co/fishaudio/s2-pro/
相关文章
苹果智能眼镜或将在WWDC27上首次亮相,重点突出隐私保护
彭博社的马克·古尔曼报道,苹果智能眼镜(内部代号 N50)计划于 2027 年 6 月的全球开发者大会(WWDC27)上首次亮相,零售版预计将于 2027 年秋季上市。该设备原定于今年晚些时候及 2027 年初发布,但现已推迟,以便进行进一步的产品完善并加强隐私保护协议。隐私仍是苹果智能眼镜战略的核心支柱。从 Meta 等竞争对手的隐私争议中吸取教训,苹果正在实施强有力的功能与政策。目前考虑的方案包括:完全移除摄像头,专注于人工智能交互、音频播放和通话;或保留摄像头但禁用照片和视频录制功能,仅
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
相关专题推荐
评论 (0)
0/500

Fish Audio 已正式推出其全新的文本转语音模型 S2,这标志着开源 TTS 技术在表现力和可控性方面取得了重大飞跃。
这款名为 Fish Audio S2 的模型重点强化了情感控制能力。用户可通过自然语言指令对语调和情感进行精细调整。无论是插入 [laugh]、[whisper] 或 [super happy] 等标签,还是使用 [专业播音语气] 或 [提高音调] 等自由描述,该模型都能实现精准的单词级控制,从而生成极具表现力且自然生动的语音。
主要特点包括:
完全开源:模型权重、微调代码以及基于 SGLang 的流式推理引擎均已在 GitHub 和 Hugging Face 上公开发布。 S2-Pro 是旗舰版本,拥有约 44 亿个参数。超低延迟:推理延迟低于 150 毫秒,非常适合聊天机器人和虚拟主播等实时应用。原生多说话人支持:它可以在单次推理中处理多个说话人,处理对话轮次、插话和自然的情感表达,同时保持一致的语音质量,无需额外处理。Fish Audio 表示,S2 基于涵盖近 50 种语言的约 1000 万小时音频数据进行训练。通过利用强化学习对齐和双自回归架构,它在多个基准测试中展现出领先的自然度和表现力。它被认为是目前最富情感智能的 TTS 系统之一,无论开源还是专有。"真正的语言自由从现在开始,"Fish Audio 宣布,标志着具有真实情感和个性的 AI 语音时代的到来。
GitHub:https://github.com/fishaudio/fish-speech/
HuggingFace:https://huggingface.co/fishaudio/s2-pro/
苹果智能眼镜或将在WWDC27上首次亮相,重点突出隐私保护
彭博社的马克·古尔曼报道,苹果智能眼镜(内部代号 N50)计划于 2027 年 6 月的全球开发者大会(WWDC27)上首次亮相,零售版预计将于 2027 年秋季上市。该设备原定于今年晚些时候及 2027 年初发布,但现已推迟,以便进行进一步的产品完善并加强隐私保护协议。隐私仍是苹果智能眼镜战略的核心支柱。从 Meta 等竞争对手的隐私争议中吸取教训,苹果正在实施强有力的功能与政策。目前考虑的方案包括:完全移除摄像头,专注于人工智能交互、音频播放和通话;或保留摄像头但禁用照片和视频录制功能,仅
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业





首页






