피쉬 오디오, S2 출시: 오픈소스 모델로 단어 단위의 감정 제어 구현

Fish Audio는 오픈소스 TTS 기술의 표현력과 제어 능력 면에서 획기적인 발전을 이룬 새로운 텍스트 음성 변환(TTS) 모델 ‘S2’를 공식 출시했습니다.
'Fish Audio S2'로 명명된 이 모델은 강력한 감정 제어 기능을 최우선으로 합니다. 사용자는 자연어 명령을 통해 억양과 감정을 세밀하게 조정할 수 있습니다. [laugh], [whisper], [super happy]와 같은 태그를 삽입하거나, [전문 방송 톤]이나 [음높이 올리기]와 같은 자유 형식의 설명을 사용함으로써, 단어 단위의 정밀한 제어가 가능해져 표현력이 뛰어나고 자연스럽고 생생한 음성을 생성할 수 있습니다.
주요 기능은 다음과 같습니다:
완전한 오픈 소스: 모델 가중치, 미세 조정 코드, SGLang 기반의 스트리밍 추론 엔진이 모두 GitHub와 Hugging Face에서 공개되어 있습니다. S2-Pro는 약 44억 개의 파라미터를 갖춘 플래그십 버전입니다. 초저지연: 추론 지연 시간이 150밀리초 미만으로, 챗봇이나 가상 스트리머와 같은 실시간 애플리케이션에 이상적입니다. 네이티브 다중 화자 지원: 단일 추론으로 여러 화자의 음성을 처리할 수 있으며, 추가 처리 없이도 일관된 음질을 유지하면서 대화 순서, 중간 끼어들기, 자연스러운 감정 전달을 처리합니다.Fish Audio에 따르면 S2는 약 50개 언어로 구성된 1,000만 시간 분량의 오디오 데이터로 훈련되었습니다. 강화 학습 정렬 및 이중 자기회귀 아키텍처를 활용하여 여러 벤치마크에서 최고의 자연스러움과 표현력을 보여줍니다. 이 모델은 오픈소스 또는 상용 모델을 막론하고 현재 이용 가능한 TTS 시스템 중 가장 높은 감정 지능을 갖춘 시스템 중 하나로 평가받고 있습니다. Fish Audio는 "진정한 언어적 자유가 지금부터 시작된다"고 발표하며, 진정한 감정과 개성을 지닌 AI 음성 기술의 도래를 알렸습니다.
GitHub:https://github.com/fishaudio/fish-speech/
HuggingFace:https://huggingface.co/fishaudio/s2-pro/
관련 기사
전 OpenAI 수석 과학자 일리아의 SSI가 첫 모델을 공개하다
AI는 또 다른 주요 이정표를 달성했습니다. 오픈AI를 떠난 전 수석 과학자 일야 수트케버는 세이프 슈퍼인텔리전스 인크.(SSI)를 설립했으며, 이 회사는 최근 첫 번째 모델에 대한 세부 사항을 공개했습니다. 해외 소셜 미디어의 보도에 따르면, 이 팀은 안전한 슈퍼인텔리전스 추구를 위한 중요한 진전인 TTT(테스트 중 학습)를 활용한 컴팩트한 추론 엔진을 개발하고 있습니다.이 새로운 아키텍처는 모델이 '학습 방법을 학습'할 수 있도록 하는 데
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026년 5월 14일, AI 애플리케이션 개발 플랫폼 라블러블(Lovable)은 덴마크 하드웨어 스타트업 Atech의 80만 달러 시드 투자 라운드 참여를 발표했습니다. 라블러블이 주도한 이번 투자에는 a16z 스카우트 펀드, 시에리야 스카우트 펀드, 노르딕 메이커스(Nordic Makers) 등 최상위 벤처캐피탈 기업들이 참여했습니다. 이번 투자는 라블러블이 순수 소프트웨어 개발을 넘어 하드웨어 엔지니어링 영역으로 '바이브 코딩(Vibe C
Anthropic, 클로드 AI 코딩 도구를 일본으로 확장하여 해외 성장 추진
미국의 대표적인 인공지능 기업인 앤트로픽(Anthropic)이 글로벌 마케팅을 강화하고 있다. 수요일, 이 회사는 도쿄에서 약 500명의 소프트웨어 엔지니어가 참석한 대규모 개발자 행사인 '클로드로 코딩(Code with Claude)'을 개최했다. 이번 행사는 자율적 코딩 기능의 핵심 이점을 강조하며, 클로도 AI 도구와 관련 제품을 일본 시장에 적극적으로 도입하여 기업의 생산성을 높이는 것을 목표로 한다.자동 코드 생성 강조행사 동안 앤
관련 특별 주제 추천
의견 (0)
0/500

Fish Audio는 오픈소스 TTS 기술의 표현력과 제어 능력 면에서 획기적인 발전을 이룬 새로운 텍스트 음성 변환(TTS) 모델 ‘S2’를 공식 출시했습니다.
'Fish Audio S2'로 명명된 이 모델은 강력한 감정 제어 기능을 최우선으로 합니다. 사용자는 자연어 명령을 통해 억양과 감정을 세밀하게 조정할 수 있습니다. [laugh], [whisper], [super happy]와 같은 태그를 삽입하거나, [전문 방송 톤]이나 [음높이 올리기]와 같은 자유 형식의 설명을 사용함으로써, 단어 단위의 정밀한 제어가 가능해져 표현력이 뛰어나고 자연스럽고 생생한 음성을 생성할 수 있습니다.
주요 기능은 다음과 같습니다:
완전한 오픈 소스: 모델 가중치, 미세 조정 코드, SGLang 기반의 스트리밍 추론 엔진이 모두 GitHub와 Hugging Face에서 공개되어 있습니다. S2-Pro는 약 44억 개의 파라미터를 갖춘 플래그십 버전입니다. 초저지연: 추론 지연 시간이 150밀리초 미만으로, 챗봇이나 가상 스트리머와 같은 실시간 애플리케이션에 이상적입니다. 네이티브 다중 화자 지원: 단일 추론으로 여러 화자의 음성을 처리할 수 있으며, 추가 처리 없이도 일관된 음질을 유지하면서 대화 순서, 중간 끼어들기, 자연스러운 감정 전달을 처리합니다.Fish Audio에 따르면 S2는 약 50개 언어로 구성된 1,000만 시간 분량의 오디오 데이터로 훈련되었습니다. 강화 학습 정렬 및 이중 자기회귀 아키텍처를 활용하여 여러 벤치마크에서 최고의 자연스러움과 표현력을 보여줍니다. 이 모델은 오픈소스 또는 상용 모델을 막론하고 현재 이용 가능한 TTS 시스템 중 가장 높은 감정 지능을 갖춘 시스템 중 하나로 평가받고 있습니다. Fish Audio는 "진정한 언어적 자유가 지금부터 시작된다"고 발표하며, 진정한 감정과 개성을 지닌 AI 음성 기술의 도래를 알렸습니다.
GitHub:https://github.com/fishaudio/fish-speech/
HuggingFace:https://huggingface.co/fishaudio/s2-pro/
전 OpenAI 수석 과학자 일리아의 SSI가 첫 모델을 공개하다
AI는 또 다른 주요 이정표를 달성했습니다. 오픈AI를 떠난 전 수석 과학자 일야 수트케버는 세이프 슈퍼인텔리전스 인크.(SSI)를 설립했으며, 이 회사는 최근 첫 번째 모델에 대한 세부 사항을 공개했습니다. 해외 소셜 미디어의 보도에 따르면, 이 팀은 안전한 슈퍼인텔리전스 추구를 위한 중요한 진전인 TTT(테스트 중 학습)를 활용한 컴팩트한 추론 엔진을 개발하고 있습니다.이 새로운 아키텍처는 모델이 '학습 방법을 학습'할 수 있도록 하는 데
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026년 5월 14일, AI 애플리케이션 개발 플랫폼 라블러블(Lovable)은 덴마크 하드웨어 스타트업 Atech의 80만 달러 시드 투자 라운드 참여를 발표했습니다. 라블러블이 주도한 이번 투자에는 a16z 스카우트 펀드, 시에리야 스카우트 펀드, 노르딕 메이커스(Nordic Makers) 등 최상위 벤처캐피탈 기업들이 참여했습니다. 이번 투자는 라블러블이 순수 소프트웨어 개발을 넘어 하드웨어 엔지니어링 영역으로 '바이브 코딩(Vibe C
Anthropic, 클로드 AI 코딩 도구를 일본으로 확장하여 해외 성장 추진
미국의 대표적인 인공지능 기업인 앤트로픽(Anthropic)이 글로벌 마케팅을 강화하고 있다. 수요일, 이 회사는 도쿄에서 약 500명의 소프트웨어 엔지니어가 참석한 대규모 개발자 행사인 '클로드로 코딩(Code with Claude)'을 개최했다. 이번 행사는 자율적 코딩 기능의 핵심 이점을 강조하며, 클로도 AI 도구와 관련 제품을 일본 시장에 적극적으로 도입하여 기업의 생산성을 높이는 것을 목표로 한다.자동 코드 생성 강조행사 동안 앤





집






