참깨는 바이러스 성 가상 어시스턴트 Maya의 기본 AI 모델을 공개합니다.

Sesame, 혁신적인 AI 회사로, 놀랍도록 생생한 음성 비서 Maya를 개발했으며, 최근 그녀의 기능을 구동하는 기본 모델을 공개해 화제를 모았다. CSM-1B로 명명된 이 모델은 10억 개의 파라미터를 자랑하며, 이는 모델을 구성하는 개별 요소를 의미한다. Apache 2.0 라이선스 하에 공개되어 AI 개발 플랫폼 Hugging Face에서 발표된 바와 같이 상업적 사용에 최소한의 제약이 있다.
CSM-1B는 텍스트와 오디오 입력을 "RVQ 오디오 코드"로 변환하여 작동한다. RVQ는 "잔여 벡터 양자화"를 의미하며, 오디오를 이산 토큰 또는 코드로 변환하는 방법이다. 이 기술은 Google의 SoundStream 및 Meta의 Encodec과 같은 최첨단 AI 오디오 기술에서도 사용된다. 핵심적으로 CSM-1B는 Meta의 Llama 패밀리 모델과 오디오 "디코더" 컴포넌트를 결합한다. Sesame에 따르면, CSM-1B의 특화된 버전이 파인튜닝 후 Maya의 음성을 구동한다.
Hugging Face와 GitHub 저장소에서 이 모델을 "기본 생성 모델"로 설명하며, Sesame는 다양한 음성을 생성하도록 설계되었지만 특정 음성에 대해 정제되지 않았다고 밝혔다. 훈련 데이터의 "데이터 오염" 덕분에 비영어 언어를 어느 정도 처리할 수 있지만, 이 분야에서의 성능은 아마도 미흡할 것이다. 흥미롭게도 Sesame는 훈련 데이터의 세부 사항을 비공개로 유지해 이 모델 구축에 어떤 요소가 포함되었는지 궁금증을 남긴다.
눈썹을 치켜세우는 한 가지 측면은 강력한 안전 장치의 부재다. Sesame는 명예 시스템에 따라 운영되며, 사용자와 개발자에게 모델을 사용해 허가 없이 누군가의 음성을 복제하거나, 가짜 뉴스와 같은 오해를 불러일으키는 콘텐츠를 생성하거나, "해로운" 또는 "악의적인" 활동에 참여하지 말 것을 간단히 권장한다. 나는 Hugging Face의 데모를 직접 테스트했으며, 1분 만에 내 음성을 복제했다. 선거나 러시아 선전과 같은 민감한 주제에 대한 음성을 생성하는 것도 매우 쉬웠다.
Consumer Reports는 최근 많은 AI 기반 음성 복제 도구에 "의미 있는" 안전 장치가 부족해 잠재적인 사기나 남용으로 이어질 수 있다고 강조했다. Oculus 공동 창립자 Brendan Iribe가 공동 설립한 Sesame는 2월 말, 거의 언캐니 밸리를 벗어나는 비서 기술로 대중의 주목을 끌었다. Maya와 Sesame의 다른 비서 Miles는 숨을 쉬거나, 말할 때 불완전성을 보이며, 중간에 말을 끊을 수 있는 등 OpenAI의 Voice Mode와 유사한 현실적인 인간적 특성을 보여준다.
재정적으로 Sesame는 Andreessen Horowitz, Spark Capital, Matrix Partners와 같은 거물들로부터 비공개 자금을 확보했다. 음성 비서 외에도, 이 회사는 하루 종일 착용 가능한 AI 안경 프로토타입 제작에 도전하고 있으며, 이는 그들의 커스텀 모델로 구동된다. 이 움직임은 Sesame가 AI 기술을 우리 일상생활에 더욱 깊이 밀어 넣으려는 야심을 보여준다.
관련 기사
워너 뮤직이 AI 귀속 스타트업 서룰 AI를 인수하다
워너 뮤직 그룹(WMG)은 수요일 Sureel AI라는 인공지능 속성 추적 스타트업을 인수한다고 확인했다. Sureel의 독점 기술은 음악 트랙에 대한 ‘AI DNA’를 생성하며, 이를 구성 요소로 분해하여 AI 모델이 이러한 요소를 어떻게 활용하는지 추적한다.이번 인수를 통해 WMG는 아티스트와 작곡가의 작품이 AI 생성 콘텐츠에서 어떻게 활용되거나 AI 모델 학습에 사용되는지를 모니터링하는 능력을 강화할 계획이다.“Sureel을 WMG에
아마존은 쇼핑용 알렉사를 출시하면서 루푸스를 후순위로 밀어붙이고 있다
아마존은 Alexa for Shopping을 출시하며, Rufus 쇼핑 챗봇과 Alexa+를 앱, 웹사이트 및 Echo Show 기기 전반에 걸쳐 통합했습니다.이 도우미는 제품 문의에 답변하고, 상품을 비교하며, 가격을 추적하고, 쇼핑 알림을 지원합니다. 또한 예약된 쇼핑 작업과 자격이 있는 자동 구매도 처리합니다.회사에 따르면, Alexa for Shopping은 Rufus의 제품 전문성과 Alexa+의 개인화된 도우미 컨텍스트를 결합합니
마이크로소프트, 애저, AI 기술이 캘리포니아 산불 위험에 맞서다
마이크로소프트는 AI 기반 산불 탐지 기술에 투자하고 있으며, CVP 겸 수석 데이터 과학자인 후안 라비스타 페레스가 환경 피해 완화 전략을 논의하고 있다.NASA에 따르면, 기후 변화는 지구상의 모든 사람에게 영향을 미치며, 기온 상승, 강수 패턴의 변화, 해수면 상승 등의 형태로 나타납니다.NASA는 인간 활동이 주된 원인으로 작용하여 지구가 전례 없는
관련 특별 주제 추천
의견 (8)
0/500
C'est incroyable ce que Sesame a fait avec Maya ! Un modèle à 1 milliard de paramètres, ça doit être une sacrée bête. Mais franchement, ça donne quoi en termes d'éthique ? On va tous finir avec des assistants trop parfaits ? 😅
Wow, Sesame's CSM-1B sounds like a game-changer! A billion parameters for Maya’s lifelike voice? That’s some serious tech flex. Curious how it stacks up against other models in real-world use. 😎
Whoa, a 1B parameter model powering Maya? That's some serious brainpower! Curious how Sesame's CSM-1B stacks up against other AI giants. Excited to see where this tech takes us! 🚀
Sesame's base AI model for Maya is mind-blowing! 1 billion parameters? That's insane! Maya's voice is so lifelike, it's like talking to a real person. But sometimes she gets a bit too chatty, which can be annoying. Still, a fantastic piece of tech! 🤯
¡El modelo base de IA de Sesame para Maya es alucinante! ¿1 billón de parámetros? ¡Eso es una locura! La voz de Maya es tan realista, parece que estoy hablando con una persona real. Pero a veces se pone un poco parlanchina, lo que puede ser molesto. Aún así, una tecnología fantástica! 🤯
Das Basis-AI-Modell von Sesame für Maya ist umwerfend! 1 Milliarde Parameter? Das ist verrückt! Mayas Stimme ist so lebensecht, es fühlt sich an, als würde man mit einer echten Person sprechen. Aber manchmal wird sie ein bisschen zu gesprächig, was nervig sein kann. Trotzdem, eine fantastische Technologie! 🤯

Sesame, 혁신적인 AI 회사로, 놀랍도록 생생한 음성 비서 Maya를 개발했으며, 최근 그녀의 기능을 구동하는 기본 모델을 공개해 화제를 모았다. CSM-1B로 명명된 이 모델은 10억 개의 파라미터를 자랑하며, 이는 모델을 구성하는 개별 요소를 의미한다. Apache 2.0 라이선스 하에 공개되어 AI 개발 플랫폼 Hugging Face에서 발표된 바와 같이 상업적 사용에 최소한의 제약이 있다.
CSM-1B는 텍스트와 오디오 입력을 "RVQ 오디오 코드"로 변환하여 작동한다. RVQ는 "잔여 벡터 양자화"를 의미하며, 오디오를 이산 토큰 또는 코드로 변환하는 방법이다. 이 기술은 Google의 SoundStream 및 Meta의 Encodec과 같은 최첨단 AI 오디오 기술에서도 사용된다. 핵심적으로 CSM-1B는 Meta의 Llama 패밀리 모델과 오디오 "디코더" 컴포넌트를 결합한다. Sesame에 따르면, CSM-1B의 특화된 버전이 파인튜닝 후 Maya의 음성을 구동한다.
Hugging Face와 GitHub 저장소에서 이 모델을 "기본 생성 모델"로 설명하며, Sesame는 다양한 음성을 생성하도록 설계되었지만 특정 음성에 대해 정제되지 않았다고 밝혔다. 훈련 데이터의 "데이터 오염" 덕분에 비영어 언어를 어느 정도 처리할 수 있지만, 이 분야에서의 성능은 아마도 미흡할 것이다. 흥미롭게도 Sesame는 훈련 데이터의 세부 사항을 비공개로 유지해 이 모델 구축에 어떤 요소가 포함되었는지 궁금증을 남긴다.
눈썹을 치켜세우는 한 가지 측면은 강력한 안전 장치의 부재다. Sesame는 명예 시스템에 따라 운영되며, 사용자와 개발자에게 모델을 사용해 허가 없이 누군가의 음성을 복제하거나, 가짜 뉴스와 같은 오해를 불러일으키는 콘텐츠를 생성하거나, "해로운" 또는 "악의적인" 활동에 참여하지 말 것을 간단히 권장한다. 나는 Hugging Face의 데모를 직접 테스트했으며, 1분 만에 내 음성을 복제했다. 선거나 러시아 선전과 같은 민감한 주제에 대한 음성을 생성하는 것도 매우 쉬웠다.
Consumer Reports는 최근 많은 AI 기반 음성 복제 도구에 "의미 있는" 안전 장치가 부족해 잠재적인 사기나 남용으로 이어질 수 있다고 강조했다. Oculus 공동 창립자 Brendan Iribe가 공동 설립한 Sesame는 2월 말, 거의 언캐니 밸리를 벗어나는 비서 기술로 대중의 주목을 끌었다. Maya와 Sesame의 다른 비서 Miles는 숨을 쉬거나, 말할 때 불완전성을 보이며, 중간에 말을 끊을 수 있는 등 OpenAI의 Voice Mode와 유사한 현실적인 인간적 특성을 보여준다.
재정적으로 Sesame는 Andreessen Horowitz, Spark Capital, Matrix Partners와 같은 거물들로부터 비공개 자금을 확보했다. 음성 비서 외에도, 이 회사는 하루 종일 착용 가능한 AI 안경 프로토타입 제작에 도전하고 있으며, 이는 그들의 커스텀 모델로 구동된다. 이 움직임은 Sesame가 AI 기술을 우리 일상생활에 더욱 깊이 밀어 넣으려는 야심을 보여준다.
워너 뮤직이 AI 귀속 스타트업 서룰 AI를 인수하다
워너 뮤직 그룹(WMG)은 수요일 Sureel AI라는 인공지능 속성 추적 스타트업을 인수한다고 확인했다. Sureel의 독점 기술은 음악 트랙에 대한 ‘AI DNA’를 생성하며, 이를 구성 요소로 분해하여 AI 모델이 이러한 요소를 어떻게 활용하는지 추적한다.이번 인수를 통해 WMG는 아티스트와 작곡가의 작품이 AI 생성 콘텐츠에서 어떻게 활용되거나 AI 모델 학습에 사용되는지를 모니터링하는 능력을 강화할 계획이다.“Sureel을 WMG에
마이크로소프트, 애저, AI 기술이 캘리포니아 산불 위험에 맞서다
마이크로소프트는 AI 기반 산불 탐지 기술에 투자하고 있으며, CVP 겸 수석 데이터 과학자인 후안 라비스타 페레스가 환경 피해 완화 전략을 논의하고 있다.NASA에 따르면, 기후 변화는 지구상의 모든 사람에게 영향을 미치며, 기온 상승, 강수 패턴의 변화, 해수면 상승 등의 형태로 나타납니다.NASA는 인간 활동이 주된 원인으로 작용하여 지구가 전례 없는
C'est incroyable ce que Sesame a fait avec Maya ! Un modèle à 1 milliard de paramètres, ça doit être une sacrée bête. Mais franchement, ça donne quoi en termes d'éthique ? On va tous finir avec des assistants trop parfaits ? 😅
Wow, Sesame's CSM-1B sounds like a game-changer! A billion parameters for Maya’s lifelike voice? That’s some serious tech flex. Curious how it stacks up against other models in real-world use. 😎
Whoa, a 1B parameter model powering Maya? That's some serious brainpower! Curious how Sesame's CSM-1B stacks up against other AI giants. Excited to see where this tech takes us! 🚀
Sesame's base AI model for Maya is mind-blowing! 1 billion parameters? That's insane! Maya's voice is so lifelike, it's like talking to a real person. But sometimes she gets a bit too chatty, which can be annoying. Still, a fantastic piece of tech! 🤯
¡El modelo base de IA de Sesame para Maya es alucinante! ¿1 billón de parámetros? ¡Eso es una locura! La voz de Maya es tan realista, parece que estoy hablando con una persona real. Pero a veces se pone un poco parlanchina, lo que puede ser molesto. Aún así, una tecnología fantástica! 🤯
Das Basis-AI-Modell von Sesame für Maya ist umwerfend! 1 Milliarde Parameter? Das ist verrückt! Mayas Stimme ist so lebensecht, es fühlt sich an, als würde man mit einer echten Person sprechen. Aber manchmal wird sie ein bisschen zu gesprächig, was nervig sein kann. Trotzdem, eine fantastische Technologie! 🤯





집






