芝麻揭開病毒虛擬助手瑪雅背後的基礎AI模型

Sesame,這家創新的 AI 公司,推出了令人驚嘆的逼真語音助手 Maya,近日通過釋出驅動其功能的基礎模型掀起波瀾。該模型名為 CSM-1B,擁有 10 億個參數,這一術語指的是構成模型的各個組成部分。該模型以 Apache 2.0 許可證釋出,適用於商業用途且限制極少,如 AI 開發平台 Hugging Face 上所宣佈。
CSM-1B 通過將文字和音頻輸入轉換為「RVQ 音頻代碼」來運作。RVQ 代表「殞地向量量化」,這是一種將音頻轉換為離散符號或代碼的方法。此技術也被其他尖端 AI 音頻技術所採用,例如 Google 的 SoundStream 和 Meta 的 Encodec。CSM-1B 的核心利用了 Meta 的 Llama 家族模型,結合了一個音頻「解碼器」組件。Sesame 表示,經過微調的 CSM-1B 特殊版本為 Maya 的語音提供了動力。
Sesame 在其 Hugging Face 和 GitHub 儲存庫中將該模型描述為「基礎生成模型」,指出它設計用於生成多種聲音,但尚未針對任何特定聲音進行優化。由於訓練數據集中的「數據污染」,該模型具備一定程度的非英語語言處理能力,但其在此方面的表現可能不佳。有趣的是,Sesame 對訓練數據的細節保密,讓人好奇這個模型的構建過程。
一個引人注目的問題是缺乏強大的防護措施。Sesame 採用誠信制度,僅鼓勵使用者和開發者避免未經許可複製某人的聲音、製作假新聞等誤導性內容,或參與任何「有害」或「惡意」的活動。我親自測試了 Hugging Face 上的演示,僅一分鐘內就複製了我的聲音。生成關於任何主題的語音非常簡單,甚至包括選舉和俄羅斯宣傳等敏感話題。
《消費者報告》最近指出,許多 AI 驅動的語音複製工具缺乏「有意義的」防護措施,這可能導致潛在的詐騙或濫用。Sesame 由 Oculus 共同創辦人 Brendan Iribe 共同創立,在二月底以其幾乎擺脫恐怖谷效應的助手技術吸引了公眾的目光。Maya 和 Sesame 的另一個助手 Miles 展現出逼真的人類特徵,例如呼吸、語帶瑕疵,以及在講話中可被打斷,類似於 OpenAI 的語音模式。
在財務方面,Sesame 獲得了 Andreessen Horowitz、Spark Capital 和 Matrix Partners 等重量級投資者的未公開資金支持。除了語音助手外,該公司還在探索原型 AI 眼鏡,計劃全天佩戴並搭載其定制模型。這一舉動顯示了 Sesame 將 AI 技術進一步推向我們日常生活的雄心。
相關文章
華納音樂收購AI歸因初創公司Sureel AI
華納音樂集團(WMG)於週三確認,其正在收購Sureel AI,一家專注於人工智慧歸因的初創公司。Sureel的專有技術為音樂曲目生成“AI DNA”,將其分解為各個組成部分,以追蹤人工智慧模型如何利用這些元素。透過此次收購,WMG旨在增強其監控其藝術家和詞曲創作者的作品在人工智慧生成內容中被使用或用於訓練人工智慧模型的能力。“將Sureel整合到WMG中,增強了我們的保護、控制和變現能力,確保創意社羣保留對其智慧財產權、姓名、肖像、形象和聲音的控制權,”WMG執行長Robert Kync
亞馬遜推出“Alexa for Shopping”,同時將Rufus邊緣化
亞馬遜推出了“Alexa for Shopping”,將 Rufus 購物聊天機器人 Alexa+ 整合到應用程式、網站和 Echo Show 裝置中。該助手回答產品查詢、比較商品、跟蹤價格,並支援購物提醒。它還處理計劃中的購物操作和符合條件的自動購買。據該公司稱,“Alexa for Shopping”將 Rufus 的產品專業知識與 Alexa+ 的個性化助手上下文相結合。亞馬遜表示,Rufus 在 2025 年協助了超過 3 億客戶進行產品研究、比較和購買。GeekWire 報道稱,
微軟、Azure 與 AI 技術共同對抗加州野火風險
微軟投資於人工智慧驅動的野火偵測技術,其首席副總裁暨首席數據科學家胡安·拉維斯塔·費雷斯(Juan Lavista Ferres)針對減輕環境損害的策略進行了探討。根據美國國家航空暨太空總署(NASA)指出,氣候變遷影響地球上的每個人,其表現為氣溫上升、降雨模式改變以及海平面上升。NASA 指出,有確鑿證據顯示地球正以前所未有的速度變暖,而人類活動是主要驅動因素。隨著全球氣溫上升,野火構成的威脅日
相關專題推薦
評論 (8)
0/500
C'est incroyable ce que Sesame a fait avec Maya ! Un modèle à 1 milliard de paramètres, ça doit être une sacrée bête. Mais franchement, ça donne quoi en termes d'éthique ? On va tous finir avec des assistants trop parfaits ? 😅
Wow, Sesame's CSM-1B sounds like a game-changer! A billion parameters for Maya’s lifelike voice? That’s some serious tech flex. Curious how it stacks up against other models in real-world use. 😎
Whoa, a 1B parameter model powering Maya? That's some serious brainpower! Curious how Sesame's CSM-1B stacks up against other AI giants. Excited to see where this tech takes us! 🚀
Sesame's base AI model for Maya is mind-blowing! 1 billion parameters? That's insane! Maya's voice is so lifelike, it's like talking to a real person. But sometimes she gets a bit too chatty, which can be annoying. Still, a fantastic piece of tech! 🤯
¡El modelo base de IA de Sesame para Maya es alucinante! ¿1 billón de parámetros? ¡Eso es una locura! La voz de Maya es tan realista, parece que estoy hablando con una persona real. Pero a veces se pone un poco parlanchina, lo que puede ser molesto. Aún así, una tecnología fantástica! 🤯
Das Basis-AI-Modell von Sesame für Maya ist umwerfend! 1 Milliarde Parameter? Das ist verrückt! Mayas Stimme ist so lebensecht, es fühlt sich an, als würde man mit einer echten Person sprechen. Aber manchmal wird sie ein bisschen zu gesprächig, was nervig sein kann. Trotzdem, eine fantastische Technologie! 🤯

Sesame,這家創新的 AI 公司,推出了令人驚嘆的逼真語音助手 Maya,近日通過釋出驅動其功能的基礎模型掀起波瀾。該模型名為 CSM-1B,擁有 10 億個參數,這一術語指的是構成模型的各個組成部分。該模型以 Apache 2.0 許可證釋出,適用於商業用途且限制極少,如 AI 開發平台 Hugging Face 上所宣佈。
CSM-1B 通過將文字和音頻輸入轉換為「RVQ 音頻代碼」來運作。RVQ 代表「殞地向量量化」,這是一種將音頻轉換為離散符號或代碼的方法。此技術也被其他尖端 AI 音頻技術所採用,例如 Google 的 SoundStream 和 Meta 的 Encodec。CSM-1B 的核心利用了 Meta 的 Llama 家族模型,結合了一個音頻「解碼器」組件。Sesame 表示,經過微調的 CSM-1B 特殊版本為 Maya 的語音提供了動力。
Sesame 在其 Hugging Face 和 GitHub 儲存庫中將該模型描述為「基礎生成模型」,指出它設計用於生成多種聲音,但尚未針對任何特定聲音進行優化。由於訓練數據集中的「數據污染」,該模型具備一定程度的非英語語言處理能力,但其在此方面的表現可能不佳。有趣的是,Sesame 對訓練數據的細節保密,讓人好奇這個模型的構建過程。
一個引人注目的問題是缺乏強大的防護措施。Sesame 採用誠信制度,僅鼓勵使用者和開發者避免未經許可複製某人的聲音、製作假新聞等誤導性內容,或參與任何「有害」或「惡意」的活動。我親自測試了 Hugging Face 上的演示,僅一分鐘內就複製了我的聲音。生成關於任何主題的語音非常簡單,甚至包括選舉和俄羅斯宣傳等敏感話題。
《消費者報告》最近指出,許多 AI 驅動的語音複製工具缺乏「有意義的」防護措施,這可能導致潛在的詐騙或濫用。Sesame 由 Oculus 共同創辦人 Brendan Iribe 共同創立,在二月底以其幾乎擺脫恐怖谷效應的助手技術吸引了公眾的目光。Maya 和 Sesame 的另一個助手 Miles 展現出逼真的人類特徵,例如呼吸、語帶瑕疵,以及在講話中可被打斷,類似於 OpenAI 的語音模式。
在財務方面,Sesame 獲得了 Andreessen Horowitz、Spark Capital 和 Matrix Partners 等重量級投資者的未公開資金支持。除了語音助手外,該公司還在探索原型 AI 眼鏡,計劃全天佩戴並搭載其定制模型。這一舉動顯示了 Sesame 將 AI 技術進一步推向我們日常生活的雄心。
華納音樂收購AI歸因初創公司Sureel AI
華納音樂集團(WMG)於週三確認,其正在收購Sureel AI,一家專注於人工智慧歸因的初創公司。Sureel的專有技術為音樂曲目生成“AI DNA”,將其分解為各個組成部分,以追蹤人工智慧模型如何利用這些元素。透過此次收購,WMG旨在增強其監控其藝術家和詞曲創作者的作品在人工智慧生成內容中被使用或用於訓練人工智慧模型的能力。“將Sureel整合到WMG中,增強了我們的保護、控制和變現能力,確保創意社羣保留對其智慧財產權、姓名、肖像、形象和聲音的控制權,”WMG執行長Robert Kync
微軟、Azure 與 AI 技術共同對抗加州野火風險
微軟投資於人工智慧驅動的野火偵測技術,其首席副總裁暨首席數據科學家胡安·拉維斯塔·費雷斯(Juan Lavista Ferres)針對減輕環境損害的策略進行了探討。根據美國國家航空暨太空總署(NASA)指出,氣候變遷影響地球上的每個人,其表現為氣溫上升、降雨模式改變以及海平面上升。NASA 指出,有確鑿證據顯示地球正以前所未有的速度變暖,而人類活動是主要驅動因素。隨著全球氣溫上升,野火構成的威脅日
C'est incroyable ce que Sesame a fait avec Maya ! Un modèle à 1 milliard de paramètres, ça doit être une sacrée bête. Mais franchement, ça donne quoi en termes d'éthique ? On va tous finir avec des assistants trop parfaits ? 😅
Wow, Sesame's CSM-1B sounds like a game-changer! A billion parameters for Maya’s lifelike voice? That’s some serious tech flex. Curious how it stacks up against other models in real-world use. 😎
Whoa, a 1B parameter model powering Maya? That's some serious brainpower! Curious how Sesame's CSM-1B stacks up against other AI giants. Excited to see where this tech takes us! 🚀
Sesame's base AI model for Maya is mind-blowing! 1 billion parameters? That's insane! Maya's voice is so lifelike, it's like talking to a real person. But sometimes she gets a bit too chatty, which can be annoying. Still, a fantastic piece of tech! 🤯
¡El modelo base de IA de Sesame para Maya es alucinante! ¿1 billón de parámetros? ¡Eso es una locura! La voz de Maya es tan realista, parece que estoy hablando con una persona real. Pero a veces se pone un poco parlanchina, lo que puede ser molesto. Aún así, una tecnología fantástica! 🤯
Das Basis-AI-Modell von Sesame für Maya ist umwerfend! 1 Milliarde Parameter? Das ist verrückt! Mayas Stimme ist so lebensecht, es fühlt sich an, als würde man mit einer echten Person sprechen. Aber manchmal wird sie ein bisschen zu gesprächig, was nervig sein kann. Trotzdem, eine fantastische Technologie! 🤯





首頁






