芝麻揭开病毒虚拟助手玛雅背后的基础AI模型

Sesame,这家创新的AI公司,推出了令人惊叹的逼真语音助手Maya,刚刚通过发布驱动其功能的基模型掀起了波澜。该模型被称为CSM-1B,拥有10亿个参数,这一术语指的是构成模型的各个组件。该模型在Apache 2.0许可证下发布,可用于商业用途,几乎没有限制,正如在AI开发平台Hugging Face上宣布的那样。
CSM-1B通过将文本和音频输入转换为“RVQ音频代码”来运作。RVQ代表“残差向量量化”,这是一种将音频转化为离散标记或代码的方法。该技术也被其他尖端AI音频技术所使用,如Google的SoundStream和Meta的Encodec。CSM-1B的核心利用了Meta的Llama家族中的一个模型,结合了一个音频“解码器”组件。据Sesame称,经过微调的CSM-1B专用版本为Maya的语音提供动力。
Sesame在其Hugging Face和GitHub仓库中将该模型描述为“基础生成模型”,指出它设计用于生成多种语音,但尚未针对任何特定语音进行优化。由于训练集中存在“数据污染”,它在一定程度上能够处理非英语语言,但在这方面的表现可能不佳。有趣的是,Sesame对训练数据的细节保密,让我们对构建该模型的过程感到好奇。
一个引人注目的方面是缺乏强大的防护措施。Sesame采用诚信系统,仅鼓励用户和开发者避免未经许可复制某人的语音、制作虚假新闻等误导性内容,或参与任何“有害”或“恶意”活动。我亲自在Hugging Face上测试了演示版,不到一分钟就克隆了我的声音。生成关于任何话题的语音都非常轻松,甚至包括选举和俄罗斯宣传等敏感话题。
《消费者报告》最近强调了许多AI驱动的语音克隆工具缺乏“有意义的”防护措施,这可能导致潜在的欺诈或滥用。Sesame由Oculus联合创始人Brendan Iribe共同创立,在二月底凭借其几乎摆脱了恐怖谷效应的助手技术吸引了公众的注意。Maya和Sesame的另一个助手Miles展现出逼真的人类特征,如呼吸、带有口语瑕疵的讲话,以及可在讲话中被打断,类似于OpenAI的语音模式。
在财务方面,Sesame从Andreessen Horowitz、Spark Capital和Matrix Partners等重量级投资者那里获得了未公开的资金。除了语音助手,Sesame还着手开发AI眼镜原型,计划全天佩戴,配备其定制模型。这一举措显示了Sesame将AI技术进一步推向我们日常生活的雄心。
相关文章
华纳音乐收购AI归因初创公司Sureel AI
华纳音乐集团(WMG)于周三确认,其正在收购Sureel AI,一家专注于人工智能归因的初创公司。Sureel的专有技术为音乐曲目生成“AI DNA”,将其分解为各个组成部分,以追踪人工智能模型如何利用这些元素。通过此次收购,WMG旨在增强其监控其艺术家和词曲创作者的作品在人工智能生成内容中被使用或用于训练人工智能模型的能力。“将Sureel整合到WMG中,增强了我们的保护、控制和变现能力,确保创意社区保留对其知识产权、姓名、肖像、形象和声音的控制权,”WMG首席执行官Robert Kync
亚马逊推出“Alexa for Shopping”,同时将Rufus边缘化
亚马逊推出了“Alexa for Shopping”,将 Rufus 购物聊天机器人 Alexa+ 整合到应用程序、网站和 Echo Show 设备中。该助手回答产品查询、比较商品、跟踪价格,并支持购物提醒。它还处理计划中的购物操作和符合条件的自动购买。据该公司称,“Alexa for Shopping”将 Rufus 的产品专业知识与 Alexa+ 的个性化助手上下文相结合。亚马逊表示,Rufus 在 2025 年协助了超过 3 亿客户进行产品研究、比较和购买。GeekWire 报道称,
微软、Azure 和人工智能技术共同应对加利福尼亚州野火风险
微软投资于人工智能驱动的山火监测技术,其首席副总裁兼首席数据科学家胡安·拉维斯塔·费雷斯(Juan Lavista Ferres)探讨了减轻环境损害的策略。据美国国家航空航天局(NASA)称,气候变化影响着地球上的每个人,其表现为气温上升、降雨模式改变以及海平面上升。NASA指出,有确凿证据表明地球正以史无前例的速度变暖,而人类活动是其主要驱动因素。随着全球气温上升,野火构成的威胁日益加剧。 在美
相关专题推荐
评论 (8)
0/500
C'est incroyable ce que Sesame a fait avec Maya ! Un modèle à 1 milliard de paramètres, ça doit être une sacrée bête. Mais franchement, ça donne quoi en termes d'éthique ? On va tous finir avec des assistants trop parfaits ? 😅
Wow, Sesame's CSM-1B sounds like a game-changer! A billion parameters for Maya’s lifelike voice? That’s some serious tech flex. Curious how it stacks up against other models in real-world use. 😎
Whoa, a 1B parameter model powering Maya? That's some serious brainpower! Curious how Sesame's CSM-1B stacks up against other AI giants. Excited to see where this tech takes us! 🚀
Sesame's base AI model for Maya is mind-blowing! 1 billion parameters? That's insane! Maya's voice is so lifelike, it's like talking to a real person. But sometimes she gets a bit too chatty, which can be annoying. Still, a fantastic piece of tech! 🤯
¡El modelo base de IA de Sesame para Maya es alucinante! ¿1 billón de parámetros? ¡Eso es una locura! La voz de Maya es tan realista, parece que estoy hablando con una persona real. Pero a veces se pone un poco parlanchina, lo que puede ser molesto. Aún así, una tecnología fantástica! 🤯
Das Basis-AI-Modell von Sesame für Maya ist umwerfend! 1 Milliarde Parameter? Das ist verrückt! Mayas Stimme ist so lebensecht, es fühlt sich an, als würde man mit einer echten Person sprechen. Aber manchmal wird sie ein bisschen zu gesprächig, was nervig sein kann. Trotzdem, eine fantastische Technologie! 🤯

Sesame,这家创新的AI公司,推出了令人惊叹的逼真语音助手Maya,刚刚通过发布驱动其功能的基模型掀起了波澜。该模型被称为CSM-1B,拥有10亿个参数,这一术语指的是构成模型的各个组件。该模型在Apache 2.0许可证下发布,可用于商业用途,几乎没有限制,正如在AI开发平台Hugging Face上宣布的那样。
CSM-1B通过将文本和音频输入转换为“RVQ音频代码”来运作。RVQ代表“残差向量量化”,这是一种将音频转化为离散标记或代码的方法。该技术也被其他尖端AI音频技术所使用,如Google的SoundStream和Meta的Encodec。CSM-1B的核心利用了Meta的Llama家族中的一个模型,结合了一个音频“解码器”组件。据Sesame称,经过微调的CSM-1B专用版本为Maya的语音提供动力。
Sesame在其Hugging Face和GitHub仓库中将该模型描述为“基础生成模型”,指出它设计用于生成多种语音,但尚未针对任何特定语音进行优化。由于训练集中存在“数据污染”,它在一定程度上能够处理非英语语言,但在这方面的表现可能不佳。有趣的是,Sesame对训练数据的细节保密,让我们对构建该模型的过程感到好奇。
一个引人注目的方面是缺乏强大的防护措施。Sesame采用诚信系统,仅鼓励用户和开发者避免未经许可复制某人的语音、制作虚假新闻等误导性内容,或参与任何“有害”或“恶意”活动。我亲自在Hugging Face上测试了演示版,不到一分钟就克隆了我的声音。生成关于任何话题的语音都非常轻松,甚至包括选举和俄罗斯宣传等敏感话题。
《消费者报告》最近强调了许多AI驱动的语音克隆工具缺乏“有意义的”防护措施,这可能导致潜在的欺诈或滥用。Sesame由Oculus联合创始人Brendan Iribe共同创立,在二月底凭借其几乎摆脱了恐怖谷效应的助手技术吸引了公众的注意。Maya和Sesame的另一个助手Miles展现出逼真的人类特征,如呼吸、带有口语瑕疵的讲话,以及可在讲话中被打断,类似于OpenAI的语音模式。
在财务方面,Sesame从Andreessen Horowitz、Spark Capital和Matrix Partners等重量级投资者那里获得了未公开的资金。除了语音助手,Sesame还着手开发AI眼镜原型,计划全天佩戴,配备其定制模型。这一举措显示了Sesame将AI技术进一步推向我们日常生活的雄心。
华纳音乐收购AI归因初创公司Sureel AI
华纳音乐集团(WMG)于周三确认,其正在收购Sureel AI,一家专注于人工智能归因的初创公司。Sureel的专有技术为音乐曲目生成“AI DNA”,将其分解为各个组成部分,以追踪人工智能模型如何利用这些元素。通过此次收购,WMG旨在增强其监控其艺术家和词曲创作者的作品在人工智能生成内容中被使用或用于训练人工智能模型的能力。“将Sureel整合到WMG中,增强了我们的保护、控制和变现能力,确保创意社区保留对其知识产权、姓名、肖像、形象和声音的控制权,”WMG首席执行官Robert Kync
微软、Azure 和人工智能技术共同应对加利福尼亚州野火风险
微软投资于人工智能驱动的山火监测技术,其首席副总裁兼首席数据科学家胡安·拉维斯塔·费雷斯(Juan Lavista Ferres)探讨了减轻环境损害的策略。据美国国家航空航天局(NASA)称,气候变化影响着地球上的每个人,其表现为气温上升、降雨模式改变以及海平面上升。NASA指出,有确凿证据表明地球正以史无前例的速度变暖,而人类活动是其主要驱动因素。随着全球气温上升,野火构成的威胁日益加剧。 在美
C'est incroyable ce que Sesame a fait avec Maya ! Un modèle à 1 milliard de paramètres, ça doit être une sacrée bête. Mais franchement, ça donne quoi en termes d'éthique ? On va tous finir avec des assistants trop parfaits ? 😅
Wow, Sesame's CSM-1B sounds like a game-changer! A billion parameters for Maya’s lifelike voice? That’s some serious tech flex. Curious how it stacks up against other models in real-world use. 😎
Whoa, a 1B parameter model powering Maya? That's some serious brainpower! Curious how Sesame's CSM-1B stacks up against other AI giants. Excited to see where this tech takes us! 🚀
Sesame's base AI model for Maya is mind-blowing! 1 billion parameters? That's insane! Maya's voice is so lifelike, it's like talking to a real person. But sometimes she gets a bit too chatty, which can be annoying. Still, a fantastic piece of tech! 🤯
¡El modelo base de IA de Sesame para Maya es alucinante! ¿1 billón de parámetros? ¡Eso es una locura! La voz de Maya es tan realista, parece que estoy hablando con una persona real. Pero a veces se pone un poco parlanchina, lo que puede ser molesto. Aún así, una tecnología fantástica! 🤯
Das Basis-AI-Modell von Sesame für Maya ist umwerfend! 1 Milliarde Parameter? Das ist verrückt! Mayas Stimme ist so lebensecht, es fühlt sich an, als würde man mit einer echten Person sprechen. Aber manchmal wird sie ein bisschen zu gesprächig, was nervig sein kann. Trotzdem, eine fantastische Technologie! 🤯





首页






