高盛前员工与Meta创始人联手开发面向被忽视市场的语音AI

客户支持与服务是当今语音人工智能领域最热门的领域之一。但在某些市场,开发出声音逼真且响应延迟极低的产品要比其他市场困难得多——而大多数主要玩家在设计产品时并未将非洲和中东地区纳入考量。
AethexAI是一家成立于去年、旨在弥合这一差距的初创公司,已获得由4DX Ventures领投、Enza Capital、Dorm Room Fund、Mojo Ventures和斯坦福大学商学院26号基金跟投的300万美元超种子轮融资。个人投资者包括斯坦福大学教职人员、电信高管以及Anthropic的人工智能研究人员。
该公司没有依赖Vapi和LiveKit等现有的编排工具,而是从零开始构建了自己的紧凑型模型和编排层,以适应其目标市场中通用的英语、法语和阿拉伯语方言——正如我们将看到的,这一决策正是由在该地区运营的具体需求所驱动的。
该公司还推出了面向企业的平台,供其测试技术并注册服务,同时为开发者提供了API和SDK,以便他们对模型进行实验。
这家初创公司由玛丽亚玛·迪亚洛(Mariama Diallo)和阿尤卢瓦·奥德穆伊瓦(Ayooluwa Odemuyiwa)共同创立。首席执行官迪亚洛曾就职于高盛(Goldman Sachs),随后加入由 Y Combinator 支持的 ModelML,负责产品和业务增长。首席技术官奥德穆伊瓦毕业于加州理工学院(Caltech),曾在 Meta 工作,并在斯坦福商学院进修,之后共同创立了该公司。 两人希望为新兴市场打造一款产品,并开始寻找机会。
全球各地的企业都在竞相采用人工智能工具,以实现部分运营流程的自动化。但这一过程并不总是一帆风顺。创始人发现,在埃及,某呼叫中心曾将大部分来电处理流程自动化,但因效果不佳而撤回了该系统。 非洲的多家客服中心向他们反映,以合理的成本寻找并招聘能够实现呼叫自动化的工程师,一直是一项棘手的挑战。
“我们在该地区自动呼叫中观察到的延迟和抖动简直令人难以置信。如果我们当时只是扮演协调者的角色,可能不得不使用托管在该地区以外的大型模型,从而导致更高的延迟。 我们意识到,要想让系统正常运行,必须使用非常小的模型,并在每个环节降低延迟,”奥德穆伊瓦在接受TechCrunch采访时,谈及公司决定自主开发模型和协调层的原因。
部署最新模型的AI实验室通常需要花费数百万来训练模型并获取数据。AethexAI为这两个问题都找到了解决方案。该公司没有一味追求最大规模的模型,而是得出结论:小型模型在保证准确性的同时足以解决延迟问题,并开发了参数范围在3亿至17亿之间的自有Kora系列模型。 这仅相当于大型语言模型规模的一小部分——而这正是关键所在。
为了训练这些模型,这家初创公司使用了来自呼叫中心合作伙伴的匿名录音。此外,它还向非洲各地的广播电台寄送硬盘,以收集更多音频数据。为了降低成本,它建立了一个由大学生组成的贡献者网络,负责对数据进行标注并发音当地地名。 据该公司称,目前其日均处理通话量已超过17,000通。
在业务层面,该公司会耐心引导初次接触语音AI的客户,通过现场演示和研讨会,帮助他们确定最适合自动化的应用场景。
“我们总是告诉客户,目前我们无法满足所有人的所有需求。我们规模还很小。当我们开始与一家公司接洽时,会请他们先选择一个对他们而言最重要的应用场景作为起点,”迪亚洛说道。
这家初创公司愿意与各行各业合作,但目前其大部分应用场景涉及催收、客户激活或KYC(了解你的客户)验证——这是银行和电信运营商采用的标准身份核查流程。 该公司正在以合同制形式招聘前置工程师以服务当地市场,并与电信运营商建立渠道合作伙伴关系,以处理语音AI通话的通信业务。该公司表示,现成的“即插即用”解决方案在这里根本行不通。
4DX Ventures的联合创始人兼管理合伙人沃尔特·巴杜(Walter Badoo)指出,非洲和中东市场与大多数语音AI公司最初所针对的市场存在根本性差异。
“非洲和中东企业的呼叫量大约是西方企业的三倍,因为语音仍是客户互动的主要渠道,”他说,“现有系统是为西方市场设计的,这些市场以高端GPU基础设施、标准英语和欧洲语音环境以及欧美常见的企业工作流程为特征。 当企业需要能够处理方言、语言转换和非正式语态,且能在现有电话通信基础设施和实际价格范围内运行的系统时,这便造成了实质性的差距。”
换言之,尽管ElevenLabs、Deepgram、Sierra和Cognigy等公司正在快速全球扩张,但它们最初为之构建的市场与当前正在进入的市场并不总是相同的。 像AethexAI这样的初创公司正押注于这些空白——专门针对当地方言的模型、本土合作伙伴关系以及为该地区量身打造的基础设施——这代表着一个市场机遇,而行业巨头既缺乏填补这一空白的动力,也没有相应的架构来实现。
相关文章
政府中的自主人工智能面临一个棘手的问题:应该允许机器做出哪些决定?
阿联酋在人工智能领域已走在前列长达九年之久。该国于2017年10月推出了国家人工智能战略,随后不久便设立了专门负责监督该战略的部长级职位,并任命时年27岁的奥马尔·苏丹·阿尔·奥拉马担任全球首位人工智能国务部长。 自那时起,该国已开发出数字身份、主权云和数据共享基础设施,而大多数政府目前仍在建设这些基础设施。政府在自主人工智能领域的真正考验在于,这一先发优势能否转化为切实成果。本月,这一测试阶段正
谷歌在 Docs 和 Keep 中推出了语音提示功能
在谷歌I/O开发者大会上,该公司宣布将在Docs、Keep和Gmail等Workspace应用中引入语音提示功能。这些功能使用户能够通过语音创建草稿、记录笔记以及搜索邮件。在 Docs 中,用户可以完全通过语音起草文档。在 TechCrunch 展示的演示中,一位用户从 Drive 中提取了简历信息,从一封电子邮件中添加了活动安排,甚至还加入了几则幽默轶事。图片来源:谷歌此前,用户必须手动输入所有
谷歌在iOS平台上悄然推出了一款“离线优先”的AI语音输入应用
本周一,谷歌悄然在iOS平台推出了一款“离线优先”的语音输入应用——Google AI Edge Eloquent,以此与Wispr Flow、SuperWhisper、Willow等同类应用展开竞争。该应用可免费下载。下载基于Gemma的自动语音识别(ASR)模型后,您即可在手机上开始语音输入。应用会实时显示转录内容,暂停时会自动去除“嗯”、“啊”等口头语,并优化文本。在转录内容下方,“要点”、
相关专题推荐
评论 (0)
0/500

客户支持与服务是当今语音人工智能领域最热门的领域之一。但在某些市场,开发出声音逼真且响应延迟极低的产品要比其他市场困难得多——而大多数主要玩家在设计产品时并未将非洲和中东地区纳入考量。
AethexAI是一家成立于去年、旨在弥合这一差距的初创公司,已获得由4DX Ventures领投、Enza Capital、Dorm Room Fund、Mojo Ventures和斯坦福大学商学院26号基金跟投的300万美元超种子轮融资。个人投资者包括斯坦福大学教职人员、电信高管以及Anthropic的人工智能研究人员。
该公司没有依赖Vapi和LiveKit等现有的编排工具,而是从零开始构建了自己的紧凑型模型和编排层,以适应其目标市场中通用的英语、法语和阿拉伯语方言——正如我们将看到的,这一决策正是由在该地区运营的具体需求所驱动的。
该公司还推出了面向企业的平台,供其测试技术并注册服务,同时为开发者提供了API和SDK,以便他们对模型进行实验。
这家初创公司由玛丽亚玛·迪亚洛(Mariama Diallo)和阿尤卢瓦·奥德穆伊瓦(Ayooluwa Odemuyiwa)共同创立。首席执行官迪亚洛曾就职于高盛(Goldman Sachs),随后加入由 Y Combinator 支持的 ModelML,负责产品和业务增长。首席技术官奥德穆伊瓦毕业于加州理工学院(Caltech),曾在 Meta 工作,并在斯坦福商学院进修,之后共同创立了该公司。 两人希望为新兴市场打造一款产品,并开始寻找机会。
全球各地的企业都在竞相采用人工智能工具,以实现部分运营流程的自动化。但这一过程并不总是一帆风顺。创始人发现,在埃及,某呼叫中心曾将大部分来电处理流程自动化,但因效果不佳而撤回了该系统。 非洲的多家客服中心向他们反映,以合理的成本寻找并招聘能够实现呼叫自动化的工程师,一直是一项棘手的挑战。
“我们在该地区自动呼叫中观察到的延迟和抖动简直令人难以置信。如果我们当时只是扮演协调者的角色,可能不得不使用托管在该地区以外的大型模型,从而导致更高的延迟。 我们意识到,要想让系统正常运行,必须使用非常小的模型,并在每个环节降低延迟,”奥德穆伊瓦在接受TechCrunch采访时,谈及公司决定自主开发模型和协调层的原因。
部署最新模型的AI实验室通常需要花费数百万来训练模型并获取数据。AethexAI为这两个问题都找到了解决方案。该公司没有一味追求最大规模的模型,而是得出结论:小型模型在保证准确性的同时足以解决延迟问题,并开发了参数范围在3亿至17亿之间的自有Kora系列模型。 这仅相当于大型语言模型规模的一小部分——而这正是关键所在。
为了训练这些模型,这家初创公司使用了来自呼叫中心合作伙伴的匿名录音。此外,它还向非洲各地的广播电台寄送硬盘,以收集更多音频数据。为了降低成本,它建立了一个由大学生组成的贡献者网络,负责对数据进行标注并发音当地地名。 据该公司称,目前其日均处理通话量已超过17,000通。
在业务层面,该公司会耐心引导初次接触语音AI的客户,通过现场演示和研讨会,帮助他们确定最适合自动化的应用场景。
“我们总是告诉客户,目前我们无法满足所有人的所有需求。我们规模还很小。当我们开始与一家公司接洽时,会请他们先选择一个对他们而言最重要的应用场景作为起点,”迪亚洛说道。
这家初创公司愿意与各行各业合作,但目前其大部分应用场景涉及催收、客户激活或KYC(了解你的客户)验证——这是银行和电信运营商采用的标准身份核查流程。 该公司正在以合同制形式招聘前置工程师以服务当地市场,并与电信运营商建立渠道合作伙伴关系,以处理语音AI通话的通信业务。该公司表示,现成的“即插即用”解决方案在这里根本行不通。
4DX Ventures的联合创始人兼管理合伙人沃尔特·巴杜(Walter Badoo)指出,非洲和中东市场与大多数语音AI公司最初所针对的市场存在根本性差异。
“非洲和中东企业的呼叫量大约是西方企业的三倍,因为语音仍是客户互动的主要渠道,”他说,“现有系统是为西方市场设计的,这些市场以高端GPU基础设施、标准英语和欧洲语音环境以及欧美常见的企业工作流程为特征。 当企业需要能够处理方言、语言转换和非正式语态,且能在现有电话通信基础设施和实际价格范围内运行的系统时,这便造成了实质性的差距。”
换言之,尽管ElevenLabs、Deepgram、Sierra和Cognigy等公司正在快速全球扩张,但它们最初为之构建的市场与当前正在进入的市场并不总是相同的。 像AethexAI这样的初创公司正押注于这些空白——专门针对当地方言的模型、本土合作伙伴关系以及为该地区量身打造的基础设施——这代表着一个市场机遇,而行业巨头既缺乏填补这一空白的动力,也没有相应的架构来实现。
政府中的自主人工智能面临一个棘手的问题:应该允许机器做出哪些决定?
阿联酋在人工智能领域已走在前列长达九年之久。该国于2017年10月推出了国家人工智能战略,随后不久便设立了专门负责监督该战略的部长级职位,并任命时年27岁的奥马尔·苏丹·阿尔·奥拉马担任全球首位人工智能国务部长。 自那时起,该国已开发出数字身份、主权云和数据共享基础设施,而大多数政府目前仍在建设这些基础设施。政府在自主人工智能领域的真正考验在于,这一先发优势能否转化为切实成果。本月,这一测试阶段正
谷歌在 Docs 和 Keep 中推出了语音提示功能
在谷歌I/O开发者大会上,该公司宣布将在Docs、Keep和Gmail等Workspace应用中引入语音提示功能。这些功能使用户能够通过语音创建草稿、记录笔记以及搜索邮件。在 Docs 中,用户可以完全通过语音起草文档。在 TechCrunch 展示的演示中,一位用户从 Drive 中提取了简历信息,从一封电子邮件中添加了活动安排,甚至还加入了几则幽默轶事。图片来源:谷歌此前,用户必须手动输入所有
谷歌在iOS平台上悄然推出了一款“离线优先”的AI语音输入应用
本周一,谷歌悄然在iOS平台推出了一款“离线优先”的语音输入应用——Google AI Edge Eloquent,以此与Wispr Flow、SuperWhisper、Willow等同类应用展开竞争。该应用可免费下载。下载基于Gemma的自动语音识别(ASR)模型后,您即可在手机上开始语音输入。应用会实时显示转录内容,暂停时会自动去除“嗯”、“啊”等口头语,并优化文本。在转录内容下方,“要点”、





首页






