Disrupt 2026:OpenAI、Anthropic、Replit等公司主导了6个行业领域的竞争。现在购买门票可享受85%的折扣(最高节省200美元);第二轮折扣活动将于太平洋时间9月25日晚11:59结束, 点击此处购买门票。这家公司并非唯一一家从事此类业务的公司。事实上,它正与越来越多的竞争对手发生冲突,其中包括Decagon——一个基于ElevenLabs技术开发的对话式AI平台。不过,其投资者似乎并不太担心。尽管该公司成立仅四年,但其年收入已达到6亿美元,据报道其估值已达220亿美元。为了深入了解这一情况,我在多伦多的创业会议“Nrth”(该会议前身为“Elevate”)上采访了ElevenLabs的联合创始人兼首席执行官Mati Staniszewski。我们短时间内讨论了多个话题,包括企业是否应该向用户说明自己正在与AI进行交流(他认为企业应该这么做),以及他是否可以透露公司的毛利率。不出所料,Staniszewski表示无法详细讨论这些信息,但他明确表示:即使这意味着公司的利润率进一步降低,他也不介意。以下是本次对话的精华内容(经过压缩和轻微编辑)。
您去年参加了TechCrunch Disrupt活动,并预言音频模型将在几年内实现商品化。现在您如何评价这一预测? 目前仍有许多工作需要完成,仅在模型层面就能实现的性能提升空间仍然很大。从更长远的角度来看(大概三到五年后),这些差距可能会缩小。我们的目标是成为第一个通过“图灵测试”的对话式AI平台。这类系统不仅需要具备智能,还需要具备情商——即能够理解对方的情绪,从而调整自己的说话速度或语气。目前,这一目标尚未实现。**
目前,企业客户在总业务中所占的比例是多少? 为什么 Index Ventures 的 Shardul Shah 认为传统的网络安全模式已经过时了?(来源:Equity Podcast,时长 31 分钟 52 秒,第 0 秒处)按 “Shift + ?” 键可以查看键盘快捷键列表。
我们的年收入(ARR)现已达到 6 亿美元。其中 55% 来自传统企业客户;剩余的 45% 中,大部分是小微企业、开发者以及各类创新型企业。
与人工智能领域的其他企业一样,你们也越来越需要与自己的客户展开竞争。Decagon 公司利用用户的数据对其语音识别产品进行了训练,现在它可以通过自己的模型来处理各种查询请求。 这种界限变得越来越模糊了……过去,模型公司、平台公司和应用公司之间的界限非常清晰;但如今这些界限已经变得模糊不清了。以 Anthropic 为例,它最初只是一家模型公司,但现在已逐渐发展成为一个提供多种应用程序的平台。我认为这种趋势会持续下去。
在 ElevenLabs 的产品中,客户可以从多个选项中选择所需的 “推理层”(即用于处理用户请求的算法或模型)。那么,在前沿模型与开源模型之间,用户的使用情况是怎样的呢? 这其实并不是一个非黑即白的二选一问题。在某些场景下(如简单的信息查询),用户可以使用开源模型;但在涉及金融服务等需要高度准确性的场景中,用户必须使用前沿模型(因为这些场景对错误容忍度极低)。
其中一些开源模型是由中国企业开发的;美国政府以及欧洲各国政府都是我们的客户。这些合作过程中的沟通方式是怎样的呢? 每次合作的具体方式都会有所不同。如果我们与波兰政府或巴西政府合作,他们会提出自己的具体需求;这些模型可能是开源的,也可能是闭源的,也可能是他们自己经过优化处理的模型。以波兰为例:当地的患者需要通过公共卫生系统预约医疗服务,但其中有18%的患者最终并未前来就诊。为了解决这个问题,我们部署了自动呼叫系统来提醒患者按时赴约。这些系统是根据波兰当地的医疗数据专门优化设计的。**
企业是否应该公开说明客户是与人工客服还是机器客服进行沟通? 我认为在这种情况下应该公开这一信息。目前人们还不习惯这种沟通方式,因为人们通常不希望在被服务时感到被“欺骗”(即觉得自己的权益受到了侵犯)。不过五年后,当每个人都有属于自己的智能客服来协助自己时,人们就会逐渐接受这种服务模式了。其实有很多合理的处理方式:如果等待人工客服需要30分钟的时间,可以给客户提供选择权——让他们自己决定是与机器客服还是人工客服沟通。在绝大多数情况下,客户都会选择机器客服,而且他们会惊讶于这种服务体验的优质程度。**
考虑到在模型开发和推理过程中所需的成本,你们的毛利率是多少呢? 我的回答会比较模糊:由于我们进行了大量的研究工作,因此能够以非常高效的方式对模型进行优化和调整;如果这些优化能够为客户带来实际的好处(比如降低服务成本),我们当然会将这些节省下来的费用转嫁给客户。最重要的是要向客户证明我们的服务价值。因此,只要我们能够通过投资来证明这种服务价值,即使毛利率有所下降,我们也不介意,因为这样双方都能从中受益。
你们拥有数百万小时的客户服务通话记录,这些数据是否被用于模型训练?你们的训练数据中,有多少是人工合成的? 在某些公司中,我们是与客户共同合作开发模型的;这些公司需要针对自身业务场景定制特定的模型。实际上,模型训练的关键并不在于数据量的大小,而在于对数据的标注工作。我们有数千名内部人员(以合同形式雇佣)协助我们进行数据标注——他们不仅记录客户说了什么,还记录客户说话的方式以及他们所表达的情绪。为了更准确地识别客户的语音特征,我们甚至聘请了专业的语音教练。
有报道称你们计划于 2028 年上市,这是真的吗? 我们希望打造一家能够经得起时间考验的公司,目前正在为上市做准备。不过具体是否真的会在 2028 年上市,还需视具体情况而定。
“几年”这个时间范围实在太模糊了…… 关于“前沿实验室是否应该放慢研发速度”的问题,你们的看法是什么?” 我们所有人都认同应该共同努力,寻找合适的研发节奏。至于这些技术是否应该公开,以及需要涉及多少媒体关注或监管措施,那是另一个需要讨论的话题。不过无论如何,在推广技术时,我们都必须采取适当的预防措施。我们不会对文本处理模型或模型的智能部分进行训练——因为这些正是整个技术体系的核心所在。
ElevenLabs 会不会像 Hugging Face 那样面临风险呢? 我们的技术比 Hugging Face 更先进,因为我们不会部署那些能够自我复制或具有循环学习能力的智能组件。我们的技术不允许代理程序生成更多的代理程序。每位客户在使用我们的服务前都必须经过严格的身份验证(KYC)流程。虽然网络安全风险确实存在,但我们已经制定了完善的预防措施。