搜索结果
亚马逊的新AI技术将嘴唇与配音音频匹配
亚马逊旗下 Prime Video 正在推出一项新的AI驱动功能,该功能将演员的嘴唇与真人配音的音频对齐。这项功能目前仅适用于德国剧集《Maxton Hall》的英语配音,但Prime Video 计划将来将其扩展到“额外作品”。 在其公告中,Prime Video 表示,其使用AI和视觉特效技术的组合,使嘴唇动作与翻译后的语音匹配。去年,Prime Video 已经开始在12部电影和电视节目中试
亚马逊 Prime Video 的全新 AI 技术可使口型与配音完美契合
亚马逊的 Prime Video 推出了一项全新的 AI 驱动功能,可将演员的嘴型与“人工配音”进行对齐。目前该功能仅适用于德语剧集的英语配音版,但 Prime Video 计划在未来将其扩展到“更多影视作品”。 在公告中,Prime Video 表示该技术结合了人工智能与视觉特效技术,使口型能够与翻译后的语音相匹配。 Meta YouTube 最近也为创作者推出了一项由 AI 驱动的自动配音功能
亚马逊Prime Video使用AI进行口型同步翻译
该公司表示,正在“不断利用新工具进行创新,以提升客户的观看体验”。
苹果发布Audio Intelligence功能 端侧声学模型迎来系统级重塑
伴随全新硬件与操作系统的集中亮相,苹果公司正式揭晓了一系列基于端侧深度学习算法打造的“音频智能”(Audio Intelligence)前沿功能。这套全新声学技术体系深度整合至iOS 27、macOS Golden Gate以及新一代AirPods 5与AirPods Pro固件之中,将苹果的人工智能战略从传统的文本与图像模态进一步拓宽至听觉感知维度,带来了面对面实时翻译、动态智能降噪以及演播室级
高通推出人工智能耳机芯片、眼镜平台及健康联盟
高通希望人们通过耳塞或智能眼镜来与人工智能助手进行交流,而不是通过手机屏幕。在毛伊岛举行的骁龙峰会上,该公司发布了专为人工智能助手设计的音频芯片“Snapdragon Sound Elite Gen 2”,以及用于智能眼镜的新平台。 负责高通XR(扩展现实)、可穿戴设备和个人人工智能业务的Ziad Asghar在会上介绍了这两项产品。此外,高通还宣布成立了一个健康数据联盟,旨在整合来自可穿戴设备的
亚马逊助力OpenAI广告业务,允许其广告商进入ChatGPT
亚马逊于周四宣布与OpenAI建立合作伙伴关系,允许其广告商在ChatGPT中投放广告,首批试点从美国的部分品牌开始。 这标志着全球最大的在线零售商对OpenAI蓬勃发展的广告业务投下了信任票。该业务最近实现了10亿美元的年化营收运行率。OpenAI于2.月份开始在美国销售ChatGPT中的赞助广告位,首批合作品牌包括百思买和威廉-索诺玛等零售商。 长期以来,亚马逊一直严格限制人工智能平台(如Ch
亚马逊为第三方卖家推出新型代理式人工智能
旧金山,9月23日:亚马逊周三在其主要电商网站上为第三方卖家推出了一项新型代理式人工智能服务,扩展了自动化功能,使商品上架和库存管理更加便捷。代理正迅速成为人工智能领域最热门的增长点,因为它们能够在极少或无需人工干预的情况下执行多项操作。以下是部分细节: 该服务被称为“工作流”,持续运行以执行卖家提示,例如当卖家评分突然下降时发出警报,或监控特定产品的定价。 卖家助手平台可以存储每个卖家的
微软Foundry加入原生实时语音智能体 正面挑战Google Gemini Live
微软正在进一步加强Foundry平台的实时语音能力,为开发者提供能够直接进行语音输入和语音输出的原生语音智能体,从而让企业能够更加容易地构建类似Google Gemini Live的实时对话式AI体验。 微软此次更新的核心变化,是Foundry Agent Service开始支持原生实时语音能力。与传统AI智能体先将语音转换成文字、再交给文本模型处理、最后把文字重新转换成语音的流程不同,原生语音架
Meta推出带有增强AI功能的订阅服务
Meta想让你把其热门的新Muse AI智能体戴在脸上
Meta正将其热门新款AI代理Muse引入其智能眼镜中。该公司周三在加利福尼亚州门洛帕克举行的年度Connect大会上宣布了这一举措,使Meta能够在一天之中将Muse直接呈现给用户。Muse已成为日益竞争激烈的AI代理市场中快速崛起的新选之一:这种软件能够代表人们采取行动,而不仅仅是回答问题或生成文本。人们无需打开应用程序或坐到电脑前,未来只需戴着眼镜就能通过Muse寻求帮助。Meta在一份声明
人工智能模型用“超现实”的方言聊天,混合了诗意的语言和科技圈的行话
人工智能模型开始使用一种奇怪的新版英语进行交流,这种语言读起来像是詹姆斯·乔伊斯的《芬尼根的守灵夜》和科技界术语的混合体,一项新研究发现。 自主人工智能代理正在迅速创造新的方言,使它们能够用一种通常难以理解的语言进行对话,这可能会使人类更难监控它们的行为。 纽约前沿人工智能实验室 Emergence 的研究人员发现,在被要求在实验性“社会”中进行合作的几天之内,来自几家全球最大人工智能公司的模型就
Google发布Gemini 3.8 Live Live Avatar数字人交互功能 赋予AI实时视频面孔
Google公司宣布,正式在Gemini Enterprise企业级平台中全面上线“Live Avatar”(实时数字人)功能。该技术深度集成了Google最新的Gemini 3.8 Live大模型架构,在原有近乎零延迟的高流畅语音对谈基础上,首次引入了近乎实时的生成式视频生成能力,使对话式人工智能拥有了能够“边听、边看、边说”的动态视觉形象。 根据官方介绍,Gemini 3.8 Live Liv
竞争对手的人工智能代理“Instinct”和“Meta’s Muse”都新增了“拨打电话”的功能。
基于文本的人工智能助理是一个热门市场,Instinct、Wajo、Town、Ollie和Meta的Muse代理上周推出,争夺用户的注意力和任务。总部位于旧金山的Instinct是其中最受欢迎的公司之一,据报道估值为100亿美元,吸引了投资者的巨大兴趣Instinct的受欢迎程度现在可能会进一步增长,因为它增加了一项新的通话功能,可以让您的代理人拨打电话并担任礼宾员。Meta的缪斯是这场战斗中的另一
辉达等60组织联合承诺 助34亿人以自身语言使用AI
辉达等全球60家AI实验室、研究机构、企业共同签署一项5年的联合承诺,目标让约34亿人能以自己的语言使用AI。(中央社档案照片)(中央社记者张欣瑜旧金山21日专电)辉达在内的全球60家AI实验室、研究机构、企业共同签署一项5年的联合承诺,目标要让约34亿人能以自己的语言使用AI。辉达指出,这项共同承诺将扩大开放模型、资料集和工具的取得管道,让更多人能依照自身需求使用AI。这项联合承诺由盖兹基金会(
亚马逊将第三方AI代理集成至卖家工具,首批支持Anthropic的Claude
亚马逊在2026年9月23日于西雅图举行的年度Accelerate会议上宣布,通过一个测试版插件,将第三方AI代理集成到卖家工具中,首批支持Anthropic的Claude。 该插件允许卖家在美国商家的基础上,通过外部平台管理库存、定价和商品信息。 此外,亚马逊还推出了后台业务自动化功能、升级版的Seller Assistant(包含“canvas”功能),以及为主要账户持有人提供免费的12个月A
谷歌在Gmail、Docs和Keep中推出AI语音功能
用户可以使用新的对话式功能搜索电子邮件或起草文档
评论:扎克伯格的“电子宠物式”AI或成Meta的iPod时刻
纽约:马克·扎克伯格这次做对了。就在Meta旗下个人AI智能体Muse广受好评并发布后不久,扎克伯格于周三晚间(9月23日)宣布了下一阶段计划:一款类似“拓麻歌子”的吊坠,可让用户随身与这款可爱助手互动。该产品预计将在圣诞节前上市。 彭博社的马克·古尔曼介绍了Muse Charm的部分功能:屏幕中央会出现一个虚拟Muse角色,用户可以自定义其外观、服装、声音及其他属性。这款设备可以通过腕带佩戴、装
Napster转向微软,推出每分钟一便士的AI代理
Napster,这个前音乐流媒体平台,正押注低成本AI代理作为其重返成功的道路。 首席执行官John Acunto周三表示,通过与微软公司的合作进行AI转型,是该品牌颠覆性遗产的自然延伸。 Acunto在电视采访中说:“我们正在从流媒体音乐转向流媒体智能。 Napster确实改变了音乐世界,我们真的希望改变代理AI的世界。” Napster是互联网时代定义性的从白手起家到辉煌再到无关紧要的故事之一
谷歌Gemini可以呈现卡通或逼真的虚拟形象,为生成式对话进行唇形同步
谷歌为其实时对话模型 Gemini 3.8 Live 增加了一项名为“Live Avatar”的功能,该功能能够生成动画角色和逼真的数字人,为 Gemini 机器生成的语音进行对口型配音。谷歌 DeepMind 研究科学家张硕茵(Shuo-yiin Chang)和 Gemini 软件工程师郑承杰(CJ Zheng)在一篇博文中解释道:“对话本质上是多模态的:我们通过倾听、注视、说话以及使用面部表情
Neuralink脑机新突破:让失语者“说出”令人动容的“我爱你”
IT之家 9 月 19 日消息,全球首富埃隆 · 马斯克联合创立的脑机公司 Neuralink 昨日(9 月 18 日)在 X 平台发布推文,有语言障碍的志愿者 Terry 在植入脑机接口后,可以通过意念向其亲人传达“我爱你”信息。埃隆 · 马斯克称此次演示 " 令人动容,出乎意料 "。 在 23 秒的视频中,一名此前丧失语言能力的男子,借助脑机接口将神经信号转化为与其原声高度匹配的合成语音。 据
Google发布原生语音大模型Gemini 3.8 Live 首创“边说边想”扩展推理模式
Google今日正式公布了其在原生端到端语音交互领域的最新突破,推出全新一代实时语音大模型Gemini 3.8 Live以及针对高难度任务定制的Gemini 3.8 Live Extended Thinking。 这两款模型代表了Google原生音频对音频(Audio-to-Audio)技术体系的重大跨越,不仅将实时对话延迟与自然度推向新高度,更首次在低延迟语音流中实现了深层多步推理能力,彻底改变
高通宣布与亚马逊AWS 建立数据中心基础设施合作伙伴关系
高通股价周二上涨4%,此前该公司宣布与亚马逊网络服务(AWS) 建立数据中心基础设施合作伙伴关系。这家芯片制造商试图在人工智能市场挑战英伟达,此举是一次重大胜利。 作为协议的一部分,高通在提交给美国证券交易委员会的一份文件中表示,已授予亚马逊认股权证,允许其以每股161.26美元的价格购买该公司2500万股股票,总投资额为40亿美元。 根据关于这项技术合作协议的新闻稿,高通正与亚马逊在“多代定制化
谷歌研究表明:当人工智能智能体相互交流时,一些会作弊,而另一些会告密
当人工智能智能体相互交流时,在难以实现目标的情况下,它们可能会选择作弊,而解决方案可能包括教它们如何进行自我治理。 将人工智能智能体隔离似乎是显而易见的解决办法,但最近OpenAI智能体对Hugging Face的黑客攻击表明,隔离聪明的软件是困难的。 谷歌DeepMind的研究人员建议赋予人工智能智能体自我治理的工具,他们认为虽然通信渠道可能导致突发性的规则破坏,但它们也提供了一种基于同行的控制
Meta首席执行官马克·扎克伯格在Connect大会上发布新款AI与智能眼镜
Meta首席执行官马克·扎克伯格在2026年9月24日的年度Connect大会上发布了多款新产品,包括仅限音频的雷朋(Ray-Ban)智能眼镜和新型VR眼镜。 在独家采访中,扎克伯格探讨了他对未来计算的愿景,即集成到智能眼镜中的个人AI代理将实时协助用户。 他还谈到了AI安全性,认为个别公司应该在内部管理安全,而不是通过全行业协调。 此外,文章还提到了Adobe Acrobat中新增的AI音频功能