搜索结果
亚马逊的新AI技术将嘴唇与配音音频匹配
亚马逊旗下 Prime Video 正在推出一项新的AI驱动功能,该功能将演员的嘴唇与真人配音的音频对齐。这项功能目前仅适用于德国剧集《Maxton Hall》的英语配音,但Prime Video 计划将来将其扩展到“额外作品”。 在其公告中,Prime Video 表示,其使用AI和视觉特效技术的组合,使嘴唇动作与翻译后的语音匹配。去年,Prime Video 已经开始在12部电影和电视节目中试
亚马逊Prime Video使用AI进行口型同步翻译
该公司表示,正在“不断利用新工具进行创新,以提升客户的观看体验”。
亚马逊 Prime Video 的全新 AI 技术可使口型与配音完美契合
亚马逊的 Prime Video 推出了一项全新的 AI 驱动功能,可将演员的嘴型与“人工配音”进行对齐。目前该功能仅适用于德语剧集的英语配音版,但 Prime Video 计划在未来将其扩展到“更多影视作品”。 在公告中,Prime Video 表示该技术结合了人工智能与视觉特效技术,使口型能够与翻译后的语音相匹配。 Meta YouTube 最近也为创作者推出了一项由 AI 驱动的自动配音功能
YouTube 对话式视频编辑工具让创作者用自然语言进行编辑
YouTube 在周三的 Made On YouTube 活动上宣布了一系列新的创作者工具,其中包括一款对话式编辑工具,可使用自然语言来精修长视频和短视频素材。 “一小时的拍摄可能需要十小时甚至更长的剪辑时间。那么,如果我们能在不牺牲任何创作控制权的情况下加快这一过程呢?”YouTuber Happy Kelli 在台上分享道。 在聊天界面中,创作者向 AI 发出指令,指导它如何帮助自己完成视频制
YouTube借助AI驱动的“Ask YouTube”功能加倍押注视频购物
“Ask YouTube”是该视频网站较新的AI驱动对话式搜索功能,将成为一个购物助手,该公司在周三的“Made on YouTube”活动上宣布。 Ask YouTube最初是作为对话式搜索的一项实验,后来成为YouTube体验中更重要的组成部分。该功能允许任何人使用自然语言请求搜索YouTube,包括比传统搜索更复杂、更详细的查询。YouTube随后会汇总一组结果,其中可能包括Shorts和长
Google发布Gemini 3.8 Live Live Avatar数字人交互功能 赋予AI实时视频面孔
Google公司宣布,正式在Gemini Enterprise企业级平台中全面上线“Live Avatar”(实时数字人)功能。该技术深度集成了Google最新的Gemini 3.8 Live大模型架构,在原有近乎零延迟的高流畅语音对谈基础上,首次引入了近乎实时的生成式视频生成能力,使对话式人工智能拥有了能够“边听、边看、边说”的动态视觉形象。 根据官方介绍,Gemini 3.8 Live Liv
视频AI公司Pika推出新工具以加速AI视频创作
该产品可自动选择用于创建视频中特定元素的AI模型,并加快提示词生成过程。 用户无需从零开始撰写段落描述,只需输入视频外观的基本细节,即可生成可编辑的逐镜头列表。 该公司还发布了一套应用程序,包括用于重新打光以及更换角色或服装的工具。 Pika估值4.7亿美元,背后有Spark Capital、Lightspeed Venture Partners以及演员杰瑞德·莱托和AI研究员安德烈·卡帕西等投资
亚马逊将第三方AI代理集成至卖家工具,首批支持Anthropic的Claude
亚马逊在2026年9月23日于西雅图举行的年度Accelerate会议上宣布,通过一个测试版插件,将第三方AI代理集成到卖家工具中,首批支持Anthropic的Claude。 该插件允许卖家在美国商家的基础上,通过外部平台管理库存、定价和商品信息。 此外,亚马逊还推出了后台业务自动化功能、升级版的Seller Assistant(包含“canvas”功能),以及为主要账户持有人提供免费的12个月A
辉达等60组织联合承诺 助34亿人以自身语言使用AI
辉达等全球60家AI实验室、研究机构、企业共同签署一项5年的联合承诺,目标让约34亿人能以自己的语言使用AI。(中央社档案照片)(中央社记者张欣瑜旧金山21日专电)辉达在内的全球60家AI实验室、研究机构、企业共同签署一项5年的联合承诺,目标要让约34亿人能以自己的语言使用AI。辉达指出,这项共同承诺将扩大开放模型、资料集和工具的取得管道,让更多人能依照自身需求使用AI。这项联合承诺由盖兹基金会(
YouTube新增创作者工具,包括视频A/B测试、动态缩略图和实时配音
为了帮助创作者触达更多人,YouTube周三推出一系列新工具,其中许多工具利用人工智能尝试不同的视频策略,以找出最能提升视频表现的方法。 新的Ask Studio功能允许创作者将草稿视频分享给AI,以便根据他们之前的内容和用户评论获得个性化反馈。该功能将提出替代标题和缩略图选项,分析创作者的频道数据以解释其视频的表现,并提供改进指标的建议。Ask Studio也将扩展到YouTube的移动应用中。
谷歌Gemini可以呈现卡通或逼真的虚拟形象,为生成式对话进行唇形同步
谷歌为其实时对话模型 Gemini 3.8 Live 增加了一项名为“Live Avatar”的功能,该功能能够生成动画角色和逼真的数字人,为 Gemini 机器生成的语音进行对口型配音。谷歌 DeepMind 研究科学家张硕茵(Shuo-yiin Chang)和 Gemini 软件工程师郑承杰(CJ Zheng)在一篇博文中解释道:“对话本质上是多模态的:我们通过倾听、注视、说话以及使用面部表情
Google翻译迎来重磅更新:Android端支持后台实时同传 iOS端上线贴耳“听力模式”
Google近日宣布对其旗下翻译应用“Google翻译”(Google Translate)进行重要功能升级,分别针对 Android 与 iOS 平台推出了更贴合用户实际使用场景的实时翻译改进。本次更新旨在降低跨语言沟通的操作门槛,让用户在跨国出行、涉外交流或日常多任务处理时获得更加自然顺畅的沟通体验。 目前,Google翻译的实时同传模式已支持超过70种语言的近实时语音转换。Google官方数
苹果在这次发布会上还发布了新一代的Apple AI,计划支持英语、简体中文、繁体中文等16 种语言,但右下角小字显示首发不支持在中国大陆使用。
微软Foundry加入原生实时语音智能体 正面挑战Google Gemini Live
微软正在进一步加强Foundry平台的实时语音能力,为开发者提供能够直接进行语音输入和语音输出的原生语音智能体,从而让企业能够更加容易地构建类似Google Gemini Live的实时对话式AI体验。 微软此次更新的核心变化,是Foundry Agent Service开始支持原生实时语音能力。与传统AI智能体先将语音转换成文字、再交给文本模型处理、最后把文字重新转换成语音的流程不同,原生语音架
亚马逊助力OpenAI广告业务,允许其广告商进入ChatGPT
亚马逊于周四宣布与OpenAI建立合作伙伴关系,允许其广告商在ChatGPT中投放广告,首批试点从美国的部分品牌开始。 这标志着全球最大的在线零售商对OpenAI蓬勃发展的广告业务投下了信任票。该业务最近实现了10亿美元的年化营收运行率。OpenAI于2.月份开始在美国销售ChatGPT中的赞助广告位,首批合作品牌包括百思买和威廉-索诺玛等零售商。 长期以来,亚马逊一直严格限制人工智能平台(如Ch
千问同声传译大模型Qwen3.8-LiveTranslate正式发布
凤凰网科技讯 9月19日,千问正式发布同声传译大模型Qwen3.8-LiveTranslate,模型以Interleave架构重构实时同传,准确度、流畅度、简洁度全面提升,字均延迟从2.8秒降至2.3秒。 据介绍,在支持60种语言的基础上,Qwen3.8-LiveTrans实时说话人分离,每句话归属清晰,音色复刻更稳定;
井英科技吴高明:AI视频,终局是编剧中心制
AI替代了导演、演员和后期,但替代不了编剧。这是井英科技联合创始人吴高明的判断。 今年一季度,中国新上线了12.8万部微短剧,AI生成的占比超过95%。月活7.18亿,人均每天刷129分钟,首次超过长视频。全球短剧应用内购收入去年达到29.8亿美元,同比翻了一倍还多。 内容制作端,整条生产链都在被AI接管,但吴高明认为,编剧是这条链上最后一个、也最难被替代的环节。 因为创意的源头、对人心的直觉、对
Napster转向微软,推出每分钟一便士的AI代理
Napster,这个前音乐流媒体平台,正押注低成本AI代理作为其重返成功的道路。 首席执行官John Acunto周三表示,通过与微软公司的合作进行AI转型,是该品牌颠覆性遗产的自然延伸。 Acunto在电视采访中说:“我们正在从流媒体音乐转向流媒体智能。 Napster确实改变了音乐世界,我们真的希望改变代理AI的世界。” Napster是互联网时代定义性的从白手起家到辉煌再到无关紧要的故事之一
字节跳动新AI模型曝光:可实时生成空间视频 张一鸣亲自负责
据彭博社报道,字节跳动正准备推出一款面向实时空间视频生成的AI模型,在机器人和自主系统应用领域与Meta、Google母公司Alphabet展开竞争。据知情人士透露,字节跳动创始人张一鸣正在亲自监督这款新模型的开发工作,该模型最快将于下个月发布。知情人士称,张一鸣一直在协调公司旗下各业务部门的相关工作,并为这一项目调配AI资源和算力。该模型的发布时间尚不确定,计划可能会有所变动。 字节跳动知情人士
亚马逊Prime Video借短视频新闻片段向TikTok发起挑战
Amazon Prime Video正效仿TikTok,新增短视频新闻片段。该公司周一表示,正在扩大其新闻覆盖范围,纳入可点播的新闻短片,提供本地和全国新闻。这些内容将可在电视和其他客厅设备上观看,但该公司表示,很快也会推广到网页端和Prime Video移动应用。 这些短片将在Prime Video应用内的“新闻”板块中,出现在“热门话题”和“本地新闻”轮播区。它们将加入Prime Video现
亚马逊为第三方卖家推出新型代理式人工智能
旧金山,9月23日:亚马逊周三在其主要电商网站上为第三方卖家推出了一项新型代理式人工智能服务,扩展了自动化功能,使商品上架和库存管理更加便捷。代理正迅速成为人工智能领域最热门的增长点,因为它们能够在极少或无需人工干预的情况下执行多项操作。以下是部分细节: 该服务被称为“工作流”,持续运行以执行卖家提示,例如当卖家评分突然下降时发出警报,或监控特定产品的定价。 卖家助手平台可以存储每个卖家的
苹果发布Audio Intelligence功能 端侧声学模型迎来系统级重塑
伴随全新硬件与操作系统的集中亮相,苹果公司正式揭晓了一系列基于端侧深度学习算法打造的“音频智能”(Audio Intelligence)前沿功能。这套全新声学技术体系深度整合至iOS 27、macOS Golden Gate以及新一代AirPods 5与AirPods Pro固件之中,将苹果的人工智能战略从传统的文本与图像模态进一步拓宽至听觉感知维度,带来了面对面实时翻译、动态智能降噪以及演播室级
Google发布原生语音大模型Gemini 3.8 Live 首创“边说边想”扩展推理模式
Google今日正式公布了其在原生端到端语音交互领域的最新突破,推出全新一代实时语音大模型Gemini 3.8 Live以及针对高难度任务定制的Gemini 3.8 Live Extended Thinking。 这两款模型代表了Google原生音频对音频(Audio-to-Audio)技术体系的重大跨越,不仅将实时对话延迟与自然度推向新高度,更首次在低延迟语音流中实现了深层多步推理能力,彻底改变