1CCF

全球要闻
字号 ·· | 护眼

搜索结果

「谷歌新的Gemini TTS模型可以从30秒的音频中克隆声音」共 39 条 · 第 1 页
thenextweb

谷歌新的Gemini TTS模型可以从30秒的音频中克隆声音

“今天,我们为Gemini系列引入两款全新的文本转语音模型,将语音生成从静态预设转变为动态创意工作室。”谷歌在公告中写道。 谷歌于周三发布了Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS。两款模型从今天起在Gemini API和Google AI Studio中逐步上线。它们加入了谷歌本月早些时候推出的Gemini 3.8系列。 据谷歌介绍,Flash

09/23
cnbeta

Google发布原生语音大模型Gemini 3.8 Live 首创“边说边想”扩展推理模式

Google今日正式公布了其在原生端到端语音交互领域的最新突破,推出全新一代实时语音大模型Gemini 3.8 Live以及针对高难度任务定制的Gemini 3.8 Live Extended Thinking。 这两款模型代表了Google原生音频对音频(Audio-to-Audio)技术体系的重大跨越,不仅将实时对话延迟与自然度推向新高度,更首次在低延迟语音流中实现了深层多步推理能力,彻底改变

09/16
LoopDNS 资讯播报

[GIF] Google Gemini 4 Pro测试表现亮眼,多项指标跃居行业前列

Google Gemini 4 Pro测试表现亮眼,多项指标跃居行业前列 谷歌最新大模型Gemini 4 Pro在权威平台Arena及多项基准测试中展现出卓越性能。 在 Three.js 3D渲染与代码生成测试中,该模型响应速度与生成质量均显著超越同类竞品;在智能体编码、知识工作及终端操作等测评中亦斩获多项最佳成绩。 该模型在保持旗舰级性能的同时具备极高性价比,预示着谷歌在前沿AI领域的研发节奏正

09/20 全文见 cnbeta
罗塞塔简报

谷歌推出面向企业的Gemini 3.8 Live,配备实时虚拟形象

谷歌推出面向企业的 Gemini 3.8 Live,配备实时虚拟形象。 2026 年 9 月 24 日,谷歌推出 Gemini 3.8 Live 的实时虚拟形象功能。 这是 Gemini Enterprise 的一项功能,将近实时视频生成与语音相结合,提供动态的视觉形象。 该工具支持 97 种语言的精准唇形同步和自然表情,让企业智能体能够改善客户服务和交互式操作演示。 它支持异步工具执行,使 AI

09/25
arstechnica

谷歌发布Gemini 3.8 Flash,六周内第三个Flash模型

自2026年初以来,谷歌尚未发布前沿级别的Gemini Pro AI模型,但它确实热衷于推出新的Gemini Flash变体。今天,谷歌宣布在短短六周内发布第三个Flash模型,这使得我们更有可能永远看不到承诺的Gemini 3.5 Pro。但谷歌表示没关系,因为Gemini 3.8 Flash是其迄今为止最好的推理和编码模型。 Gemini 3.8 Flash有两个版本。有标准Flash,谷歌将

09/03
cnbeta

Google Gemini开始替你打电话:AI可代表用户联系商家、预约服务并全程处理通话

Google正在测试一项名为“Call for Me”的新功能,让Gemini能够代表用户直接拨打商家的电话,并独立完成整个通话过程。与过去只能帮助用户拨号或者在电话菜单中提供辅助不同,这一次Gemini真正承担了“替用户打电话”的工作,可以询问商品库存、了解价格、预约服务、修改预约时间,甚至在电话另一端长时间等待人工接听。 目前这项功能仍处于实验阶段,首批仅面向美国地区的Pixel 11系列手机

09/25
cnbeta

Google深度整合Gemini语音交互功能 全面登陆Gmail、Docs与Keep

Google宣布为其Workspace办公生态推出一系列基于Gemini的人工智能语音新功能,正式将对话式语音交互深度整合进Gmail、Google Docs和Google Keep三大核心产品。用户未来无需繁琐地手动打字输入,直接通过语音对话即可完成邮件检索、文档起草以及结构化笔记整理等多项复杂任务。 在Google Docs中,用户现在能够通过语音指令直接创建和编辑文档草稿。该功能特别针对处理

09/04
theregister

谷歌Gemini可以呈现卡通或逼真的虚拟形象,为生成式对话进行唇形同步

谷歌为其实时对话模型 Gemini 3.8 Live 增加了一项名为“Live Avatar”的功能,该功能能够生成动画角色和逼真的数字人,为 Gemini 机器生成的语音进行对口型配音。谷歌 DeepMind 研究科学家张硕茵(Shuo-yiin Chang)和 Gemini 软件工程师郑承杰(CJ Zheng)在一篇博文中解释道:“对话本质上是多模态的:我们通过倾听、注视、说话以及使用面部表情

09/25
华尔街日报

独家 | 新谷歌AI模型据称缩小编程能力差距

谷歌正在准备一款具有更强编程技能的新AI模型,以寻求缩小与OpenAI和Anthropic的差距。 Gemini 3.8 Flash的内部测试显示,在该公司落后于Anthropic和OpenAI的领域取得了进展。预计本周发布。

09/02
cnbeta

Google正式推出面向Windows平台的Gemini原生桌面应用程序

Google公司正式宣布向全球Windows操作系统用户推出Gemini人工智能助手的原生桌面客户端应用程序。这一长期受PC用户期待的举措,标志着Google不再将Gemini的桌面访问体验局限于网页浏览器标签页之内,而是选择直接切入全球最大的桌面计算操作系统底层生态,正面迎战已深度植入Windows平台的微软Copilot以及OpenAI早前上线的ChatGPT桌面客户端。 长期以来,Windo

09/11
cnbeta

Google发布Gemini 3.8 Live Live Avatar数字人交互功能 赋予AI实时视频面孔

Google公司宣布,正式在Gemini Enterprise企业级平台中全面上线“Live Avatar”(实时数字人)功能。该技术深度集成了Google最新的Gemini 3.8 Live大模型架构,在原有近乎零延迟的高流畅语音对谈基础上,首次引入了近乎实时的生成式视频生成能力,使对话式人工智能拥有了能够“边听、边看、边说”的动态视觉形象。 根据官方介绍,Gemini 3.8 Live Liv

09/25
LoopDNS 资讯播报

谷歌宣布正加速推进旗舰级 Gemini 4 AI 模型研发

谷歌科技巨头即将推出其最新旗舰人工智能模型 Gemini 4,以在与 Anthropic 和 OpenAI 的竞争中重新赢得优势。谷歌 DeepMind 新任最高领导人 Kavukcuoglu 在 AI Agenda Live 峰会上表示,Gemini 4 目前正处于后训练阶段的早期,团队正在对其进行精调与安全性测试,目标是“远早于”今年年底发布。 该模型是自去年 Gemini 3 系列发布以来的

09/24 全文见 罗塞塔简报
信报财经

AI丨谷歌匿名测试新模型 能力价格胜竞争对手

Arena近日出现一款名为「gemini-3.8-flash」匿名模型,据报为谷歌Gemini 4 Pro早期版本。(路透资料图片) 人工智能(AI)模型竞技场Arena近日出现一款名为「gemini-3.8-flash」的匿名模型,经多名开发者实测后,认为极可能是谷歌(Google)的Gemini 4 Pro的早期版本。基准测试显示,该模型在程式编码、AI代理、推理及电脑操作等多项能力上领先Op

09/18
cnbeta

下一代旗舰模型Gemini 4发布时间或“远早于”今年底

Google DeepMind部门负责人Koray Kavukcuoglu周三表示,Google接近发布其最新旗舰模型 Gemini 4,这是这家科技巨头在人工智能模型竞赛中落后于竞争对手 Anthropic 和 OpenAI 后期待已久的进展。 Kavukcuoglu 在一次活动上表示,Gemini 4 正处于被称为“后训练”的开发阶段的初期,在此阶段,基础 AI 模型将得到完善,以使其表现可靠

09/24
cnbeta

Google Gemini 4 Pro首测杀回Arena榜单第一

Google真要彻底翻身了!这几天,一个披着“gemini-3.8-flash”马甲的神秘模型,在大模型竞技场Arena上现身。在多轮盲测中,AI圈瞬间沸腾:这绝对是Google“隐藏款”Gemini 4 Pro。 就在今天,Gemini 4 Pro生成的一只机械蝴蝶刷屏全网,仅用十分钟大功告成,而Fable足足耗费了约30分钟。发光的机械羽翼、精密咬合的发条齿轮、流畅灵动的动态表现——Gemin

09/20
凤凰网科技

谷歌最强数学推理AI模型曝光:100万词元上下文,专攻数学难题

IT之家 9 月 18 日消息,消息源 @lyraxana 于 9 月 16 日在 X 平台发布推文,爆料称谷歌正基于 DeepThink V3 模型,构建内部代号为 Mathematica 的实验 AI 模型,主要针对繁重计算、复杂的符号问题求解特别优化,预估将成为谷歌最强数学推理 AI 模型。 I 数据显示,该模型内部标识符为“models / deepthink-mathematica-tf

09/18
华尔街见闻

RSI时代将至:谷歌、OpenAI、SSI正在发出同一个信号

AI行业正在出现一个值得资本市场重视的新变化。过去两年,模型能力能否继续提升、推理成本能否下降、Coding之外能否出现新的万亿美元应用、数据中心建设会不会过剩。 但随着谷歌发布Gemini 3.8 Flash、SSI宣布未来12个月算力扩张10倍,以及OpenAI公开讨论递归自我改进(RSI)与训练资源调配,AI不只要服务用户,也开始参与训练、评估和优化下一代AI。 RSI,即Recursive

09/03
cnbeta

Gemini 4 Pro疑似泄露 “AI减速”又成空话

前几个月,OpenAI和Anthropic轮番把旗舰模型往前推,Google却显得异常安静。Flash几乎3周一更,3.6、3.7、3.8连续往前,但代表最高能力上限的Pro迟迟没有动静。直到这两天,大模型盲测竞技场Arena里,突然冒出一个挂着gemini-3.8-flash名字的模型。 开发者一上手就发现了不对劲,真正的Gemini 3.8 Flash已经发布了,它该是什么水平,大家心里有数。

09/19
商业内幕

谷歌员工已在测试下一代Gemini Flash AI模型

虽然谷歌的下一代前沿模型仍在推迟,但它正以快速的速度推出更快、更便宜的模型。

08/28
凤凰网科技

阿里千问发布Qwen-Audio-3.1系列语音大模型,全线降价最高达95%

千问今日正式发布Qwen-Audio-3.1系列语音大模型,对语音识别、语音合成和实时语音交互三大核心模型进行全面升级同时推出全新的音频创作模型Qwen-Audio-3.1-TTS-Next和音频理解模型Qwen-Audio-3.1-ASR-Next。官方称,五款新模型形成覆盖“理解-生成-交互-创作”的完整音频能力栈。为进一步降低使用成本,Qwen-Audio全线语音模型价格均下调,其中TTS降

09/23
凤凰网科技

阿里发布Qwen3.8-Omni-Flash:音视频API降价超90%

凤凰网科技讯 9月18日,阿里千问正式上线新一代原生全模态模型Qwen3.8-Omni-Flash。该模型支持文本、图像、音频和视频输入,具备1M长上下文,核心目标是推动全模态模型从“理解内容”走向“规划任务、调用工具并完成创作”。 在累计30项评测中,该模型相比上一代Qwen3.5-Omni-Plus平均得分提升超26%。其中,音视频Agent、Coding及长程任务在WildClawBench

09/18
华尔街见闻

刚刚,Gemini 4 Pro偷跑上线!碾压Astra和Fable

真是深藏不漏! 这一次,谷歌终于把底牌扔出来了。 就在这两天,大模型竞技场Arena悄然杀入一款新模型,名字竟挂着「gemini-3.8-flash」。 上手实测的AI大佬和开发者交手几轮后,几乎倒吸一口气—— 这极有可能是谷歌DeepMind,悟了整整半年的下一代旗舰Gemini 4 Pro! 一张疯传全网的基准图,简直堪称「恐怖」。 Gemini 4 Pro完全杀疯,编码、智能体、推理等

09/18
cnbeta

Google翻译迎来重磅更新:Android端支持后台实时同传 iOS端上线贴耳“听力模式”

Google近日宣布对其旗下翻译应用“Google翻译”(Google Translate)进行重要功能升级,分别针对 Android 与 iOS 平台推出了更贴合用户实际使用场景的实时翻译改进。本次更新旨在降低跨语言沟通的操作门槛,让用户在跨国出行、涉外交流或日常多任务处理时获得更加自然顺畅的沟通体验。 目前,Google翻译的实时同传模式已支持超过70种语言的近实时语音转换。Google官方数

09/05
cnbeta

阿里巴巴发布Qwen3.8-Omni-Flash 多项表现逼近Gemini 3.8 Flash

阿里巴巴旗下Qwen团队近日发布新一代原生全模态模型Qwen3.8-Omni-Flash,进一步将音频、视频理解与AI智能体能力结合起来。该模型支持文本、图像、音频和视频四种输入形式,并提供100万Token上下文窗口。与上一代Qwen3.5-Omni-Plus相比,Qwen官方称其在29项基准测试中的平均成绩提升超过25%,同时大幅降低了音频和音视频处理成本。 Qwen3.8-Omni-Flas

09/18
上一页 第 1 页 下一页
1CCF | 全球资讯
正在加载…