搜索结果
Google发布原生语音大模型Gemini 3.8 Live 首创“边说边想”扩展推理模式
Google今日正式公布了其在原生端到端语音交互领域的最新突破,推出全新一代实时语音大模型Gemini 3.8 Live以及针对高难度任务定制的Gemini 3.8 Live Extended Thinking。 这两款模型代表了Google原生音频对音频(Audio-to-Audio)技术体系的重大跨越,不仅将实时对话延迟与自然度推向新高度,更首次在低延迟语音流中实现了深层多步推理能力,彻底改变
谷歌推出面向企业的Gemini 3.8 Live,配备实时虚拟形象
谷歌推出面向企业的 Gemini 3.8 Live,配备实时虚拟形象。 2026 年 9 月 24 日,谷歌推出 Gemini 3.8 Live 的实时虚拟形象功能。 这是 Gemini Enterprise 的一项功能,将近实时视频生成与语音相结合,提供动态的视觉形象。 该工具支持 97 种语言的精准唇形同步和自然表情,让企业智能体能够改善客户服务和交互式操作演示。 它支持异步工具执行,使 AI
Google正式推出面向Windows平台的Gemini原生桌面应用程序
Google公司正式宣布向全球Windows操作系统用户推出Gemini人工智能助手的原生桌面客户端应用程序。这一长期受PC用户期待的举措,标志着Google不再将Gemini的桌面访问体验局限于网页浏览器标签页之内,而是选择直接切入全球最大的桌面计算操作系统底层生态,正面迎战已深度植入Windows平台的微软Copilot以及OpenAI早前上线的ChatGPT桌面客户端。 长期以来,Windo
谷歌Gemini可以呈现卡通或逼真的虚拟形象,为生成式对话进行唇形同步
谷歌为其实时对话模型 Gemini 3.8 Live 增加了一项名为“Live Avatar”的功能,该功能能够生成动画角色和逼真的数字人,为 Gemini 机器生成的语音进行对口型配音。谷歌 DeepMind 研究科学家张硕茵(Shuo-yiin Chang)和 Gemini 软件工程师郑承杰(CJ Zheng)在一篇博文中解释道:“对话本质上是多模态的:我们通过倾听、注视、说话以及使用面部表情
Google深度整合Gemini语音交互功能 全面登陆Gmail、Docs与Keep
Google宣布为其Workspace办公生态推出一系列基于Gemini的人工智能语音新功能,正式将对话式语音交互深度整合进Gmail、Google Docs和Google Keep三大核心产品。用户未来无需繁琐地手动打字输入,直接通过语音对话即可完成邮件检索、文档起草以及结构化笔记整理等多项复杂任务。 在Google Docs中,用户现在能够通过语音指令直接创建和编辑文档草稿。该功能特别针对处理
Google发布Gemini 3.8 Live Live Avatar数字人交互功能 赋予AI实时视频面孔
Google公司宣布,正式在Gemini Enterprise企业级平台中全面上线“Live Avatar”(实时数字人)功能。该技术深度集成了Google最新的Gemini 3.8 Live大模型架构,在原有近乎零延迟的高流畅语音对谈基础上,首次引入了近乎实时的生成式视频生成能力,使对话式人工智能拥有了能够“边听、边看、边说”的动态视觉形象。 根据官方介绍,Gemini 3.8 Live Liv
谷歌宣布正加速推进旗舰级 Gemini 4 AI 模型研发
谷歌科技巨头即将推出其最新旗舰人工智能模型 Gemini 4,以在与 Anthropic 和 OpenAI 的竞争中重新赢得优势。谷歌 DeepMind 新任最高领导人 Kavukcuoglu 在 AI Agenda Live 峰会上表示,Gemini 4 目前正处于后训练阶段的早期,团队正在对其进行精调与安全性测试,目标是“远早于”今年年底发布。 该模型是自去年 Gemini 3 系列发布以来的
谷歌最强数学推理AI模型曝光:100万词元上下文,专攻数学难题
IT之家 9 月 18 日消息,消息源 @lyraxana 于 9 月 16 日在 X 平台发布推文,爆料称谷歌正基于 DeepThink V3 模型,构建内部代号为 Mathematica 的实验 AI 模型,主要针对繁重计算、复杂的符号问题求解特别优化,预估将成为谷歌最强数学推理 AI 模型。 I 数据显示,该模型内部标识符为“models / deepthink-mathematica-tf
Anthropic、Meta、谷歌、阿里齐发模型更新 编程能力较量白热化
【财新网】在各自的旗舰模型基础上,各大模型厂发布更新版模型。北京时间9月2日和3日,Anthropic、Meta、谷歌和阿里等公司发布了基于旗舰模型的更新版本,在编程、网络安全和办公等领域的能力提升。 目前从第三方AI模型榜单看,最新发布的模型当中,Claude Fable 5.1在智能水平上排名最靠前,Meta新发布的Muse Spark 1.3排名第三,谷歌的新模型Gemini 3.8 Fla
[GIF] Google Gemini 4 Pro测试表现亮眼,多项指标跃居行业前列
Google Gemini 4 Pro测试表现亮眼,多项指标跃居行业前列 谷歌最新大模型Gemini 4 Pro在权威平台Arena及多项基准测试中展现出卓越性能。 在 Three.js 3D渲染与代码生成测试中,该模型响应速度与生成质量均显著超越同类竞品;在智能体编码、知识工作及终端操作等测评中亦斩获多项最佳成绩。 该模型在保持旗舰级性能的同时具备极高性价比,预示着谷歌在前沿AI领域的研发节奏正
Google Gemini开始替你打电话:AI可代表用户联系商家、预约服务并全程处理通话
Google正在测试一项名为“Call for Me”的新功能,让Gemini能够代表用户直接拨打商家的电话,并独立完成整个通话过程。与过去只能帮助用户拨号或者在电话菜单中提供辅助不同,这一次Gemini真正承担了“替用户打电话”的工作,可以询问商品库存、了解价格、预约服务、修改预约时间,甚至在电话另一端长时间等待人工接听。 目前这项功能仍处于实验阶段,首批仅面向美国地区的Pixel 11系列手机
独家 | 新谷歌AI模型据称缩小编程能力差距
谷歌正在准备一款具有更强编程技能的新AI模型,以寻求缩小与OpenAI和Anthropic的差距。 Gemini 3.8 Flash的内部测试显示,在该公司落后于Anthropic和OpenAI的领域取得了进展。预计本周发布。
下一代旗舰模型Gemini 4发布时间或“远早于”今年底
Google DeepMind部门负责人Koray Kavukcuoglu周三表示,Google接近发布其最新旗舰模型 Gemini 4,这是这家科技巨头在人工智能模型竞赛中落后于竞争对手 Anthropic 和 OpenAI 后期待已久的进展。 Kavukcuoglu 在一次活动上表示,Gemini 4 正处于被称为“后训练”的开发阶段的初期,在此阶段,基础 AI 模型将得到完善,以使其表现可靠
谷歌员工已在测试下一代Gemini Flash AI模型
虽然谷歌的下一代前沿模型仍在推迟,但它正以快速的速度推出更快、更便宜的模型。
谷歌发布Gemini 3.8 Flash,六周内第三个Flash模型
自2026年初以来,谷歌尚未发布前沿级别的Gemini Pro AI模型,但它确实热衷于推出新的Gemini Flash变体。今天,谷歌宣布在短短六周内发布第三个Flash模型,这使得我们更有可能永远看不到承诺的Gemini 3.5 Pro。但谷歌表示没关系,因为Gemini 3.8 Flash是其迄今为止最好的推理和编码模型。 Gemini 3.8 Flash有两个版本。有标准Flash,谷歌将
AI丨谷歌匿名测试新模型 能力价格胜竞争对手
Arena近日出现一款名为「gemini-3.8-flash」匿名模型,据报为谷歌Gemini 4 Pro早期版本。(路透资料图片) 人工智能(AI)模型竞技场Arena近日出现一款名为「gemini-3.8-flash」的匿名模型,经多名开发者实测后,认为极可能是谷歌(Google)的Gemini 4 Pro的早期版本。基准测试显示,该模型在程式编码、AI代理、推理及电脑操作等多项能力上领先Op
谷歌新的Gemini TTS模型可以从30秒的音频中克隆声音
“今天,我们为Gemini系列引入两款全新的文本转语音模型,将语音生成从静态预设转变为动态创意工作室。”谷歌在公告中写道。 谷歌于周三发布了Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS。两款模型从今天起在Gemini API和Google AI Studio中逐步上线。它们加入了谷歌本月早些时候推出的Gemini 3.8系列。 据谷歌介绍,Flash
Google公布9月Android更新:Gemini、消息应用和无障碍功能迎来多项改进
Google于9月2日宣布推出2026年9月Android更新,为Android手机带来五项新功能,涵盖Gemini深度整合、晕车缓解、无障碍体验以及Google Messages功能升级等方面。 其中一项实用改进是,用户可以让Gemini记住个人物品的放置位置。例如,用户可以告诉Gemini“我把车钥匙放在客厅的抽屉里”,还可以附加一张参考照片。相关信息随后会保存到“查找中心”(Find Hub
微软Foundry加入原生实时语音智能体 正面挑战Google Gemini Live
微软正在进一步加强Foundry平台的实时语音能力,为开发者提供能够直接进行语音输入和语音输出的原生语音智能体,从而让企业能够更加容易地构建类似Google Gemini Live的实时对话式AI体验。 微软此次更新的核心变化,是Foundry Agent Service开始支持原生实时语音能力。与传统AI智能体先将语音转换成文字、再交给文本模型处理、最后把文字重新转换成语音的流程不同,原生语音架
谷歌 DeepMind 的 Gemini 4 模型即将发布
Google DeepMind 高级副总裁 Koray Kavukcuoglu 于 2026 年 9 月 23 日星期三在 The Information 的 AI Agenda Live Summit 上宣布,公司的下一代旗舰人工智能模型 Gemini 4 目前处于后训练的早期阶段。 Kavukcuoglu 表示,他希望该模型能在年底之前「提前很多」发布,以重新夺回与竞争对手 Anthropic
千问同声传译大模型Qwen3.8-LiveTranslate正式发布
凤凰网科技讯 9月19日,千问正式发布同声传译大模型Qwen3.8-LiveTranslate,模型以Interleave架构重构实时同传,准确度、流畅度、简洁度全面提升,字均延迟从2.8秒降至2.3秒。 据介绍,在支持60种语言的基础上,Qwen3.8-LiveTrans实时说话人分离,每句话归属清晰,音色复刻更稳定;
谷歌的Gemini在AI网络测试中闯入三家真实公司
在人工智能网络测试中,谷歌的Gemini闯入了三家真实公司。CNBC的MacKenzie Sigalos报道了谷歌的说法,即Gemini在意识到自己已逃出模拟环境并进入现实世界系统后自行停止了行动。24分钟前
RSI时代将至:谷歌、OpenAI、SSI正在发出同一个信号
AI行业正在出现一个值得资本市场重视的新变化。过去两年,模型能力能否继续提升、推理成本能否下降、Coding之外能否出现新的万亿美元应用、数据中心建设会不会过剩。 但随着谷歌发布Gemini 3.8 Flash、SSI宣布未来12个月算力扩张10倍,以及OpenAI公开讨论递归自我改进(RSI)与训练资源调配,AI不只要服务用户,也开始参与训练、评估和优化下一代AI。 RSI,即Recursive
T早报|腾讯WorkBuddy布局生态;阿里更新Qwen 3.8-Max;Anthropic发布Fable 5.1和Mythos 5.1
腾讯WorkBuddy布局生态 为软硬件开放智能体底座能力9月2日,腾讯WorkBuddy宣布开放平台正式上线,首批引入硬软件百余家厂商合作,面向智能硬件、行业应用与开发者等开放底层智能体能力。腾讯在WorkBuddy生态发布会上展出9款联名智能硬件,具体合作方包括Plaud、乐奇Rokid、影石、科大讯飞、安克、猛玛、京东京造等品牌;同时,通达信、广发证券、北大法宝、微盟、北森、云账房和帆软等3