搜索结果
千问同声传译大模型Qwen3.8-LiveTranslate正式发布
凤凰网科技讯 9月19日,千问正式发布同声传译大模型Qwen3.8-LiveTranslate,模型以Interleave架构重构实时同传,准确度、流畅度、简洁度全面提升,字均延迟从2.8秒降至2.3秒。 据介绍,在支持60种语言的基础上,Qwen3.8-LiveTrans实时说话人分离,每句话归属清晰,音色复刻更稳定;
阿里千问发布Qwen-Audio-3.1系列语音大模型,全线降价最高达95%
千问今日正式发布Qwen-Audio-3.1系列语音大模型,对语音识别、语音合成和实时语音交互三大核心模型进行全面升级同时推出全新的音频创作模型Qwen-Audio-3.1-TTS-Next和音频理解模型Qwen-Audio-3.1-ASR-Next。官方称,五款新模型形成覆盖“理解-生成-交互-创作”的完整音频能力栈。为进一步降低使用成本,Qwen-Audio全线语音模型价格均下调,其中TTS降
阿里发布Qwen3.8-Omni-Flash:音视频API降价超90%
凤凰网科技讯 9月18日,阿里千问正式上线新一代原生全模态模型Qwen3.8-Omni-Flash。该模型支持文本、图像、音频和视频输入,具备1M长上下文,核心目标是推动全模态模型从“理解内容”走向“规划任务、调用工具并完成创作”。 在累计30项评测中,该模型相比上一代Qwen3.5-Omni-Plus平均得分提升超26%。其中,音视频Agent、Coding及长程任务在WildClawBench
Google发布原生语音大模型Gemini 3.8 Live 首创“边说边想”扩展推理模式
Google今日正式公布了其在原生端到端语音交互领域的最新突破,推出全新一代实时语音大模型Gemini 3.8 Live以及针对高难度任务定制的Gemini 3.8 Live Extended Thinking。 这两款模型代表了Google原生音频对音频(Audio-to-Audio)技术体系的重大跨越,不仅将实时对话延迟与自然度推向新高度,更首次在低延迟语音流中实现了深层多步推理能力,彻底改变
阿里巴巴发布Qwen3.8-Omni-Flash 多项表现逼近Gemini 3.8 Flash
阿里巴巴旗下Qwen团队近日发布新一代原生全模态模型Qwen3.8-Omni-Flash,进一步将音频、视频理解与AI智能体能力结合起来。该模型支持文本、图像、音频和视频四种输入形式,并提供100万Token上下文窗口。与上一代Qwen3.5-Omni-Plus相比,Qwen官方称其在29项基准测试中的平均成绩提升超过25%,同时大幅降低了音频和音视频处理成本。 Qwen3.8-Omni-Flas
DeepSeek 开口说话了:灰度测试上线,支持四种音色
同时,DeepSeek的设置页面语音栏里会出现“朗读音色”的选项,贝壳(百变活泼)、白浪(明朗坚定)、海星(俏皮甜美)、暗潮(低沉浑厚)。 另据DeepSeek消息,DeepSeek V4.1 Flash模型于9月10日正式发布。这是DeepSeek全新模型结构系列中的最小尺寸模型,具备原生多模态视觉理解能力。能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型。 DeepSeek称, De
谷歌推出面向企业的Gemini 3.8 Live,配备实时虚拟形象
谷歌推出面向企业的 Gemini 3.8 Live,配备实时虚拟形象。 2026 年 9 月 24 日,谷歌推出 Gemini 3.8 Live 的实时虚拟形象功能。 这是 Gemini Enterprise 的一项功能,将近实时视频生成与语音相结合,提供动态的视觉形象。 该工具支持 97 种语言的精准唇形同步和自然表情,让企业智能体能够改善客户服务和交互式操作演示。 它支持异步工具执行,使 AI
Google发布Gemini 3.8 Live Live Avatar数字人交互功能 赋予AI实时视频面孔
Google公司宣布,正式在Gemini Enterprise企业级平台中全面上线“Live Avatar”(实时数字人)功能。该技术深度集成了Google最新的Gemini 3.8 Live大模型架构,在原有近乎零延迟的高流畅语音对谈基础上,首次引入了近乎实时的生成式视频生成能力,使对话式人工智能拥有了能够“边听、边看、边说”的动态视觉形象。 根据官方介绍,Gemini 3.8 Live Liv
GPT周报|OpenAI拓展巴西市场;MiniMax 8月ARR超8亿美元;智谱认领神秘模型“牛来”
OpenAI拓展巴西市场8月27日,OpenAI宣布正式落地巴西,启动商业化运营。以周活跃用户计算,巴西是ChatGPT全球三大市场之一,过去一年该国用户数量近乎翻倍,巴西用户每天向ChatGPT发送约2.15亿条消息。OpenAI称,巴西用户正从尝试体验AI,转向将其投入日常工作场景,巴西地区ChatGPT企业版订阅数量同比增长五倍,巴西现已跻身OpenAI商业客户规模前十市场。2026年6月,
腾讯混元发布Hy Image3.5 preview:支持文生图和图生图,多轮对话创作
凤凰网科技讯 9月22日,腾讯混元正式发布图像生成模型Hy Image3.5 preview,支持文生图、图生图及多轮对话创作。据官方介绍,该模型经腾讯内部数百名专业设计师GSB盲测,效果较Hy Image3.0提升30%,与Seedream 5.0 pro持平,略优于Nano-Banana Pro和Qwen-Image-3.0 Pro。 定价方面,腾讯云I 2K图像定价为0.15元/张(国际版0
腾讯上线“Hy翻译”App:支持33种语言互译,离线也能用
凤凰网科技讯 9月24日,腾讯混元宣布推出“腾讯Hy翻译”App,同步支持小程序、插件及PC端,用户搜索“腾讯混元翻译”即可体验。该应用基于腾讯混元Hy-MT2翻译模型打造,支持33种语言互译,并覆盖5种中国少数民族语言及方言。 功能方面,提供语音翻译、拍照翻译及离线翻译等多种方式。离线模式下,用户可提前将翻译模型下载至手机,在无网络或信号不佳处仍可稳定使用。目前该App已在12个国家和地区上线,
据介绍,Hy4 preview在模型尺寸、上下文长度、数据规模上都进行了显著的扩展,预训练和后训练的共同进步带来了智能水平的又一次巨大提升,稳居开源模型第一梯队。
T早报|腾讯WorkBuddy布局生态;阿里更新Qwen 3.8-Max;Anthropic发布Fable 5.1和Mythos 5.1
腾讯WorkBuddy布局生态 为软硬件开放智能体底座能力9月2日,腾讯WorkBuddy宣布开放平台正式上线,首批引入硬软件百余家厂商合作,面向智能硬件、行业应用与开发者等开放底层智能体能力。腾讯在WorkBuddy生态发布会上展出9款联名智能硬件,具体合作方包括Plaud、乐奇Rokid、影石、科大讯飞、安克、猛玛、京东京造等品牌;同时,通达信、广发证券、北大法宝、微盟、北森、云账房和帆软等3
阿里Qwen4和下代视频模型训练中,Qwen4.5后模型将扩展至5-10T参数
IT之家 9 月 22 日消息,IT之家今日从 2026 年云栖大会现场获悉,阿里巴巴公布了大模型一系列进展,大模型递归自我改进已初步进入模型训练、推理及芯模协同等环节中,基于新一代架构的 Qwen4 已在训练中,未来 Qwen4.5、Qwen5 等版本将扩展至 5-10T 参数。 同时,阿里的视频生成模型、语音模型、图像模型、世界模型、音乐模型以及全模态模型等均在当天或近期推出新版本。 阿里全新
DeepSeek V4.1 Flash内测:采用新结构 原生多模态支持
9月8日,DeepSeek今日在官方交流群内发布通知,DeepSeek V4.1 Flash的中间版本内测。据介绍,模型采用了新的模型结构,原生多模态支持、能力更强、速度更快、且成本更低。模型的base_url不变,将模型名设置为deepseek-v4.1-flash-expires-on-0910即可调用。当前计费与deepseek-v4-flash相同,每账号限流20并发。 据了解,DeepS
美团上线LongCat-2.5-Preview模型:1.6T参数,原生100万Token上下文
IT之家 9 月 26 日消息,美团旗下 LongCat API 开放平台于 9 月 25 日上线新一代大模型 LongCat-2.5-Preview,主打“长程任务”与多模态能力,并同步开放 API 与网页端体验入口。IT之家附上官方更新日志内容如下:LongCat-2.5-Preview 的核心特性如下:多模态理解:新增图片理解能力,可解析图像内容,支持跨模态问答、内容摘要与复杂视觉推理。 卓
谷歌Gemini可以呈现卡通或逼真的虚拟形象,为生成式对话进行唇形同步
谷歌为其实时对话模型 Gemini 3.8 Live 增加了一项名为“Live Avatar”的功能,该功能能够生成动画角色和逼真的数字人,为 Gemini 机器生成的语音进行对口型配音。谷歌 DeepMind 研究科学家张硕茵(Shuo-yiin Chang)和 Gemini 软件工程师郑承杰(CJ Zheng)在一篇博文中解释道:“对话本质上是多模态的:我们通过倾听、注视、说话以及使用面部表情
DeepSeek-V4首款多模态模型权重开放“睁眼”后追上Opus-4.8
在连续强化了推理、代码和Agent能力之后,DeepSeek终于为V4补上了视觉输入。8月31日上午,DeepSeek在Hugging Face开放了DeepSeek-V4-Flash-Vision-Exp模型权重,开发者可以直接下载模型权重并自行部署。而官方仓库除了模型文件,还包括视觉编码器和Aligner等组件的参考推理实现,并覆盖DFlash Attention、MoE、Hyper-Conn
阿里加码AI办公场景争夺 千问办公软硬件新产品齐发布
2026年9月22日,杭州,2026云栖大会上,千问办公CEO陈宇森正式发布AI硬件QwenNote A2。图:视觉中国 【财新网】用智能体投入办公场景已经成为科技巨头继聊天机器人之后另一个共识。在9月22日-24日云栖大会期间,阿里旗下千问办公推出面向企业的上下文数据管理的产品“企业上下文”(Enterprise Context)以及AI Agent硬件产品QwenNote。 7月,阿里巴巴
阿里试水千问平板,与字节押注不同的AI终端
不管做手机还是做平板,都得找到存在的意义。文丨赵梓昕 管艺雯 郭海惟《晚点 LatePost》独家了解到,阿里云旗下无影团队正在研发一款名叫 QwenBook 的 AI 设备,定位是原生智能体电脑,但产品形态更接近一台 “千问平板”,产品定义和硬件部分由团队自研,无影过去做云电脑积累的系统和端云能力,也被带进了这个项目。 过去两年,大模型公司最重要的产品,大多是手机和电脑里的一个 App。用户打开
Anthropic、Meta、谷歌、阿里齐发模型更新 编程能力较量白热化
【财新网】在各自的旗舰模型基础上,各大模型厂发布更新版模型。北京时间9月2日和3日,Anthropic、Meta、谷歌和阿里等公司发布了基于旗舰模型的更新版本,在编程、网络安全和办公等领域的能力提升。 目前从第三方AI模型榜单看,最新发布的模型当中,Claude Fable 5.1在智能水平上排名最靠前,Meta新发布的Muse Spark 1.3排名第三,谷歌的新模型Gemini 3.8 Fla
微软Foundry加入原生实时语音智能体 正面挑战Google Gemini Live
微软正在进一步加强Foundry平台的实时语音能力,为开发者提供能够直接进行语音输入和语音输出的原生语音智能体,从而让企业能够更加容易地构建类似Google Gemini Live的实时对话式AI体验。 微软此次更新的核心变化,是Foundry Agent Service开始支持原生实时语音能力。与传统AI智能体先将语音转换成文字、再交给文本模型处理、最后把文字重新转换成语音的流程不同,原生语音架