字号 ·· | 护眼

搜索结果

「微软推出实时转录与语音合成模型MAI-Transcribe-2-Streaming 流式识别榜单排名第一」共 100 条 · 第 1 页
cnbeta

微软推出实时转录与语音合成模型MAI-Transcribe-2-Streaming 流式识别榜单排名第一

微软推出三款面向实时语音交互的新模型,分别是语音转文字模型MAI-Transcribe-2-Streaming,以及文本转语音模型MAI-Voice-2.1和MAI-Voice-2.1-Flash。微软希望开发者将它们组合起来,构建能够边听边处理、再以自然语音即时回应的语音助手和对话代理。 MAI-Transcribe-2-Streaming与此前只能处理录音文件的MAI-Transcribe-2

6小时前
cnbeta

微软发布MAI-Image-2.6 Flash 主打更快、更便宜的AI图像生成

微软正在进一步扩大自研人工智能模型的布局。当地时间9月4日,据Neowin报道,微软推出了MAI-Image-2.6 Flash,这是一款面向高频图像生成任务优化的新模型,重点提升生成速度和成本效率。微软方面表示,新模型能够在保持较高图像质量的同时,以更低的成本处理大量生成请求。 MAI-Image-2.6 Flash属于微软MAI系列图像模型,主要面向需要快速生成图片的用户和开发者。与更注重最高

09/05
凤凰网科技

口语转录,一步到位!全国产算力语音识别模型,听得懂上下文了

智东西9月24日报道,昨日,科大讯飞推出最新语音识别大模型Spark-ASR-2.0。该模型基于讯飞语音基座大模型Spark-Audio-1.0-Preview构建,重点提升通用识别、复杂声学场景识别、上下文识别和文本流畅规范性。 值得注意的是,语音基座大模型Spark-Audio-1.0-Preview和语音识别模型Spark-ASR-2.0均基于全国产算力展开训练。讯飞正在以多年积累的智能语音

09/24
cnbeta

微软Foundry加入原生实时语音智能体 正面挑战Google Gemini Live

微软正在进一步加强Foundry平台的实时语音能力,为开发者提供能够直接进行语音输入和语音输出的原生语音智能体,从而让企业能够更加容易地构建类似Google Gemini Live的实时对话式AI体验。 微软此次更新的核心变化,是Foundry Agent Service开始支持原生实时语音能力。与传统AI智能体先将语音转换成文字、再交给文本模型处理、最后把文字重新转换成语音的流程不同,原生语音架

09/25
cnbeta

微软执行副总裁发文吐槽“AI垃圾”问题

微软执行副总裁Ryan Roslansky近日在LinkedIn发文吐槽“AI垃圾”问题,Roslansky负责LinkedIn以及Microsoft 365、Teams、Outlook和Copilot等核心业务,正处于微软AI战略的最中心。 Roslansky的表态之所以值得关注,在于他不是随便一位高管在社交媒体上抱怨AI,而是负责微软最重要产品线之一的领导者。 Roslansky在帖子中描述了

09/02
华尔街见闻

集体踩刹车,微软加入OpenAI、Anthropic,表态放缓AI前沿开发

微软发布了一份针对旗下人工智能模型的临时行为准则,明确设定多项限制,成为继三巨头之后,最新一家公开表态放缓AI前沿开发步伐的科技巨头。这份长达1.5万字的准则,人比AI重要。 要求模型不得响应武器制造相关请求,不得协助获取危险物质,不得生成暴力或色情内容。微软表示,准则将在收集外部意见后更新,并将于2027年起正式指导其模型开发工作。 微软AI业务负责人Mustafa Suleiman表示,这份准

09/15
cnbeta

微软10月特别活动将展示OneDrive融合Copilot AI生态

微软公司近日宣布,将于10月8日举办一场聚焦云存储与生成式人工智能融合的特别线上发布会活动。本次活动将以“Copilot + OneDrive”为核心主题,系统性展示微软如何将前沿人工智能技术全面下沉并嵌入其云存储服务体系,推动 OneDrive 从传统的静态文件存储工具向智能化、强交互的个人与工作生产力中枢演进。 作为微软整体 AI 战略布局的重要延伸,此次大会将由负责协作应用与平台的集团高管及

09/17
凤凰网科技

实测智象视频模型:嘻哈说唱、NBA绝杀,视频生成开始理解真实世界

先理解,后生成,更懂物理规律的视频模型。近几月,AI视频生成赛道持续升温。7月31日,Seedance 2.5与MiniMax H3同日发布;8月,阿里发布Wan3.0;进入9月,智象HiDream-O1-Video-1.0(下文简称HiDream V1)发布并冲上权威榜单全球前四。 短短两个月,多家厂商接连推出新一代视频生成模型,行业竞争进一步加速。以字节Seedance、MiniMax H3、

09/18
cnbeta

Meta个人AI助手Muse算力需求极剧攀升 云端架构带来算力与硬件资源考验

科技巨头Meta最新推出的个人AI代理系统“Muse”在发布后迅速吸引了数十万用户,但其背后独特的运行架构正对数据中心的算力资源造成空前的挤压。即使在日活跃用户量尚未突破100万的情况下,该系统对通用CPU算力、内存与存储资源的巨大消耗,已经凸显出AI代理技术规模化落地所面临的硬件瓶颈。 与传统仅回答问题的对话式AI不同,Muse被设计为一款能够自主执行多步骤复杂任务的个人代理,可以为用户处理诸如

09/24
thenextweb

Modulate筹集2500万美元,销售能监听语音通话而不仅仅是转录文本的人工智能

Modulate 是一家波士顿公司,致力于构建直接分析语音而非依赖文字转录的 AI 模型。本轮融资2500万美元,由 Future Ventures 领投,Hyperplane 和 Lakestar 也参与其中,使公司的累计融资额达到6000万美元。 该公司由 Mike Pappas 和 Carter Huffman 创立。两人初次相遇是在麻省理工学院,当时 Mike 在走廊里解出了一道 Cart

09/28
华尔街见闻

新的叙事时刻:Astra之后的AI渗透率和Token总需求

在AI时代,打败你的,是那个比你更早、更会使用AI的人或公司。 但在这次OpenAI推出自己的GPT-6 Astra模型之后,上面这句话就完全不准确了,或者说完全错了。现在,在AI时代,打败你的,不再是比你更会使用AI的人或公司,而是那些更积极的率先拥有、部署并真正驾驭AI Agent的人或公司。特别提醒一句,上面的“你”也可以是一个公司。 还记得么?上个月,Astra就曾经亮过相,那时候作为Op

09/05
罗塞塔简报

AI智能体成为最终聚合者:Meta和微软争夺新科技大奖

Stratechery的本·汤普森(Ben Thompson)分析了2026年从以应用为中心的计算向以智能体为中心的计算的转变。 他认为,Meta的Muse和微软的Copilot/Autopilot等AI智能体正在成为用户的主要交互界面,使传统应用程序沦为单纯的“供应商”或实现细节。 通过为用户提供专用的虚拟机(智能体计算机),Meta和微软正致力于控制交互界面以及用户需求的“灵感”阶段。 这一转

09/28
华尔街见闻

Muse登上苹果应用商店榜首,Meta暴涨13%,AMD和英特尔也嗨了!

Meta旗下全新AI助手Muse迅速攀升至美国苹果和谷歌应用商店免费榜首位,早期数据显示其下载量已超越前代产品。 分析师认为,这一成绩是Meta数千亿美元AI投资开始兑现的切实信号,并可能为公司打开广告、订阅及交易分成等全新变现空间。 市场调研机构Sensor Tower高级分析师Abe Yousef指出,Muse于9月8日上线,此后六天内下载量超过90.2万次,高于前代Meta AI应用同期77

09/22
thenextweb

Use.ai将10多个AI模型整合到一个应用中,月活用户达到100万

每个新的 AI 模型都为用户提供了更换使用平台的理由。对于那些已经在某个平台上积累了数月甚至数年对话记录、个人偏好、文件以及各种使用数据的人来说,切换到更优秀的 AI 模型往往意味着需要重新开始一切。 Use.ai 的设计理念是:用户应该能够在不同的 AI 模型之间自由切换,而无需更改界面或丢失已有的使用数据。该平台自上线以来还不到一年,就已经吸引了 100 万月活跃用户。它为用户提供了超过 10

10/01 全文见 time
财新

进入AGI时代:新一轮的AI革命

9月初,OpenAI发布新一代模型GPT-6 Astra,将其称为“世界上最智能、最对齐的模型”。这不是一次寻常的版本迭代。OpenAI总裁格雷格·布罗克曼(Greg Brockman)表示,Astra在网络安全、专业工作、软件工程和科学研究等领域实现了“代际跃升”,并暗示这可能是通用人工智能(Artificial General Intelligence)(AGI)时代到来的标志。硅谷的措辞历来

09/09
凤凰网科技

AI Coding,正在把存储推向前台

09/28
thenextweb

OpenAI 现在为 Adobe 的创意工作室提供图像模型,并将其转化为可分享的提示词。

OpenAI 发布了 ChatGPT Images 2.5,包含两个新的图像模型,Adobe 已经将其中一个应用到了 Firefly 中。 该公司表示,ChatGPT 及其图像模型每周生成的图像超过 30 亿张。 值得注意的是,此次新增的主要是界面功能而非模型研究,其中包括能够将提示词与图像一起分享等 […]

09/09
cnbeta

中国AI大模型调用量连续十九周领跑 环比增长379%

根据OpenRouter最新数据测算,上周(8月31日至9月6日)全球AI大模型总调用量为115万亿Token,环比增长1.77%。其中,上榜的AI大模型中,中国AI大模型周调用量达56.72万亿Token,环比增长2.83%;同期美国AI大模型周调用量为16.54万亿Token,环比下滑3.1%。中国大模型周调用量连续十九周超过美国,稳居全球首位。 《每日经济新闻》注意到,上周,全球调用量排名前

09/07
凤凰网科技

千问同声传译大模型Qwen3.8-LiveTranslate正式发布

凤凰网科技讯 9月19日,千问正式发布同声传译大模型Qwen3.8-LiveTranslate,模型以Interleave架构重构实时同传,准确度、流畅度、简洁度全面提升,字均延迟从2.8秒降至2.3秒。 据介绍,在支持60种语言的基础上,Qwen3.8-LiveTrans实时说话人分离,每句话归属清晰,音色复刻更稳定;

09/19
风向旗参考快讯

亚马逊的新AI技术将嘴唇与配音音频匹配

亚马逊旗下 Prime Video 正在推出一项新的AI驱动功能,该功能将演员的嘴唇与真人配音的音频对齐。这项功能目前仅适用于德国剧集《Maxton Hall》的英语配音,但Prime Video 计划将来将其扩展到“额外作品”。 在其公告中,Prime Video 表示,其使用AI和视觉特效技术的组合,使嘴唇动作与翻译后的语音匹配。去年,Prime Video 已经开始在12部电影和电视节目中试

09/10
LoopDNS 资讯播报

🎬 【抖音首发】压缩即智能:Part 2,究竟什么是交叉熵? #交叉熵损失 #信息论 #大模型 #模型蒸馏 #科普新锐扶持计划

【抖音首发】压缩即智能:Part 2,究竟什么是交叉熵? #交叉熵损失 #信息论 #大模型 #模型蒸馏 #科普新锐扶持计划▎SourceVideo is too big

09/25
凤凰网科技

B站上线AI无限竞技场测评榜:全球百大模型同场竞技 GPT-6现居榜首

快科技9月20日消息,今日,B站宣布上线“AI无限竞技场”大模型测评榜,并同步公布了首轮模型排行榜。 其中GPT-6 Astra在10个UP主测评中拿下榜首,打败GLM-5.3获得榜首次数冠军;前5名中,国产大模型占据3席。 据B站介绍,“AI无限竞技场”是一个汇集了B站UP主AI大模型测评的竞技广场,由各领域UP主对上百个大模型的真实场景实测构成,涵盖代码、推理、协作、知识等多种测评主题。 不同

09/20
财新

T早报|OpenAI、Anthropic、DeepMind合作AI安全工作;外交部回应AI风险焦虑;梁汝波称字节跳动将加大投资企业市场

阶跃发布语音大模型StepAudio 3 9月15日,阶跃星辰发布 Step Audio 3 系列模型,包括 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 和 StepAudio 3 Music。该系列模型主要面向真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作等场景。 腾讯会议联

09/16
罗塞塔简报

Meta推出Muse AI助手,重点关注产品体验与数据集成

Meta推出Muse AI助手,聚焦产品体验与数据集成。Meta发布了Muse,这是一款由Muse Spark模型驱动的个人AI助手产品。 该助手拥有友好的用户界面,配备持久化虚拟形象、用于个性化建议的“Ideas”标签页,以及用于实时信息的“Feed”信息流。 Muse可与Meta生态系统(Facebook、Instagram、Threads)以及Google、Outlook等第三方服务集成,以

09/17
上一页 第 1 页 下一页
1CCF | 全球资讯
正在加载…