1CCF

全球要闻
字号 ·· | 护眼

搜索结果

「腾讯混元发布Hy Image3.5 preview:支持文生图和图生图,多轮对话创作」共 39 条 · 第 1 页
凤凰网科技

腾讯混元发布Hy Image3.5 preview:支持文生图和图生图,多轮对话创作

凤凰网科技讯 9月22日,腾讯混元正式发布图像生成模型Hy Image3.5 preview,支持文生图、图生图及多轮对话创作。据官方介绍,该模型经腾讯内部数百名专业设计师GSB盲测,效果较Hy Image3.0提升30%,与Seedream 5.0 pro持平,略优于Nano-Banana Pro和Qwen-Image-3.0 Pro。 定价方面,腾讯云I 2K图像定价为0.15元/张(国际版0

09/22
𝕏 @fxtrader

据介绍,Hy4 preview在模型尺寸、上下文长度、数据规模上都进行了显著的扩展,预训练和后训练的共同进步带来了智能水平的又一次巨大提升,稳居开源模型第一梯队。

08/28
凤凰网科技

腾讯上线“Hy翻译”App:支持33种语言互译,离线也能用

凤凰网科技讯 9月24日,腾讯混元宣布推出“腾讯Hy翻译”App,同步支持小程序、插件及PC端,用户搜索“腾讯混元翻译”即可体验。该应用基于腾讯混元Hy-MT2翻译模型打造,支持33种语言互译,并覆盖5种中国少数民族语言及方言。 功能方面,提供语音翻译、拍照翻译及离线翻译等多种方式。离线模式下,用户可提前将翻译模型下载至手机,在无网络或信号不佳处仍可稳定使用。目前该App已在12个国家和地区上线,

09/24
𝕏 @fxtrader

OpenAI推出新生图模型ChatGPT Images 2.

ChatGPT Images 2.5——更快、更清晰、更智能,并配备更好的工具,让你能创造出你所梦想的一切。

09/09
凤凰网科技

腾讯元宝鸿蒙版正式上线:搭载混元Hy4 preview,支持专家模式

凤凰网科技讯 9月25日,腾讯元宝官方宣布,元宝鸿蒙版正式登陆鸿蒙应用市场。首个版本即搭载最新的混元Hy4 preview模型,并支持切换到“专家模式”,全量开放AI写作、语音通话、精准识图、拍照翻译、文档精读等核心功能,同时接入微信公众号与视频号等腾讯生态信源。 据官方介绍,混元Hy4 preview是混元系列生产力方向的最新预览版,具备较强的长链条任务理解与逻辑规划能力,专为高强度复杂办公与学

09/25
thenextweb

OpenAI 现在为 Adobe 的创意工作室提供图像模型,并将其转化为可分享的提示词。

OpenAI 发布了 ChatGPT Images 2.5,包含两个新的图像模型,Adobe 已经将其中一个应用到了 Firefly 中。 该公司表示,ChatGPT 及其图像模型每周生成的图像超过 30 亿张。 值得注意的是,此次新增的主要是界面功能而非模型研究,其中包括能够将提示词与图像一起分享等 […]

09/09
凤凰网科技

美团上线LongCat-2.5-Preview模型:1.6T参数,原生100万Token上下文

IT之家 9 月 26 日消息,美团旗下 LongCat API 开放平台于 9 月 25 日上线新一代大模型 LongCat-2.5-Preview,主打“长程任务”与多模态能力,并同步开放 API 与网页端体验入口。IT之家附上官方更新日志内容如下:LongCat-2.5-Preview 的核心特性如下:多模态理解:新增图片理解能力,可解析图像内容,支持跨模态问答、内容摘要与复杂视觉推理。 卓

16小时前
凤凰网科技

千问同声传译大模型Qwen3.8-LiveTranslate正式发布

凤凰网科技讯 9月19日,千问正式发布同声传译大模型Qwen3.8-LiveTranslate,模型以Interleave架构重构实时同传,准确度、流畅度、简洁度全面提升,字均延迟从2.8秒降至2.3秒。 据介绍,在支持60种语言的基础上,Qwen3.8-LiveTrans实时说话人分离,每句话归属清晰,音色复刻更稳定;

09/19
cnbeta

DeepSeek V4.1 Flash内测:采用新结构 原生多模态支持

9月8日,DeepSeek今日在官方交流群内发布通知,DeepSeek V4.1 Flash的中间版本内测。据介绍,模型采用了新的模型结构,原生多模态支持、能力更强、速度更快、且成本更低。模型的base_url不变,将模型名设置为deepseek-v4.1-flash-expires-on-0910即可调用。当前计费与deepseek-v4-flash相同,每账号限流20并发。 据了解,DeepS

09/08
TheVerge

ChatGPT Sketch 功能可将你糟糕的草图转化为详细的 AI 图像

OpenAI 于周二宣布推出 ChatGPT Images 2.5,并新增了一种通过绘制涂鸦来告诉 ChatGPT 你想要创作什么图像的新方法。借助名为 Sketch 的新功能,你只需直接在 ChatGPT 中画出一些内容,然后告诉 ChatGPT 你希望如何根据该草图生成图像。 你可以通过在聊天框中输入 @Sketch 来激活 Sketch 功能,随后会弹出一个窗口供你进行绘制。我进行了简短的测

09/09
cnbeta

DeepSeek 开口说话了:灰度测试上线,支持四种音色

同时,DeepSeek的设置页面语音栏里会出现“朗读音色”的选项,贝壳(百变活泼)、白浪(明朗坚定)、海星(俏皮甜美)、暗潮(低沉浑厚)。 另据DeepSeek消息,DeepSeek V4.1 Flash模型于9月10日正式发布。这是DeepSeek全新模型结构系列中的最小尺寸模型,具备原生多模态视觉理解能力。能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型。 DeepSeek称, De

09/12
中央通讯社

苹果iOS 27更新 升级照片AI修图、Siri AI对话

(中央社记者吴家豪台北15日电)苹果公司(Apple)今天释出iOS 27作业系统更新,升级跨App的个人智慧系统Apple Intelligence功能,最大亮点之一是「照片」App提升人工智慧(AI)修图体验,新增拍照后可虚拟改变取景角度的「空间重构」功能,并加入果粉期待已久的闹钟与计时器独立音量设定。 另一项升级重点是全新Siri AI亮相,不仅具备更深入的回答与自然流畅的连续对话能力,还能

09/15
cnbeta

Google发布Gemini 3.8 Live Live Avatar数字人交互功能 赋予AI实时视频面孔

Google公司宣布,正式在Gemini Enterprise企业级平台中全面上线“Live Avatar”(实时数字人)功能。该技术深度集成了Google最新的Gemini 3.8 Live大模型架构,在原有近乎零延迟的高流畅语音对谈基础上,首次引入了近乎实时的生成式视频生成能力,使对话式人工智能拥有了能够“边听、边看、边说”的动态视觉形象。 根据官方介绍,Gemini 3.8 Live Liv

09/25
罗塞塔简报

谷歌推出面向企业的Gemini 3.8 Live,配备实时虚拟形象

谷歌推出面向企业的 Gemini 3.8 Live,配备实时虚拟形象。 2026 年 9 月 24 日,谷歌推出 Gemini 3.8 Live 的实时虚拟形象功能。 这是 Gemini Enterprise 的一项功能,将近实时视频生成与语音相结合,提供动态的视觉形象。 该工具支持 97 种语言的精准唇形同步和自然表情,让企业智能体能够改善客户服务和交互式操作演示。 它支持异步工具执行,使 AI

09/25
财新

T早报|腾讯WorkBuddy布局生态;阿里更新Qwen 3.8-Max;Anthropic发布Fable 5.1和Mythos 5.1

腾讯WorkBuddy布局生态 为软硬件开放智能体底座能力9月2日,腾讯WorkBuddy宣布开放平台正式上线,首批引入硬软件百余家厂商合作,面向智能硬件、行业应用与开发者等开放底层智能体能力。腾讯在WorkBuddy生态发布会上展出9款联名智能硬件,具体合作方包括Plaud、乐奇Rokid、影石、科大讯飞、安克、猛玛、京东京造等品牌;同时,通达信、广发证券、北大法宝、微盟、北森、云账房和帆软等3

09/03
凤凰网科技

小鹏汽车第二代VLA全新版本XOS 6.3.0开启推送,号称从3D空间识别跃迁至4D时空理解

IT之家 9 月 22 日消息,小鹏汽车官方今日宣布,第二代 VLA 全新版本 XOS 6.3.0 正式开启推送。 全新版本,全面升级。从 3D 空间识别跃迁至 4D 时空理解,凭借更强的时序记忆、轨迹预判与决策响应能力,实现看得更远、想得更深、反应更快、开得更稳。 另外,小鹏汽车第二代 VLA Lite 同步开启推送,单图灵 Max 车型正式升级第二代 VLA。 小鹏汽车官方此前在 8 月的小鹏

09/22
cnbeta

DeepSeek-V4首款多模态模型权重开放“睁眼”后追上Opus-4.8

在连续强化了推理、代码和Agent能力之后,DeepSeek终于为V4补上了视觉输入。8月31日上午,DeepSeek在Hugging Face开放了DeepSeek-V4-Flash-Vision-Exp模型权重,开发者可以直接下载模型权重并自行部署。而官方仓库除了模型文件,还包括视觉编码器和Aligner等组件的参考推理实现,并覆盖DFlash Attention、MoE、Hyper-Conn

09/01
凤凰网科技

AI编程平台Bitrig宣布为苹果iPhone Duo引入支持

IT之家 9 月 22 日消息随着苹果上周发布 Xcode 27.1 Beta 1 并加入 iPhone Duo 应用开发支持,如今一款 AI 编程平台 Bitrig 也宣布支持构建和测试 iPhone Duo 应用。 据介绍,Bitrig 最初是一款面向“氛围编程”(vibe coding)的应用,用户可以通过文字或语音提示生成原生 SwiftUI 应用,并直接在 iPhone 上的 Bitri

09/22
cnbeta

Google发布原生语音大模型Gemini 3.8 Live 首创“边说边想”扩展推理模式

Google今日正式公布了其在原生端到端语音交互领域的最新突破,推出全新一代实时语音大模型Gemini 3.8 Live以及针对高难度任务定制的Gemini 3.8 Live Extended Thinking。 这两款模型代表了Google原生音频对音频(Audio-to-Audio)技术体系的重大跨越,不仅将实时对话延迟与自然度推向新高度,更首次在低延迟语音流中实现了深层多步推理能力,彻底改变

09/16
techcrunch

ChatGPT 移动应用新增语音智能体功能

OpenAI 于周三宣布,其移动应用将引入基于语音的智能体功能,允许用户通过语音触发诸如起草文档或总结电子邮件等工作流。随着越来越多的用户开始使用语音向 AI 助手下达复杂任务指令,这一功能应运而生。 今年七月,OpenAI 推出了其新的对话模型 GPT-Live,随后该公司将其与桌面应用集成,使用户能够利用语音在“工作”标签页中完成任务或在“Codex”标签页中构建应用。此次新功能的推出将类似的

09/23
theregister

谷歌Gemini可以呈现卡通或逼真的虚拟形象,为生成式对话进行唇形同步

谷歌为其实时对话模型 Gemini 3.8 Live 增加了一项名为“Live Avatar”的功能,该功能能够生成动画角色和逼真的数字人,为 Gemini 机器生成的语音进行对口型配音。谷歌 DeepMind 研究科学家张硕茵(Shuo-yiin Chang)和 Gemini 软件工程师郑承杰(CJ Zheng)在一篇博文中解释道:“对话本质上是多模态的:我们通过倾听、注视、说话以及使用面部表情

09/25
凤凰网科技

人形机器人可“自主做家务”,Figure发布Helix 2.5模型

IT之家 9 月 18 日消息,人形机器人企业 Figure 今日发布了 Helix 2.5 模型,能让机器人“自主做家务” IT之家从 Figure 官方介绍获悉,Figure 在美国旧金山湾区租了 30 套房子,机器人没有进行额外训练,到了地方就开始自己收拾房子。 Helix 2.5 的构建旨在回答一个问题 —— 类人生物能否进入一个它从未见过的家,并立即自主工作? 为此,Figure 在全球

09/18
凤凰网科技

阶跃发布旗舰模型Step 5 Preview:跻身全球权威榜单开源前三

凤凰网科技讯 9月20日,阶跃StepFun正式发布新一代旗舰基座模型Step 5 Preview,面向真实世界Agentic任务设计。该模型采用稀疏MoE架构,总参数量600B、激活参数仅27B,支持100万Token上下文窗口,原生支持文本与视觉输入。即日起全量开放I,模型权重将于10月15日开源释放。 在全球权威的Artificial Analysis Intelligence Index中

09/20
华尔街见闻

腾讯港股收涨5%!Meta Muse走红,腾讯C端Agent生态被重估

腾讯控股周二港股一度涨近8%,成交额放量至177亿港元。核心催化剂来自Meta旗下AI Agent应用Muse在美国迅速走红,登顶应用商店下载榜。市场由此形成一条清晰的映射逻辑——坐拥超级社交生态与高频生活场景入口、并已推出泛办公Agent产品Workbuddy的腾讯,被视为"中国版Muse"最具条件的落地载体。腾讯同日亦发布了最新图像生成模型Hy Image 3.5 Preview。 截至收盘,

09/22
上一页 第 1 页 下一页
1CCF | 全球资讯
正在加载…