1CCF

全球要闻
字号 ·· | 护眼

搜索结果

「阿里Qwen4和下代视频模型训练中,Qwen4.5后模型将扩展至5-10T参数」共 35 条 · 第 1 页
凤凰网科技

阿里Qwen4和下代视频模型训练中,Qwen4.5后模型将扩展至5-10T参数

IT之家 9 月 22 日消息,IT之家今日从 2026 年云栖大会现场获悉,阿里巴巴公布了大模型一系列进展,大模型递归自我改进已初步进入模型训练、推理及芯模协同等环节中,基于新一代架构的 Qwen4 已在训练中,未来 Qwen4.5、Qwen5 等版本将扩展至 5-10T 参数。 同时,阿里的视频生成模型、语音模型、图像模型、世界模型、音乐模型以及全模态模型等均在当天或近期推出新版本。 阿里全新

09/22
cnbeta

阿里拟推5万亿至10万亿参数超大模型 并发布新一代自研AI芯片

阿里巴巴在杭州举行的2026云栖大会上公布了迄今最为激进的人工智能发展计划。公司首席执行官吴泳铭宣布,阿里巴巴正准备训练参数规模介于5万亿至10万亿之间的新一代人工智能模型,进一步扩大其在大模型、AI芯片和云计算基础设施领域的布局。 按照阿里巴巴披露的信息,正在研发的新模型将成为通义千问(Qwen)系列的重要后续产品。公司表示,Qwen团队目前正持续推进模型架构创新和数据优化研究,希望未来模型能够

09/22
𝕏 @fxtrader

阿里巴巴CEO吴泳铭:千问团队计划训练规模5-10万亿参数的全新模型。

计划训练规模5-10万亿参数的全新模型。

09/22 全文见 cnbeta
凤凰网科技

阿里千问发布Qwen-Audio-3.1系列语音大模型,全线降价最高达95%

千问今日正式发布Qwen-Audio-3.1系列语音大模型,对语音识别、语音合成和实时语音交互三大核心模型进行全面升级同时推出全新的音频创作模型Qwen-Audio-3.1-TTS-Next和音频理解模型Qwen-Audio-3.1-ASR-Next。官方称,五款新模型形成覆盖“理解-生成-交互-创作”的完整音频能力栈。为进一步降低使用成本,Qwen-Audio全线语音模型价格均下调,其中TTS降

09/23
cnbeta

阿里巴巴发布Qwen3.8-Omni-Flash 多项表现逼近Gemini 3.8 Flash

阿里巴巴旗下Qwen团队近日发布新一代原生全模态模型Qwen3.8-Omni-Flash,进一步将音频、视频理解与AI智能体能力结合起来。该模型支持文本、图像、音频和视频四种输入形式,并提供100万Token上下文窗口。与上一代Qwen3.5-Omni-Plus相比,Qwen官方称其在29项基准测试中的平均成绩提升超过25%,同时大幅降低了音频和音视频处理成本。 Qwen3.8-Omni-Flas

09/18
凤凰网科技

阿里发布Qwen3.8-Omni-Flash:音视频API降价超90%

凤凰网科技讯 9月18日,阿里千问正式上线新一代原生全模态模型Qwen3.8-Omni-Flash。该模型支持文本、图像、音频和视频输入,具备1M长上下文,核心目标是推动全模态模型从“理解内容”走向“规划任务、调用工具并完成创作”。 在累计30项评测中,该模型相比上一代Qwen3.5-Omni-Plus平均得分提升超26%。其中,音视频Agent、Coding及长程任务在WildClawBench

09/18
凤凰网科技

8万亿,梁文锋也开始卷“超大”

DeepSeek也加入参数大竞赛了。据The Information报道,DeepSeek目前正在训练一个约2万亿参数的新模型;梁文锋还在近期一场投资者会议上表示,公司下一步计划继续把模型推到8万亿参数。放在一年前,8万亿还是个难以想象的数字。 但现在,Kimi K3已经做到2.8万亿参数;字节正在预训练一个最高可能达到10万亿参数的新模型;阿里也公开表示,下一代模型将向5万亿到10万亿参数推进。

09/22
凤凰网科技

DeepSeek V4.1 Pro或为2万亿参数:未来还有8万亿版、押注国产芯片

快科技9月21日消息,此前我们分析了中秋国庆双节前后国内外要发的10多款大模型,其中最受期待的还得是DeepSeek V4.1 Pro。 跑得比较快的Theinformation网站又爆料了新的消息,DeepSeek正在训练2万亿参数量的大模型,未来还会扩展到8万亿参数量。 而且DeepSeek的大模型训练未来会押注国产AI芯片,尤其是华为的升腾系列,不过具体情况就没有细节流出了。 未来的8万亿参

09/21
凤凰网科技

Token彻底自由了 DeepSeek正开发轻量级模型:普通显卡就能跑

快科技9月24日消息,尽管DeepSeek的API费用已经相当低,但是用量多了还是一大笔费用,想要Token自由还得本地部署,DeepSeek也被曝出开发可以本地部署的轻量级大模型。 最新泄露的DeepSeek投资人会议中,梁文锋提到了DeepSeek内部正在测试一款轻量级大模型,已经可以在普通游戏卡上运行了。这个大模型的能力也非常可期,说是能处理绝大多数日常任务。 从梁文锋的表态来看,DeepS

09/24
cnbeta

中国AI大模型调用量连续十九周领跑 环比增长379%

根据OpenRouter最新数据测算,上周(8月31日至9月6日)全球AI大模型总调用量为115万亿Token,环比增长1.77%。其中,上榜的AI大模型中,中国AI大模型周调用量达56.72万亿Token,环比增长2.83%;同期美国AI大模型周调用量为16.54万亿Token,环比下滑3.1%。中国大模型周调用量连续十九周超过美国,稳居全球首位。 《每日经济新闻》注意到,上周,全球调用量排名前

09/07
凤凰网科技

美团上线LongCat-2.5-Preview模型:1.6T参数,原生100万Token上下文

IT之家 9 月 26 日消息,美团旗下 LongCat API 开放平台于 9 月 25 日上线新一代大模型 LongCat-2.5-Preview,主打“长程任务”与多模态能力,并同步开放 API 与网页端体验入口。IT之家附上官方更新日志内容如下:LongCat-2.5-Preview 的核心特性如下:多模态理解:新增图片理解能力,可解析图像内容,支持跨模态问答、内容摘要与复杂视觉推理。 卓

09/26
凤凰网科技

千问同声传译大模型Qwen3.8-LiveTranslate正式发布

凤凰网科技讯 9月19日,千问正式发布同声传译大模型Qwen3.8-LiveTranslate,模型以Interleave架构重构实时同传,准确度、流畅度、简洁度全面提升,字均延迟从2.8秒降至2.3秒。 据介绍,在支持60种语言的基础上,Qwen3.8-LiveTrans实时说话人分离,每句话归属清晰,音色复刻更稳定;

09/19
路透社

阿里巴巴计划开发5万亿至10万亿参数AI模型,并发布新芯片

09/22 全文见
凤凰网科技

实测智象视频模型:嘻哈说唱、NBA绝杀,视频生成开始理解真实世界

先理解,后生成,更懂物理规律的视频模型。近几月,AI视频生成赛道持续升温。7月31日,Seedance 2.5与MiniMax H3同日发布;8月,阿里发布Wan3.0;进入9月,智象HiDream-O1-Video-1.0(下文简称HiDream V1)发布并冲上权威榜单全球前四。 短短两个月,多家厂商接连推出新一代视频生成模型,行业竞争进一步加速。以字节Seedance、MiniMax H3、

09/18
财新

Anthropic、Meta、谷歌、阿里齐发模型更新 编程能力较量白热化

【财新网】在各自的旗舰模型基础上,各大模型厂发布更新版模型。北京时间9月2日和3日,Anthropic、Meta、谷歌和阿里等公司发布了基于旗舰模型的更新版本,在编程、网络安全和办公等领域的能力提升。 目前从第三方AI模型榜单看,最新发布的模型当中,Claude Fable 5.1在智能水平上排名最靠前,Meta新发布的Muse Spark 1.3排名第三,谷歌的新模型Gemini 3.8 Fla

09/03
英国金融时报

从模型到办公桌,阿里AI开始寻找更多应用出口

从模型到办公桌,阿里AI开始寻找更多应用出口 闫曼:模型已经越来越强,算力投入也越来越大,但企业愿意把多少工作交给AI,AI又能进入多深的业务流程,仍处在探索阶段。 9月22日的云栖大会上,阿里继续加码AI。 阿里巴巴集团CEO吴泳铭在上午的演讲中,将AI模型、AI芯片和AI云定义为“机器智能时代”的三大基石。Qwen计划训练5万亿至10万亿参数规模的新模型,平头哥发布新一代AI芯片真武V90

09/23
联合早报

美媒:DeepSeek押注华为晶片训练大模型

中国人工智能(AI)企业深度求索(DeepSeek)正将使用华为等国产晶片训练大模型列为重要战略方向。图为DeepSeek位于北京的办公室。(路透社档案照片) 美国媒体报道,中国人工智能(AI)企业深度求索(DeepSeek)正将使用华为等国产晶片训练大模型列为重要战略方向,以降低对英伟达的依赖,应对美国先进晶片出口管制带来的限制。路透社转引美国科技媒体The Information星期一(9月2

09/22
cnbeta

索尼Project Canis掌机参数曝光 目标2027年底推出

索尼代号“Project Canis”的新掌机近日传出更多硬件参数。GameGPU称,该设备计划于2027年底推出,但索尼尚未确认这些信息,也未确认其是否属于PlayStation 6项目。 爆料称,Project Canis将采用定制的3纳米AMD处理器,配备6个Zen 6架构核心,其中包括4个Zen 6c核心和2个低功耗Zen 6 LP核心。设备还将搭载24GB LPDDR5X统一内存,使用1

09/17
cnbeta

DeepSeek-V4首款多模态模型权重开放“睁眼”后追上Opus-4.8

在连续强化了推理、代码和Agent能力之后,DeepSeek终于为V4补上了视觉输入。8月31日上午,DeepSeek在Hugging Face开放了DeepSeek-V4-Flash-Vision-Exp模型权重,开发者可以直接下载模型权重并自行部署。而官方仓库除了模型文件,还包括视觉编码器和Aligner等组件的参考推理实现,并覆盖DFlash Attention、MoE、Hyper-Conn

09/01
风向旗参考快讯

DeepSeek V4.1 Flash预计9月10日前后发布

DeepSeek开放平台发布通知,计划于北京时间2026年9月10日前后正式发布V4.1 Flash模型。 据官方介绍,经内部及外部多方测试,V4.1 Flash在性能、费用、速度、总用时等各项指标上已全面超越V4 Pro。 昨日,DeepSeek已在官方交流群内开启V4.1 Flash中间版本内测。据参与内测的用户反馈,新模型采用了全新模型结构,原生支持多模态,能力更强、速度更快、成本更低。凤凰

09/09
凤凰网科技

阶跃发布旗舰模型Step 5 Preview:跻身全球权威榜单开源前三

凤凰网科技讯 9月20日,阶跃StepFun正式发布新一代旗舰基座模型Step 5 Preview,面向真实世界Agentic任务设计。该模型采用稀疏MoE架构,总参数量600B、激活参数仅27B,支持100万Token上下文窗口,原生支持文本与视觉输入。即日起全量开放I,模型权重将于10月15日开源释放。 在全球权威的Artificial Analysis Intelligence Index中

09/20
罗塞塔简报

Cognition推出SWE-2编程模型,旨在提升智能体性能

2026年9月10日,Cognition推出了其迄今为止最先进的编程模型SWE-2,旨在优化成本与性能的帕累托前沿(Pareto frontier)。 SWE-2基于拥有2.8万亿参数的Kimi K3模型进行后训练,采用了一种全新的强化学习(RL)算法,通过线性成本惩罚同时训练多个推理力度级别。 基准测试数据显示,SWE-2在FrontierCode 1.1 Main上的得分为50.0%,在性能上

09/11
南华早报

腾讯Hy4模型在生态驱动训练后于开源AI排名中上升

腾讯控股利用其庞大产品生态系统训练新Hy4预览模型的策略,使其在开发AI智能体方面占据优势,并使其旗舰模型系列重回开源产品第一梯队,分析师表示。 这家中国科技巨头的“差异化产品加模型策略”——即预览模型首先部署在腾讯全系产品中——使其能够收集用户数据,再将信息反馈到后续训练轮次中,高盛分析师在周一的研究报告中表示。 “我们认为这种闭环方法对生产力和编码工作负载尤其重要,在智能体AI时代,真实世界的

09/02
𝕏 @fxtrader

OpenAI推出新生图模型ChatGPT Images 2.

ChatGPT Images 2.5——更快、更清晰、更智能,并配备更好的工具,让你能创造出你所梦想的一切。

09/09
上一页 第 1 页 下一页
1CCF | 全球资讯
正在加载…