搜索结果
DeepSeek新论文公开Agent训练!梁文锋署名
大模型训练拼的是算力,Agent训练拼的是环境。环境怎么造?梁文锋署名的DeepSeek最新论文,把技术细节公开了。 DeepSeek做的这个系统叫DSec(DeepSeek Elastic Compute),干的事情就是给Agent训练批量制造沙盒。 它每秒能产生5000+个沙盒,一天能达到300万个,峰值同时运行38万个。 支撑这个规模的单集群也非常庞大,大约有160个节点、3万核CPU和25
梁文锋用沙盒开启RSI
DeepSeek联合清华大学发表了一篇文章,署名的最后一人是梁文锋。 文章表面上是说DeepSeek训练Agent所使用的沙盒,但是论文第6节越看越不对劲。字里行间写了三个英文字母:RSI。 通过这个沙盒,Agent能创建自己需要的环境,这个环境会再次训练Agent,被训练的更强的Agent会创造更好的环境。由此形成了一个小型的RSI闭环。 也正是因此,沙盒,或许成为了开启RSI第一场战争的一把钥
↩️ 据科技媒体 The Information 报道,DeepSeek 创始人梁文锋向投资者表示,采用华为芯片进行训练是 DeepSeek 最核心的战略赌注之一,预计华为最早将于 2026 ...
LoopDNS资讯播报: 中国国产AI芯片迈入大模型训练与海外输出阶段 国产AI芯片正打破“只能推理、无法训练”的认知:美团万亿参数模型“LongCat-2.0”已成功在5万颗国产芯片集群上完成预训练,表明国产硬件已具备大规模训练能力;同时,华为正向中东及中亚客户销售搭载DeepSeek-V4模型的升腾950DT系统。美国旨在限制中国AI芯片能力的出口管制,反而促使部分同样面临英伟达供应限制的国家
DeepSeek披露智能体训练平台 提升效率并降低失控风险
中国人工智能公司深度求索(DeepSeek)最近发表一篇新论文,披露了一套面向大规模人工智能(AI)智能体训练的新型基础设施。图为DeepSeek位于北京的办公室。(路透社档案照片) 中国人工智能公司深度求索(DeepSeek)披露一套面向大规模人工智能(AI)智能体训练的新型基础设施,可提高训练资源利用效率,并通过加强监测和访问控制,应对智能体“作弊”、破坏执行环境等失控行为。综合路透社和澎湃新
美媒:DeepSeek押注华为晶片训练大模型
中国人工智能(AI)企业深度求索(DeepSeek)正将使用华为等国产晶片训练大模型列为重要战略方向。图为DeepSeek位于北京的办公室。(路透社档案照片) 美国媒体报道,中国人工智能(AI)企业深度求索(DeepSeek)正将使用华为等国产晶片训练大模型列为重要战略方向,以降低对英伟达的依赖,应对美国先进晶片出口管制带来的限制。路透社转引美国科技媒体The Information星期一(9月2
DeepSeek测试高效、更安全的AI代理训练方法
原文内容:根据彼得·埃尔斯特罗姆(Peter Elstrom)的报道,中国的 DeepSeek 公司提出了一种创新的人工智能训练方法,该方法有望让人工智能代理更高效地学习,同时最大限度地减少那些引发全球关注的不良行为。 这家总部位于杭州的公司在一篇长达 1 万字的论文中详细介绍了其“DeepSeek Elastic Compute”(简称 DSec)技术。该论文共有约 130 位合著者,其中包括公
DeepSeek年化收入据报达10亿美元 梁文锋:加价未造成客户流失
美国科技媒体《The Information》报道,DeepSeek行政总裁梁文锋在近期投资者会议上披露,公司最新的年化收入由数月前的不足5亿美元大增至10亿美元(约78亿港元),受惠于近期上调API定价,以及其大模型持续受到市场追捧。 《The Information》分析,此次营收大幅跃升,部分原因在于公司将旗下模型的定价提高了2.3至4.5倍。梁文锋在会上表示,加价并未造成客户流失,用户需求
8万亿,梁文锋也开始卷“超大”
DeepSeek也加入参数大竞赛了。据The Information报道,DeepSeek目前正在训练一个约2万亿参数的新模型;梁文锋还在近期一场投资者会议上表示,公司下一步计划继续把模型推到8万亿参数。放在一年前,8万亿还是个难以想象的数字。 但现在,Kimi K3已经做到2.8万亿参数;字节正在预训练一个最高可能达到10万亿参数的新模型;阿里也公开表示,下一代模型将向5万亿到10万亿参数推进。
Token彻底自由了 DeepSeek正开发轻量级模型:普通显卡就能跑
快科技9月24日消息,尽管DeepSeek的API费用已经相当低,但是用量多了还是一大笔费用,想要Token自由还得本地部署,DeepSeek也被曝出开发可以本地部署的轻量级大模型。 最新泄露的DeepSeek投资人会议中,梁文锋提到了DeepSeek内部正在测试一款轻量级大模型,已经可以在普通游戏卡上运行了。这个大模型的能力也非常可期,说是能处理绝大多数日常任务。 从梁文锋的表态来看,DeepS
DeepSeek被曝冲刺5000亿元估值!年化营收达67亿
智东西9月24日消息,据外媒The Information今日报道,两名直接知情人士透露,DeepSeek目前的年化营收运行率已经达到10亿美元(约合人民币67.13亿元),较几个月前不足5亿美元的水平翻了一倍以上。 这一最新数据被曝是由DeepSeek创始人兼CEO梁文锋在近期一次投资者会议上披露。近期模型涨价叠加持续增长的市场需求,共同推动了DeepSeek营收提升。 与此同时在敲定新一轮融资
严文韬正式入职DeepSeek
报道/投资界PEdaily周一(9月21日),严文韬正式加入DeepSeek,本人已到公司报到。 上周,高瓴创投合伙人严文韬将出任DeepSeek CFO的消息不胫而走,投资界报道了梁文锋招到CFO。其实近两个月内,还有多位头部VC的年轻合伙人也参与了DeepSeek 的CFO岗位竞聘。 如今这位90后前高瓴创投合伙人的到来,终结了DeepSeek成立三年来CFO空缺的局面。 此时,临近DeepS
DeepSeek据报聘高瓴创投合伙人严文韬任首席财务官
在公司准备上市之际,中国人工智能(AI)初创企业深度求索(DeepSeek)据报聘请高瓴创投合伙人严文韬出任首席财务官(CFO)。星期一(9月14日)引述两名知情者报道上述消息。 另据IT之家同日消息,凤凰网科技引述多个独立信源称,深度求索的首席财务官即将到岗,最终人选是高瓴创投合伙人严文韬,后者目前已在走离职程序中。 另有信源称,五源资本、红杉资本、龙珠资本等中国多家头部投资机构的负责人都就上述
DeepSeek的烦恼:任务越来越多,人不够用了
以“小团队、高人才密度”著称的DeepSeek,开始大规模补充工程人员。9月7日晚,DeepSeek Harness团队负责人崔添翼在社交平台公开招聘,一次性释放约150个名额。他称,这是“前所未有的150个HC的招聘需求”,公司目前有“很多新方向、新系统、新需求需要搞”。 崔添翼贴文截图两天后,DeepSeek又宣布下调Flash系列I价格,缓存命中输入价格最高下降60%。相比价格变化,此次招聘
消息称DeepSeek等公司将就AI风险向联合国安理会作简报
凤凰网科技讯月22日,据路透社报道,两位知情人士透露,DeepSeek等公司将于本周就AI带来的风险向联合国安理会作简报。眼下,世界各国领导人正齐聚纽约,出席一年一度的联合国大会。 联合国安理会定于周三开会讨论AI与国际安全。几周前,多家AI行业领袖呼吁协调放缓日益强大的AI系统的开发,警告这些系统可能很快将自行改进并脱离人类控制。联合国安理会由15个成员国组成。 一位知情人士称,DeepSeek
DeepSeek招150人,全部押注工程岗
DeepSeek的人才扩张还在继续,但枪口已经调转方向。9月8日,DeepSeek启动新一轮招聘,计划招募约150名工程师,岗位全部集中于服务端开发工程师与Agent弹性计算研发工程师两个方向,重点面向2至10年经验的资深后端工程师,未设AI研究类岗位。 这是DeepSeek在两个多月内的第二次大规模招贤。6月25日,DeepSeek曾在官方公众号宣布“随着技术演进,正努力将所有部门的规模扩大至少
OpenAI推出Agents API公开测试版
2026年9月10日,OpenAI正式发布Agents I公开测试版,为开发者提供构建和部署云端智能体(cloud agents)的托管服务。 该I基于开源的Codex harness驱动,可管理编排、长时会话及工具调用。 开发者可选择使用OpenAI托管的沙箱环境,或选择Cloudflare、DigitalOcean、Oracle和Vercel等合作伙伴提供的基础设施。 针对长会话的自动上下文压
请来90后CFO,梁文锋要冲刺中国首富了?
去年2月发布CFO“招募令”后,头部大模型公司DeepSeek的财务掌门人或即将在近期尘埃落定。 作为高瓴的新生代合伙人代表,严文韬在一级市场融资、科创企业估值、IPO股权架构设计以及产业资源对接上有着丰富的经验。同时,其在年龄上也符合梁文锋对CFO是“90后”的期望。 CFO人选即将敲定之际,DeepSeek近期在资本市场上也动作频频。今年6月,DeepSeek完成了510亿元的A轮融资;8月,
OpenAI同日发布两份文件:AI加速时代,安全正在掉队
在外界等待OpenAI就Agent自主入侵德国程序员网站DseWiki事件披露更多细节之际,当地时间9月6日,宣布公司已达到去年设定的目标,拥有能够在人类指导下完成熟练研究员数天工作的“自动化研究实习生”;另一份则由首席科学家雅库布·帕乔基(Jakub Pachocki)撰写,聚焦前沿AI发展的安全困境,强调目前没有任何实验室解决足够程度的对齐和监控问题。 两份文件释AI已经开始反过来加速AI研发
DeepSeek核心工程师长文刷屏:《我不得不把才华埋葬在昨天》
9月14日,刚刚交付DeepSeek V4.1核心算子的青年工程师刘胜与,以一篇记录技术变迁与个人心路的长文《我不得不把才华埋葬在昨天》在海内外技术社区持续刷屏,引发关于AI时代开发者命运与技术演进的广泛讨论。 词条#我不得不把才华埋葬在昨天#也冲上知乎热榜第一。 作为大模型底层的核心构建者之一,DeepSeek机器学习系统工程师刘胜与的技术履历十分突出。他是北京大学2021级计算机“图灵班”成
美:DeepSeek等6家中企,擅自蒸馏美尖端AI
▲ 美国与中国国旗。/,韩联社美国政府正式宣布,中国DeepSeek、阿里巴巴等人工智能(AI)企业迂回接入OpenAI、Anthropic等的AI模型,大量收集回答并用于开发自研模型。也就是说,中国企业把美国的尖端AI当作“课外老师”,以缩减研究、开发的成本与时间。 8日,美国国家安全局(NSA)、联邦调查局(FBI)、网“中国AI企业正在开展产业规模的、带有攻击性的恶意‘蒸馏(distilla
网友爆料DeepSeek仍可生成涉黄内容,闲鱼平台有人低价售卖“教程”
近日,不少网友在社交媒体发帖称,DeepSeek更新下架“专家模式”后,此前被曝光的涉黄色情角色扮演对话现象仍存在。记者调查发现,部分社交媒体以及闲鱼等平台甚至存在教用户使用DeepSeek开展涉黄角色扮演对话的教程帖,且对外出售。不少网友称通过网传教程DeepSeek生成了涉黄内容,并质疑平台审核机制存在漏洞。DeepSeek仍能生成涉黄短文,部分社交平台存“教程”近期,有网友向新黄河记者反映,
DeepSeek-V4首款多模态模型权重开放“睁眼”后追上Opus-4.8
在连续强化了推理、代码和Agent能力之后,DeepSeek终于为V4补上了视觉输入。8月31日上午,DeepSeek在Hugging Face开放了DeepSeek-V4-Flash-Vision-Exp模型权重,开发者可以直接下载模型权重并自行部署。而官方仓库除了模型文件,还包括视觉编码器和Aligner等组件的参考推理实现,并覆盖DFlash Attention、MoE、Hyper-Conn
DeepSeek一名工程师关于人才、权力与人性的刷屏帖文,罕见地展现了中国前沿人工智能实验室的工作图景。
一名曾参与编写深度求索(DeepSeek)最新模型核心组件的工程师,让读者得以罕见地一窥这家中国前沿实验室的工作状态,以及中国劳动者如何应对人工智能带来的风险。 在这篇以中文发表在其微信公众号上、题为《我别无选择,只能将天赋埋葬在昨天》的博文中,DeepSeek的人工智能开发人员刘圣宇(音)反思了一种奇异的现实:他正在协助构建的人工智能,最终可能会让其自身的专业技能变得过时。刘圣宇向《商业内幕》证
DeepSeek被以色列用于操控上千虚假社交账号
人工智能正在把网络舆论操纵从“AI帮助人生成内容”,推进到“AI自己运营整套虚假账号网络”。 《纽约时报》9月18日报道,美国情报官员、科技公司和网络安全研究人员近期发现,伊朗和中国支持的行动,以及两家以色列私人公司的项目,已经开始利用中国开源人工智能模型建立自主AI智能体,在Facebook、Instagram、X和TikTok等平台自动创建和经营虚假账号。 其中,一项来自以色列的行动,已经明