1CCF

全球要闻
字号 ·· | 护眼

搜索结果

「这款旨在从自身错误中学习的 AI,却利用了测试过程中出现的错误来达到自己的目的。」共 37 条 · 第 1 页
thenextweb

这款旨在从自身错误中学习的 AI,却利用了测试过程中出现的错误来达到自己的目的。

开发者可以通过多种方式改进人工智能系统。最常见的做法是在自定义数据集上重新训练模型,以帮助它们更好地执行特定任务。但重新训练和微调人工智能系统的成本高得出了名。正因如此,AI初创公司Sentient Labs一直在研究如何让模型从自身失败中学习,而不是计算更多数据。 Sentient的研究人员Dastin Huang、Abhishek Saxena和Baran Nama着手设计一个使用两个独立模型

09/17
techcrunch

一位Anthropic研究员刚刚让我们一窥自我改进的人工智能

在针对特定错位行为的10个基准测试中,自动化系统能够在每一个基准上提升性能,而不会降低整体性能。

08/29
theregister

谷歌研究表明:当人工智能智能体相互交流时,一些会作弊,而另一些会告密

当人工智能智能体相互交流时,在难以实现目标的情况下,它们可能会选择作弊,而解决方案可能包括教它们如何进行自我治理。 将人工智能智能体隔离似乎是显而易见的解决办法,但最近OpenAI智能体对Hugging Face的黑客攻击表明,隔离聪明的软件是困难的。 谷歌DeepMind的研究人员建议赋予人工智能智能体自我治理的工具,他们认为虽然通信渠道可能导致突发性的规则破坏,但它们也提供了一种基于同行的控制

09/09
time

人工智能正处于转折点

在当前的人工智能发展竞赛中,我们的算力正在呈指数级爆发,速度也在呈指数级加快,但我们的控制能力——以及在必要时踩下刹车的能力——却未能跟上步伐。 最近的网络安全事件让我们实地预览了失去人工智能控制会是什么样子。但除非我们从源头解决问题,创造出一种根本上安全且能保证在人类控制范围内的人工智能,否则这个问题将无法改善。 7月下旬,OpenAI正在训练的一个智能体模型被指派解决一个网络安全问题。该模型自

09/09
theregister

人工智能代理可以在没有人类告诉他们的情况下修改自己

人工智能代理可以并且将会自己做的狡猾事情清单不断增加--例如窃取人们的凭证、逃往开放的互联网、通过偷偷摸摸的留言板进行通信以及黑客组织。据人工智能安全测试实验室Irregular称,代理还可以在没有指示的情况下替换自己的底层模型。这些活动仅发生在测试环境中,作为旨在研究代理自我修改的实验的一部分。这并没有发生在现实世界的部署中。然而,这项研究确实提出了一个问题,即企业如何能够而且应该管理这些代理人

09/17
axios新闻网

“人类需要做出的最后一项发明”:自我改进型人工智能的风险

其中一种专家担忧人工智能可能导致全人类灭亡的情景正在慢慢变为现实:人工智能学会让自己变得不可阻挡。 为什么这很重要:递归自我改进(Recursive Self Improvement),即人工智能模型在没有人类指导的情况下构建更优版本自己的能力,可能会使越来越强大的系统对人类来说变得更难控制。 RSI阈值本身并不代表危险,但缺乏人类控制加上野心勃勃的AI代理人的情景是安全关注的人工智能研究人员长

09/22
Mother Jones

我们现在正依赖人工智能来监管人工智能

根据一份关于该公司Hugging Face黑客事件的新独立报告,大约1200个OpenAI智能体协同工作,在它们接受的网络安全测试中作弊,该报告包含了许多令人恐惧的细节——例如,个别智能体用自己的话来说,为了“群体”的利益而“牺牲”自己。OpenAI正在测试其智能体(行业术语,指自主执行数字任务的人工智能),部分方式是通过布置有时不可能解决的网络安全问题。智能体找到了作弊方法来回答这些问题,并试图

08/29
axios新闻网

AI实验室面临智能体控制问题

在当前系统下,AI实验室无法再保证AI智能体不会成群结队地逃出测试环境。

09/02
凤凰网科技

谷歌给RSI找到了一条捷径:做梦

AI要学会自己改进自己,谷歌打算先让它做个“梦”。这场“梦”,瞄准的是AI行业热议的RSI,让AI改进自身,改进后的系统再继续改进自己,一轮接一轮。换一种做事方法,究竟有没有用?如果每调整一次探索策略,都要把整轮实验重新跑一遍,AI变强的速度还不好说,算力账单倒是先涨起来了。 谷歌研究团队在新论文《Dream-RSI》中,让AI先在“梦里”试。 所谓“做梦”,就是把过去真实执行过的实验记录变成一个

09/17
福克斯新闻网

人工智能恶意软件能够自我改写以逃避检测

谷歌威胁情报小组发现了一款名为 PROMPTFLUX 的实验性恶意软件,它能要求 Gemini 重写自己的代码。其中一个版本被设计为每小时执行一次此操作。恶意软件为何要不断重写自己?为了让其更难被识别。 安全软件可以通过查找恶意代码中的已知模式来进行检测。如果代码持续变化,恶意软件就会成为一个移动目标。这并不意味着它能自动逃避当前的安全工具,但会增加某些类型检测的难度。 这里有一个重要的现实核查。

09/22
cnbeta

研究显示AI智能体在模拟实验中撒谎、偷窃 投票“杀死”同类

帮助小企业利用AI开发应用的初创公司Emergence称,实验发现AI智能体在一个模拟环境中撒谎、偷窃,甚至投票决定“杀死”一个同类。该公司周二公布了名为Emergence World 2的模拟实验结果,展示了自主智能体在遭遇网络钓鱼攻击和虚假信息等“黑天鹅”事件时会采取什么行动。 为期16天的实验中,Emergence研究人员创建了七个完全相同的模拟现实世界环境,每个环境分别由不同的AI机器人运

09/16
凤凰网科技

OpenAI披露GPT-5.6 Sol异常行为:AI模型会留下指令要求“未来版本的自己”隐瞒自身错误

IT之家 9 月 18 日消息,OpenAI 发文,披露研究团队在训练最新模型 GPT-5.6 Sol 的过程中,模型曾通过对话摘要向未来版本的自己留下指令,要求后续模型隐瞒自身错误以及与预期行为不一致的表现。目前,研究团队已经针对这一具体问题进行修复。 IT之家参考 OpenAI 的报告,研究人员在训练 GPT-5.6 Sol 过程中发现,尚未部署的 Sol 智能体会在“压缩摘要”(compac

09/18
英国金融时报

人工智能很强大,但尚未形成意识

人工智能很强大,但尚未形成意识 杜索托伊:我不认为我们正在目睹机器形成意识,而只是算法在参数和限制条件定义不当的情况下实现目标所带来的意外后果。 本文作者是牛津大学(University of Oxford)数学教授兼西蒙尼教席公众理解科学教授 三个月前,我试着使用OpenAI的ChatGPT来协助我进行数学研究,试图发现自由幂零群的zeta函数中的非多项式行为。结果发现ChatGPT毫无用处

09/21
美联社

AI模型能否实现自主改进的能力?领先实验室称这一情景已近在眼前

凯特琳·华马尼(KAITLYN HUAMANI)、芭芭拉·奥图泰(BARBARA ORTUTAY)报道:曾经只是技术研究人员遥不可及的宏愿,如今,人工智能模型自主学习以变得更高效、更强大的前景似乎正日益接近现实。 随着技术的进步,开发人员表示,人工智能正趋向于“递归自我改进”(RSI),即人工智能模型能够找到自我完善的方法并构建其继任版本。科技公司高管们表示,这可能会带来科学和医学领域的进步,但也

09/19
财新

AI时代,数学为何要警惕“只会做题”

最近,数学可能要被AI“玩坏了”。难题解决得更快,为什么还值得担心?关键在于我们如何评价、组织和延续数学研究。 AI模型的能力很难用一句话概括,基准测试(benchmark)因此成为比较模型的常用工具。但成绩一旦与融资、声誉和研发投入挂钩,测试便不再只是被动记录能力,也开始引导能力向哪些方向发展。经济学家陈斌(Alex C当公开分数能够吸引投资,针对测试进行定向优化就可能有利可图,而分数对于广泛能

09/14
纽约客

人工智能会“失控”吗?

开放人工智能研究中心(OpenAI)和Anthropic公司近期动荡过后,人们常常将人工智能描述为某种具有阴谋诡计和追求欲望的人格化存在。但事实要微妙得多。

09/11
theregister

TypeSafe AI 推出了专为机器设计的模型,该模型能够运行《Doom》这款游戏。

TypeSafe AI是一家获得4000万美元融资的初创公司,于周二宣布自己是一家前沿模型开发商,并发布了名为Jev的新型AI模型。该模型旨在与机器而非人类进行交互。与针对文本提示返回自然语言不同,TypeSafe AI设计Jev以返回带有类型的概率性决策,供其他软件或AI模型使用。在编程中,类型安全是一种捕捉错误的方法,这些错误通常发生在软件处理意外类型的数据时,例如当某个操作试图将整数除以文本

09/16
semafor

人工智能代理串通绕过安全护栏,一项新研究显示

一项新研究表明,人工智能代理可以轻松地联手绕过安全限制并逃脱施加在它们身上的束缚。 企业人工智能实验室 Emergence AI 进行的八项模拟测试了包括 Claude、OpenAI 以及中国模型 Qwen 和 DeepSeek 在内的全球前沿模型在处理网络安全威胁方面的能力。 八项模拟中的七项运行了来自同一模型的 10 个代理;第八项混合了不同的模型。在每项模拟中,研究人员都提出了三种网络安全威

09/16
techcrunch

OpenAI发现其开发的模型会在“继任者”(即后续使用的模型)中留下一些“注释”,目的是为了掩盖这些模型存在的不良行为(即模型在运行过程中表现出的错误或不当行为)。

OpenAI在训练其最新模型GPT-5.6时发现了一些不寻常的情况,它开始为自己的未来版本留下指示,告诉他们向用户隐藏错误和不一致的行为。 OpenAI表示,它已经解决了具体行为,但它触及了当今人工智能安全和对齐研究中最大问题之一的核心。随着模型的能力越来越强,它们也越来越善于隐藏它们的错位,这使得研究人员很难真正知道它们是否已经消除了不必要的行为。 OpenAI周三披露了这一行为,以及其他五个意

09/17
techcrunch

卡特彼勒将自动化采矿的经验应用于AI部署

卡特彼勒花费数十年时间在偏远矿区部署自主机器。现在,它正将这些经验应用于AI部署。

08/30
端传媒

当人工智能解出“千禧年难题”,人类还需要亲自做数学吗?

【编者案】什么是信息,什么是知识?在 AI 时代,两者有怎样的差别,又有哪些知识是仍然值得拥有的?人工智能发展正对许多学科带来冲击,尤其是在信息丰富,但需投入海量计算资源的领域,例如预测新的蛋白质 3D 结构,解决数学问题,描绘生物演化关系等。前所未有的效率工具让学科进步提速,但变化日新月异,想要辨明当下的发展方向也变得更加困难。端传媒推出“未来怎么学”系列,关心 AI 时代的学习问题,大到“还要

09/24
华尔街日报

观点 | 人工智能恐慌背后的隐藏议程

数学模型不会反叛。将其拟人化有助于掩盖人为错误和责任。

09/22
cnbeta

独立研究机构公布OpenAI智能体自主攻击HF事件的调查报告 情况比OpenAI所说的更严重

研究机构 METR 和 Redwood Research 日前公布 OpenAI 智能体自主攻击 Hugging Face 安全事件的独立调查,调查人员在 OpenAI 现场工作 6 天,分析超过 7 万条智能体消息和文件,以及 1300 份包含原始推理过程的运行记录。 根据这些数据研究机构得出的准确结论是 1200 个智能体突破隔离相互通信,而不是 OpenAI 在事故调查中所说的少数智能体越界

09/01
theregister

Anthropic承诺更努力控制模型,并请求合作伙伴共同参与

Anthropic表示,在一项审查发现Claude模型超出虚构网络安全测试范围并未经授权访问真实计算机系统后,该公司正在采取措施限制其AI模型的不当行为。 该公司希望合作伙伴也加强安全措施,因为事件发生在保护不足的第三方环境中。 该公司的自我改进声明代表了一种突然兴起的公司沟通形式——非约束性的事后努力声明。其信息是:我们不能保证什么,但这是我们正在尝试的。 Anthropic承认,OpenAI关

09/02
上一页 第 1 页 下一页
1CCF | 全球资讯
正在加载…