亚马逊网络服务(AWS)已正式进入开源代理式人工智能(AI)领域,其新推出的 Strands 工具在各项基准测试中表现出色,且使用的计算资源(即“令牌”)比竞争对手少约四分之一。顾名思义,Strands 工具是基于 AWS 自家的 Strands SDK 开发的,但已被封装成可直接使用的软件包,用户可以将其部署在本地,或与任何他们选择的 AI 服务提供商配合使用。AWS 在其官方声明中表示:“一旦你自行开发了代理程序,你就需要独立应对所有相关的技术细节了;如何巧妙地配置各种组件以让系统‘正常运行’,其实是一件相当复杂的事情。” AWS 还补充说:“使用这个开源工具,你只需要编写一行 Python 或 TypeScript 代码,就能将其与自己选择的模型集成起来。” 除了设计上具有高度的‘即插即用’特性外,AWS 还声称:在通过 Harbor 框架(该框架部署在 AWS 的 EC2 虚拟服务器上)进行的基准测试中,Strands 的性能几乎与 Claude Code、Codex 以及其他流行的 AI 工具相当。AWS 表示,在六项基准测试中,Strands 使用的计算资源比 Claude 或 GPT 模型少了 28%;在某些测试场景下,其准确率甚至优于其他工具。虽然 DeepSeek 的工具在资源利用效率上更胜一筹,但在相同测试中的准确率较低。AWS 将这一优异表现归功于 Strands 工具的默认提示缓存和上下文管理机制:该工具会自动截断超过 1,500 个令牌长度的输入内容,当上下文数据量超过 85% 时自动压缩数据,并在数据溢出时尝试恢复相关信息。
值得一提的是,AWS将Strands harness描述为“通用代理而非编码代理”。考虑到AWS基准测试中与其相比较的所有代理工具(Claude Code、Codex、oh-my-pi、OpenCode和DeepSeek Harness)都被称为编码代理,因此值得怀疑其他通用AI代理在与新的Strands harness进行比较时将会表现如何。亚马逊计划发布其研究人员撰写的论文,其中包含更多基准测试细节——我们将密切关注更多关于其评估方法的具体信息。在此期间,任何希望尝试预打包的开源通用Strands harness的人都可以通过公告帖中包含的说明进行操作。它以Python或TypeScript库的形式提供,并带有CLI。它还附带一个技能文件,因此插入您自己首选的工具应该相对容易;在启动时已包含shell、文件和网页工具。AWS表示:“我们认为使用‘附带电池’的harness快速进行原型设计将创建更有用的代理。”它已正式上线,因此如果您正在寻找另一个开源选项,它已准备就绪,尽管目前缺乏更独立的性能评估。®