詹姆斯·波拉德(纽约)——盖茨基金会正在召集Anthropic、谷歌、OpenAI基金会以及数十家其他机构,共同推动人工智能技术以更多语言形式被更多人使用。根据周一发布的公告,这些合作伙伴总共有60家,其中包括前沿的人工智能研究机构、企业及慈善组织。他们都在致力于扩大人工智能工具所支持的语言种类,盖茨基金会认为这有助于缓解全球不平等现象。该联盟希望通过更好地协调各方资源,在五年内帮助超过30亿人受益于人工智能技术。
盖茨基金会首席执行官马克·苏兹曼表示,这项工作必须“全速推进”。他指出,尽管一些大型人工智能公司呼吁业界放慢先进模型的研发速度,但政府仍需对人工智能技术可能对网络安全或儿童发展产生的影响进行监管,并将人工智能的人道主义应用扩展到那些目前无法接触该技术的贫困社区。
苏兹曼对美联社表示:“即使现在人工智能技术的发展被立即停止(我认为这种情况不会发生,也不主张这样做),我们仍应继续构建相应的语言数据集,并确保这些数据能够通过现有的工具被有效利用。”
此次合作是基于上周发布的《Goalkeepers报告》提出的。该报告指出,盖茨基金会已承诺投入10亿美元用于推动人工智能技术在改善全球健康状况、升级教育工具以及帮助小农户方面的应用。报告警告称,如果语言数据不全面或不准确,人工智能模型可能会误译某些语言信息——例如,马拉维孕妇用当地语言表达“我的羊水破了”时,系统可能会将其错误地翻译成“我把水扔掉了”。
“根本问题在于:许多人工智能工具都是利用从互联网上抓取的语言数据来进行训练的,”Mozilla Data Collective的首席执行官E.M. Lewis-Jong指出。她的公司最初由Mozilla基金会孵化,如今已成为非营利组织Mozilla.org的子公司。这个数据共享平台旨在帮助各社区按照自己的意愿上传文化和语言数据集,而不是在未经他们明确同意的情况下将这些数据从互联网上提取。
“互联网本身并不是一个具有代表性的样本集,”她说道,“既然这些人工智能工具主要使用Reddit上的数据来进行训练,又怎么可能产生一个文化多样且具有代表性的系统呢?”Suzman表示,该联盟的治理结构等细节仍在讨论中。一个秘书处将负责监督各成员的承诺履行情况;必要时,盖茨基金会可能会推动合作伙伴填补数据收集方面的空白。
作为该联盟的成员之一,谷歌一直在资助一项旨在收集印度各地超过15万小时语音数据的项目。该项目被称为“Project Vaani”,谷歌高级副总裁James Manyika表示,这一项目强调了收集语言内部不同方言的语音数据的必要性。为此,谷歌正与当地合作伙伴合作,在实地进行语音录制工作。
Anthropic公司的首席执行官曾发表文章,呼吁整个行业加强合作以减缓人工智能技术的快速发展。该公司此前已与Mozilla基金会合作,致力于加速疫苗的研发工作,并扩充其聊天机器人的相关数据集(尤其是关于当地农作物的数据)。Anthropic公司负责推动产品实际应用工作的Elizabeth Kelly承认:“在许多非洲语言方面,我们的产品确实存在不足。我们非常清楚:除非我们能够解决语言数据的问题,否则就无法实现改善患者治疗结果、提升全球学生读写能力和计算能力的目标。”
美联社关于慈善事业和非营利组织的报道得到了《The Conversation US》的支持,相关资金由 Lilly Endowment Inc. 提供。美联社对所有慈善相关内容的发布与编辑工作完全由自己负责。如需查看美联社的全部慈善报道,请访问其官方网站的“philanthropy”板块。