AI破解古文字登Nature封面:修复缺失文字,精确地理位置和书写时间,DeepMind&哈佛&谷歌多家联手开发...

DeepMind与谷歌等机构合作的Ithaca架构,利用Transformer在古文字修复、地理归属和时间定位上取得显著成就,与历史学家合作后,准确率翻倍,成为考古研究新工具。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

博雯 发自 凹非寺
量子位 | 公众号 QbitAI

最新一期的Nature封面,AI再度来到舞台中央,这一次是在破译古文字方面立功了。

这是一种基于Transformer架构的方法,由DeepMind、谷歌、牛津大学等多家研究机构联合开发。

f16422072050e0fe82b87dc846c1e315.png

在单独修复受损文本时,这种方法能达到62%的准确率。

在实际应用中,历史学家单独破译某块古希腊石碑的准确率本来只有25%,但在使用这一方法后一举提升了近乎3倍,达到了72%。

不仅能修复文字,这一方法在地理归属的任务上也有71%的准确率,还能将古文字的书写日期精确到30年以内。

目前,这一方法已经引起了不小的讨论热度:

c202dab042daa81c06235d35fd6046bc.png

现在已经有可以在线解析古希腊文字的网页版,架构方法也已开源。

7f7f12c194d2c0cf344b0a8de82b6474.gif

Transformer破译古文字

这是一个叫做Ithaca的架构,以荷马史诗《奥德赛》中的希腊岛屿命名。

Ithaca架构中的注意力机制能够通过串联输入的单个字符、完整单词的表征与顺序位置来了解输入文本的每一部分的位置,最终权衡不同的输入对模型决策过程的影响。

完整架构由多个Transformer块组成,每个Transformer块都输出一个经过处理的表征序列(Sequence of Processed Representations),其长度即输入字符的数量。

其输入随后被传递给三个分别负责文字修复、地理归属、时间归属的任务头,每个头都由一个前馈的神经网络组成,专门负责各自任务的训练。

a87afecd2ee3b84f0963c26ac921723e.png

在文字修复任务中,Ithaca会提供20个按概率排列的解析结果预测:

d477e2d70401a1f5de9452b12b9da9a7.png

地理归属的确定上,则会依据古历史学中的84个区域中对输入文本进行分类,将可能的区域预测类别通过地图和柱状图展现:

5a910b196ba2b3d84783f13f17349490.png

日期归属任务同样也通过分布预测的柱状图来展示。

如下图所示,公元前300-250年的日期10年一组,被表示为5个概率相同的范围,而公元前305年的铭文将以100%的概率被分配到公元前300-310年的十年组:

8a14a66a8bcd7b9193e02a23166ebc15.png

历史学家的AI助手

研究人员分别将Ithaca与历史学家、同类AI方法Pythia、以及Ithaca与历史学家合作等不同破解古文字的方法做了对比。

字错率(CER)总是越低越好,在文字修复任务上,Ithaca的字错率和准确率都最好,如果与历史学家合作时,效果还将再次提升。

05223448b6b9f4ce21993acef00858db.png

在论文的最后,研究人员表示,研究方法适用于手稿学、钱币学和纸草学等所有与古代文本相关的学科,也适用于古代、现代的任何语言。

目前,这一方法已经投入了实际使用,比如在雅典时期颁布的某个重要法令的碑文的日期确认上,历史学家们之前认为是在公元前446/5年之前书写的。

而Ithaca与历史学家一起,将这一日期更新到了公元前424/3 年:

168c60d07af0db369bc0771bf94c5651.png

Ithaca现在提供了在线试用的途径,登录官网,在方框中中输入古希腊铭文,将缺少的字符标记为破折号(-)),将预测的字符标记为问号(?)。

f7f3f20e70d930554bd424ab5bed3d76.png

每次查询最多可以预测10个连续或非连续的问号,点击查询后将在下方显示文本缺失的字符,并将其归属到原来的地点和时间:

d13285ecaf791669922a3930bff45a72.png

作者介绍

研究由DeepMind、威尼斯卡福斯卡里大学(Ca’ Foscari University of Venice)、哈佛大学、雅典经商大学 (Athens University of Economics and Business)、谷歌几家AI团队合作开发。

论文有两位共同一作,其中annis Assael为DeepMind的AI部门的研究员,硕博都毕业于牛津大学,同时也是福布斯“30岁以下30名欧洲杰出科学家”之一:

d5ca1727511612c2b156900f38ad7272.png

共同一作Thea Sommerschield则是一位历史学家,目前任威尼斯佛斯卡里大学的人文科学院,以及哈佛大学希腊研究中心的研究员,主要研究领域是将机器学习应用于研究古代地中海的书面文化。

3dc6eb1305935b31c3a8fe73723b7ae1.png

论文:
https://www.nature.com/articles/s41586-022-04448-z

开源链接:
https://github.com/DeepMind/ithaca

在线试用:
https://ithaca.DeepMind.com/?job=eyJyZXF1ZXN0SUQiOiJmYzUwNGY0NWNhZjJjZWMxZjIxZDA4YWVjNTdkMjEzMSIsImF0dHJpYnV0aW9uIjp0cnVlLCJyZXN0b3JhdGlvbiI6dHJ1ZX0%3D

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值