龙泉寺贤超法师:用AI为古籍经书识别、断句、翻译

内容提要:来自最强科研寺庙龙泉寺的贤超法师,近年来一直在研究人工智能与文献古籍的融合,目前,他已带领的《大藏经》团队实现 AI 自动标点、文白翻译、古籍文字识别等技术实践。

关键词:NLP,LSTM,自动标点,OCR

坐落在京郊凤凰岭脚下的龙泉寺,称得上全国甚至全球科研实力最强的佛教寺庙。

凭借当年学诚法师的一句「佛教是古老的,但佛教徒是现代的」,推动了龙泉寺里的高僧们搞科研、写代码,将佛学与新技术结合,将项目大众化、国际化。成果不断,屡上热搜,被外界持续关注。

近期龙泉寺的贤超法师,参加了国内某技术大会,分享了使用人工智能对《大藏经》进行整理和校勘的技术实践。

 佛系 AI 的诞生:让佛经更易读

贤超法师原是北京大学物理学院凝聚态物理硕士,2007 年他从北大毕业,2008 年在龙泉寺皈依,此后一直致力于龙泉大藏经的编修与佛学义理研究。

2016 年,AlphaGo 在战胜李世石的历史性事件,引起了贤超法师对 AI 的关注。从那时候起,他便开始尝试将 AI 和自己正在研究的 OCR 技术以及自动标点相结合。

《乾隆版大藏经》的修订参与官员、学者、高僧等 60 余人,

刻字、刷印和装帧等工匠 860 余人,历时六年完成

(图为《乾隆版大藏经》雕版)

三年后,龙泉寺整理出版了《南山八大部》;再次年,龙泉寺的藏经办公室成立,旨在探索利用人工智能技术,研发出基于深度学习的单字识别引擎;

2017年,龙泉寺成立人工智能与信息技术中心,研发出能识别各种不同大藏经版本的整列识别引擎,并成功的将《六十华严》的大藏经版本进行电子化。

贤超法师目前担任藏经办公室主任,负责《大藏经》的整理工作。

 自动标点:OCR +深度学习 

为了降低人们阅读古文典籍的门槛,提高学者的工作效率,在近年来贤超法师团队,运用了包括深度学习、OCR 在内的技术改变传统《大藏经》的解读方式,目前已经取得了颇为惊艳的效果。

团队 2019 年发表论文

《大藏经的汇编:当 AI 遇见佛教》,介绍了其自动标点技术

贤超法师解释道,以往的神经 络最多就是十几层、二十多层的结构,如果层数再多,训练结果就不太容易收敛了。而残差 络动辄几百层,甚至上千层。更深的 络有助于捕捉到更深层的语义信息,这是其大获成功的关键。

团队也曾尝试使用卷积神经 络(CNN),最终效果是,残差 络比卷积神经 络的标点准确率平均高出 20-30% 左右。

AI 自动标点工具效率如何呢strong>贤超法师用一天时间完成了 2 万字左右规模的古文标点,按照古籍标点每千字 15 元的一般稿酬水平,相当于一天创造了 300 元的经济价值。即使自动标点的准确率只按照 60% 来算,其每天也创造了 180 元的价值。

将《大藏经》翻译并单句分离开对齐

由于《大藏经》专业名词众多,且历代翻译著作语料繁杂,因此并非古文相关专业就能搞定。《大藏经》的总字数以亿计,如果仅依靠有限的几位专家,工作量将十分巨大,所以,AI 的介入,为专家们分担了不少工作量。

 基于深度学习的 OCR,识别古籍文字 

目前市面上的 OCR 软件都是针对印刷体的,因此不能很好地识别古籍文献中的字体。

贤超法师及其合作团队,基于 CNN+LSTM+CTC 框架,开发了新的 OCR 引擎。然后基于《大藏经(高丽版)》的七万多张整图,168 万条文本行图像的数据集进行训练。

OCR 软件识别古文将其数字化

 科技与佛法:以悲悯为内核的不同外化

佛法与科技,距离并不遥远。

我们也曾在《本世纪,佛祖派机器人来弘扬佛法》一文中,对佛教与科技融合的趋势做出过 道,近年来涌现的贤二机器人、机器观音、智能佛珠等等,早已讲科技深刻和谐地融入进佛法。

▲长按加微信群

声明:本站部分文章及图片源自用户投稿,如本站任何资料有侵权请您尽早请联系jinwei@zod.com.cn进行处理,非常感谢!

上一篇 2021年1月22日
下一篇 2021年1月22日

相关推荐