星空(中国)xingkong-人工智能或可唤醒“沉睡”的文化宝藏 发布时间:2026-08-27 17:37:59

图① 云南丽江白沙古镇古建群围墙上的东巴文壁画。

图② 中心平易近族年夜学平易近族博物馆展出的东巴文手手本。

图③ 中国文字博物馆展厅内展示的丽江东巴文化黉舍教材和纳西象形文字。视觉中国供图

此刻,请你画一个小人,你会起首想到画个“洋火人”吗?一个圆作头,一条竖作身,四条斜线作为四肢……恭喜你,你写出了一个我国纳西族东巴文中的“人”字。

东巴文异体千形、句法矫捷,被誉为研究人类文字发源与书写体系演化的“活化石”。但如今,因为专家稀缺、文献数目重大、部门文字已经再也不广泛利用,很多东巴文、古彝文、水书、回鹘文等平易近族文字文献正面对无人能读懂的境界,国内外年夜量古籍文献已经是“养于深闺无人识”。

本年7月,《中华人平易近共及国平易近族连合前进促成法》正式实行,明确提出鞭策少数平易近族语言文字的规范化、尺度化及信息化设置装备摆设,撑持少数平易近族古籍的掩护、收拾、研究及使用。怎样急救掩护我国辉煌光耀富厚的多平易近族语言文字,挖掘平易近族古籍中各平易近族来往、交流、融合的汗青印记?针对于这些问题,人工智能技能可能会带来全新的解题思绪。

很多少数平易近族文字没法直译

假如拿出一卷无人研读过的东巴文古籍,咱们可否像释读汉字古籍同样对于其举行释读?

谜底是不克不及。“很多平易近族文字没法逐字直译。文字组合法则、上下文省略表达、非线性排版挨次,城市年夜幅晋升总体语义的理解难度。简朴来讲,即便熟悉单字,也很难读懂整句、整段的寄义。”中心平易近族年夜学信息工程学院传授、平易近族语言智能阐发与安全管理教诲部重点试验室主任毕晓君说。

文化掉传不是一刹时的事,但它现在正于发生。全球现存东巴文古籍3万余卷,此中至少1.4万卷封存在海外藏书楼,无人问津;水书是我国水族独占的文字,重要通行在贵州省黔南州,本地存有水书文献文籍原件共1.9万余册,而2022年建档于册能读懂水书的人仅466名;于被誉为彝族毕摩之乡的四川省美姑县,能读懂古彝文的人不足2000人,此中高程度研究者更是不足20人……

“假如咱们没有能力解读这些平易近族古籍文献,将来属在咱们本身的文化话语权,就会拱手让人。”深耕人工智能近二十年的毕晓君,但愿本身的课题组能使用人工智能技能鞭策少数平易近族文字古籍的辨认、修复、释读及翻译。

“语言学家擅长文本研读与文化研究,而咱们作为技能研究者,可经由过程及语言学专家的深度交流与互助,得到有用的语言数据来练习AI模子。如许就能够让呆板读懂、辨认平易近族文字。”毕晓君告诉科技日报记者,于平易近族文字掩护使用中,人文研究提供了问题意识、文献依据及注释框架,而人工智能则提供了图象修复、文字辨认及呆板翻译等技能手腕。两者相辅相成,深度交融。

霸占低资源语言处置惩罚技能难题

看懂古籍,先要看懂文字。想要让人工智能识字,高质量、尺度化的数据集必不成少。虽然预练习技能于汉语、英语等通用语言范畴已经取患上成熟结果,但全世界现存的7000余种语言中,超6500种语言犹如东巴文一般,存于可用数据稀缺、标注语料匮乏、专用场理东西缺掉的共性问题。这种语言被界说为低资源语言,其智能处置惩罚技能持久处在空缺状况。

“从零最先做数据集,面对着文字形态高度相似与文本生存状况欠安的两重挑战。”课题构成员、山西电子科技学院信息与通讯工程学院讲师骆彦龙说。

一方面,平易近族古籍中存于年夜量字形高度相似的字符。怎样搭建具有强局部特性提取能力的收集模子,同时完备保留全局语义信息,晋升文字总体辨认正确率,是共性技能难题。另外一方面,很多古籍年月长远,部门书写介质为树皮纸、树叶纸,遍及存于文字残破、画面恍惚、页面破损等问题,需要修复优化。

对于此,课题组联合东巴文怪异的书写特性,构造学生仿写尺度化东巴文字典,构建了年夜范围单字数据集,同时经由过程图象预处置惩罚技能优化数据质量,年夜幅晋升东巴文单字辨认精度。于古籍图象修复方面,课题组先对于残破文字举行开端粗修复,再从自建的尺度字库中匹配候选文字,联合上下文语义交织验证,显著晋升了修复成果的正确性与可托度。

2023年,课题组面向全社会公然手写东巴文单字数据集DB1404。该数据集包罗44.5万张东巴文单字图象,笼罩2546个东巴基础单字。依托这一数据集,课题组搭建了东巴文智能阐发治理体系。今朝,该体系的文字辨认正确率达99.34%,已经有35家高校、科研单元申请利用。

字看懂了,人工智能要怎么理解句子?平易近族古籍智能阐发不克不及逗留于“认字”层面,必需进一步解决语义理解及呆板翻译问题。

东巴文持久被认为是一种弱语法、弱语义的文字体系,没有标点符号,缺少明确句式、句型及词组,甚至没有明确的浏览挨次,句子中经常呈现指代及省略。“好比说,你去那里,找那谁,拿那啥,这些代称可能散落于上下文的差别语句中,单看一个句子是看不懂的。”中心平易近族年夜学博士孙梓玮说。

解题之道一样是数据先行。缭绕语义理解,课题构成员、清华年夜学计较机系博士后李硕等人构建了多平易近族古籍平行语料库。团队经由过程数据标注得到18.9万条东巴古籍平行句对于,包罗东巴单字146.9万字,完成段落级、句子级及单字级的多层标注,构建起可支撑呆板翻译及内容挖掘的语料资源。

数据系统搭建完成后,怎样让人工智能精准输出通顺、正确的汉语译文,成为新的技能瓶颈。跟着人工智能天然语言处置惩罚技能的飞速迭代,2025年12月,李硕等人依托多模态年夜模子,经由过程引入段落级语义加强、智能句子组合计谋、自界说文天职隔符设计,让东巴文智能阐发治理体系对于东巴文的翻译效果显著晋升。

这一研究思绪也为其他低资源语言或者古文字质料的研究提供了可借鉴的要领线路。今朝,古彝文、水书、满文、回鹘文等多平易近族文字古籍的智能阐发研究均于稳步推进。中心平易近族年夜学博士韩璐牵头构建的年夜型水书单字数据集S_842已经面向全社会公然。

为平易近族文化研究提供东西

人工智能不仅能掩护平易近族古籍,更为平易近族文化研究提供了全新东西。

国际学界对于东巴文是纯真符号系统还有是成熟文字体系争议已经久。课题组于研究中提出一个新的思绪:东巴文毕竟是自己不存于固定词组系统,还有是传统人工研究未能挖掘出对于应的词组纪律?

“咱们经由过程数据挖掘,从东巴文古籍中筛选出一批不变呈现、语义一致的词组。好比,‘日’及‘桶’不变表达‘东方’的意思,‘绿松石’及‘月’不变表达‘魂灵’的意思,这些两个或者多个字的组合于东巴文古籍中重复呈现,其语义不是两个单字意义的简朴叠加。”中心平易近族年夜学信息工程学院讲师乔伟征先容,这象征着早于千年前,纳西先平易近就已经经由过程象形符号的组合,成立起文字与语言体系规范、不变的对于应瓜葛,可以或许经由过程字符组合表达繁杂抽象观点。

该研究成果为界定东巴文的成熟文字体系属性提供了要害实证,有用回应了国际学界的持久争议,为人类文字发源及书写演化研究提供了新的证据。

我国平易近族多、语言多、文字多。千百年来,各平易近族一体齐心,配合创造了辉煌光耀的中汉文化。55个少数平易近族中,除了回族、满族通用汉语外,其余53个平易近族共利用28种文字及72种语言,此中22个平易近族有本身的文字。

各平易近族运用本身平易近族的语言文字,堆集了卷帙众多的古籍文献。中华平易近族多元一体的成长汗青,不仅记录于“二十四史”等华文古籍中,也记录于《西南彝志》等少数平易近族古籍里。国务院宣布的六批《国度贵重古籍名录》中,共收录少数平易近族古籍1133部。

这些贵重古籍承载着各平易近族对于天然、宇宙、人文社会的古老认知,记载着各平易近族配合开拓广宽边境、来往交流融合的成长过程,是筑牢中华平易近族共有精力家园的主要文化资源。

跟着数据集及语料库的不停完美,相干研究正于从文字辨认及呆板翻译进一步走向内容理解、常识挖掘与文明研究,年夜量尘封于国内外馆藏机构、持久未被释读的平易近族古籍,从头进入学术研究视线。同时,这套低资源语言处置惩罚计谋,已经慢慢运用在缅甸语、泰语等南亚东南亚语言研究,为跨境经贸交流、人文互通往来、跨国文化研究搭建技能桥梁。

“开展多平易近族古籍文献智能阐发与呆板翻译研究,不仅是AI技能于低资源语言场景中的运用摸索,让甜睡的平易近族古籍可读、可研、可用,更是数智时代掩护、激活及阐释中华平易近族文化遗产,铸牢中华平易近族配合体意识的主要路径。”毕晓君如是说。(记者 陈可轩)

-星空(中国)xingkong