在数字化浪潮的冲击下,纳西族东巴文这一被誉为人类文字演化“活化石”的古老符号,正经历一场前所未有的技术变革。当人们以简单的线条勾勒出“人”的形态时,东巴文中圆头竖身、四肢舒展的独特字形,不仅展现了艺术的美感,更揭示了人类早期书写系统的演化逻辑。然而,这些珍贵的文化瑰宝正面临严峻的生存危机。据估算,全球现存的三万余卷东巴文古籍中,竟有至少一万四千卷沉睡于海外图书馆,无人问津。与此同时,贵州水族的水书文献虽有两万余册原件存世,但能读懂者仅剩四百余人;四川美姑县的古彝文研究者不足两千人,其中高水平专家更是屈指可数。这种“养在深闺”的困境,使得大量历史印记面临失传风险。
面对这一挑战,2024年7月正式实施的《中华人民共和国民族团结进步促进法》为民族语言文字的标准化、信息化建设提供了法律支撑,明确支持少数民族古籍的保护与利用。在此背景下,人工智能技术被视为破解古籍释读难题的关键钥匙。中央民族大学信息工程学院教授毕晓君指出,民族古籍的解读难度远超汉字,其非线性排版、复杂的上下文省略以及独特的文字组合规则,使得即便认识单字,也难以理解整句乃至整段含义。若无法有效解读,未来在文化话语权上我们将处于被动地位。
为攻克低资源语言处理的技术瓶颈,科研团队采取了“数据先行”的策略。针对民族古籍字形相似、保存状态不佳等问题,课题组组织学生仿写标准化字典,构建了包含44.5万张图像的单字数据集,覆盖2546个基础字符。该数据集于2023年向社会公开,并依托其搭建的智能分析系统,将东巴文单字识别准确率提升至99.34%,已服务于35家高校及科研机构。此外,清华大学博士后李硕团队构建了包含18.9万条平行句对的多民族古籍语料库,通过段落级、句子级及单字级的多层标注,解决了语义理解难题。结合多模态大模型的段落级语义增强策略与自定义文本分隔符技术,机器翻译效果显著改善,相关技术路线也已拓展至缅甸语、泰语等南亚东南亚语言研究。
技术突破不仅限于工具层面,更引发了学术界的深层思考。国际学界长期争议东巴文是否为成熟文字系统,而通过数据挖掘,研究人员发现“日”与“桶”稳定指向“东方”,“绿松石”与“月”象征“灵魂”等词组规律。这一发现证明,纳西先民早已通过字符组合建立起规范的文字与语言对应关系,能够表达复杂抽象概念,从而为界定东巴文的成熟属性提供了关键实证。目前,国务院公布的《国家珍贵古籍名录》中收录的1133部少数民族古籍,正从单纯的文字识别走向内容挖掘与文明研究,重新进入学术视野。毕晓君强调,让沉睡的古籍变得可读、可研、可用,不仅是AI技术的应用探索,更是数智时代铸牢中华民族共同体意识、保护文化遗产的重要路径。
暂无评论,快来抢沙发吧!