3000个甲骨文未释字有了新解法:AlphaOracle首次把人类专家的三步考据流程塞进了AI
一个甲骨文字,悬赏10万元——中国文字博物馆2016年开出的价码,九年过去,拿到奖金的人一只手数得过来。不是没人试,而是甲骨文释读的难度远超常人想象:4500个已知字形中,可靠释读的不到1500个,剩下约3000个未释字,每一个都意味着在十几万片甲骨拓片、青铜器铭文、战国简帛和传世文献之间反复交叉比对,一轮查证常常耗费数日。
这个局面可能即将改变。华中科技大学联合华南理工大学、安阳师范学院的研究团队,在《The Innovation》期刊上公布了AlphaOracle——一个不走"看图识字"捷径、而是老老实实模仿人类古文字专家三步工作流的AI系统。它的释读路径和甲骨文学者一模一样:先辨字形,再查辞例,最后以古籍和论文交叉验证。每给出一个答案,系统必须同步附上出处、候选方案和置信度,方便专家逐条复核——不是替代学者,而是替学者扛下那数日翻检查证的苦活。
3000个未释字:甲骨文破译为何如此艰难
甲骨文诞生于商代晚期,距今已有三千多年历史,是现代汉字的直系祖先。已发掘的超过15万片甲骨上保留了至少4500个不同字形,但其中得到较可靠释读的仅有约1500个。剩下约3000个未释字,每一个都是硬骨头。
传统释读高度依赖极少数专家在字形学、训诂学、文献学等多学科间的交叉判断。证据散落在不同年代的甲骨拓片、青铜器铭文、战国简帛、小篆字形和传世文献中,没有统一数据库,没有标准化流程,完全依靠学者个人的学术积累。这样的释读方式不仅效率极低,而且难以规模化、难以复现。
此前也有一些AI研究尝试借助深度学习模型辅助甲骨文考释,但它们大多停留在看图识字阶段:仅凭字形视觉相似度提出候选答案,缺少辞例与文献的相互印证,对未释字的帮助十分有限,难以让古文字学家真正采用。
AlphaOracle的三步释读流程
AlphaOracle的核心创新在于,它不是简单地用深度学习做图像匹配,而是完整模拟了人类专家从拓片解析到文字考释的全流程。
第 一步,拓片解析。系统先对输入的甲骨拓片进行字符检测、分类和句子重建。检测模型定位每个甲骨文字符,分类器辨认已释字,将有争议的未释字交由后续模块处理。随后,系统利用图神经网络结合空间信息,判断句子的起点、终点和字符之间的连接关系,恢复阅读顺序。
第二步,形态分析。系统从历时演变与内部结构两个方向为未释字提出多个候选释读。字形演变网络利用扩散模型模拟甲骨字形向金文、战国文字、小篆等后世形体的变化路径,并对多次生成结果进行识别和汇总。部件演变网络则拆解甲骨字形中的构件,映射为汉字的IDS序列,根据部件组合推测对应的后代汉字。
第三步,语境对齐与文献校验。系统将形态分析提出的候选释读放入大规模甲骨卜辞语料库中考察其语义合理性和分布规律,最后查阅传世古籍与现代学术研究,寻找支持或质疑的证据,形成完整的证据链。
每一步均附有出处、候选答案和置信度评分,方便专家逐条复核。AlphaOracle的目标不是替代学者,而是把研究者从数日的翻检查证中解放出来,让他们将精力集中在最需要学术判断的关键环节。
AI介入人文学科的新范式
AlphaOracle的发布恰逢AI在数学和自然科学领域接连取得突破的历史时刻。但与Astra解数学题不同,甲骨文释读是一个横跨考古学、古文字学、历史学和语言学的综合性人文学科问题。
华中科技大学团队表示,AlphaOracle的论文已被《The Innovation》接收,完整代码已在GitHub开源,并提供在线Demo供学者试用。项目得到了国家自然科学基金等多个渠道的支持。
已发现的甲骨碎片超过15万片,数以千计的未释字中隐藏着商王朝的战争、农事、疾病、祭祀、天象和日常决策。AlphaOracle的出现,意味着这些沉睡三千年的信息有望以更快的速度被唤醒。
中国文字博物馆曾在2016年发布悬赏公告:破译一个未释读甲骨文单字奖励10万元。如今,AI可能成为那个最高效的释读者——但最终盖上学术印章的,仍然是人。