关于通假字资源库
古籍文本中的文字通假现象较为常见,这为准确理解文意造成了困难。正如清代学者王引之在《经义述闻·经文假借》中所述:“学者改本字读之,则怡然理顺;依借字解之,则以文害辞。”通假字资源库由北京师范大学科研团队构建,获第二十二届中国计算语言学大会(CCL 2023)最佳中文论文奖。旨在破假字纷繁之扰,寻正字本来之容,为文言文教学、古籍整理和计算机语言学研究提供基础性资源。
研发团队与学术发表
研究团队:北京师范大学
主要作者:王兆基(Zhaoji Wang)、张诗睿(Shirui Zhang)、张学涛(Xuetao Zhang)、胡韧奋(Renfen Hu,通信作者)
学术荣誉:第二十二届中国计算语言学大会(CCL 2023)最佳中文论文奖(Best Paper Award)
项目资助:国家语委重大项目“古籍整理智能化关键技术研究”(ZDA145-9)、国家自然科学基金青年项目“面向古籍整理智能化的知识表示与加工研究”(62006021)、北京市社科重点项目“古典文献的智能化分析与关联技术研究”(21DTR037)。特别鸣谢:李隽琪、陈青、孟琢等师友。
子库架构与数据规模
收录 11,000 余条包含通假现象标注的文献语料,以《汉语大词典》等为主要数据来源,包含字符位置、文献出处、历史朝代、释义及反切古音。
以汉字为节点,通假和形声关系为边,从字音、字形、字义多个角度对通假字与正字的属性进行加工,收录 4,248 个通假字、8,009 条通假关系与 657 条形声构形关系(共计 8,666 条知识图谱关联)。
面向古汉语信息处理需求,支持通假字检测和正字识别两个子任务的评测,分为基础版与拓展版,收录评测数据 19,678 条,并提供完整的系列基线评测模型。
核心术语与使用规范说明
为保持古汉语语言文字学的学术严谨性,本平台在数据组织与文字说明中严格遵循以下专业用语规范:
开放数据与接口说明
Swagger UI 文档 →提供遵循 RESTful 规范的无鉴权、高性能只读 JSON API,核心端点包括:
