关于通假字资源库

古籍文本中的文字通假现象较为常见,这为准确理解文意造成了困难。正如清代学者王引之在《经义述闻·经文假借》中所述:“学者改本字读之,则怡然理顺;依借字解之,则以文害辞。”通假字资源库由北京师范大学科研团队构建,获第二十二届中国计算语言学大会(CCL 2023)最佳中文论文奖。旨在破假字纷繁之扰,寻正字本来之容,为文言文教学、古籍整理和计算机语言学研究提供基础性资源。

研发团队与学术发表

研究团队:北京师范大学

主要作者:王兆基(Zhaoji Wang)、张诗睿(Shirui Zhang)、张学涛(Xuetao Zhang)、胡韧奋(Renfen Hu,通信作者)

学术荣誉:第二十二届中国计算语言学大会(CCL 2023)最佳中文论文奖(Best Paper Award)

项目资助:国家语委重大项目“古籍整理智能化关键技术研究”(ZDA145-9)、国家自然科学基金青年项目“面向古籍整理智能化的知识表示与加工研究”(62006021)、北京市社科重点项目“古典文献的智能化分析与关联技术研究”(21DTR037)。特别鸣谢:李隽琪、陈青、孟琢等师友。

引用指引:
期刊论文:王兆基, 张诗睿, 胡韧奋, 张学涛. 古汉语通假字资源库的构建及应用研究[J]. 中文信息学报, 2024, 38(3): 152-162.
会议论文:Zhaoji Wang, Shirui Zhang, Xuetao Zhang, and Renfen Hu. 2023. The Construction and Application of an Ancient Chinese Language Resource on Tongjiazi. In Proceedings of the 22nd Chinese National Conference on Computational Linguistics (CCL 2023), pages 535–546.

子库架构与数据规模

通假字标注语料库

收录 11,000 余条包含通假现象标注的文献语料,以《汉语大词典》等为主要数据来源,包含字符位置、文献出处、历史朝代、释义及反切古音。

通假字知识库

以汉字为节点,通假和形声关系为边,从字音、字形、字义多个角度对通假字与正字的属性进行加工,收录 4,248 个通假字、8,009 条通假关系与 657 条形声构形关系(共计 8,666 条知识图谱关联)。

通假字识别评测集

面向古汉语信息处理需求,支持通假字检测和正字识别两个子任务的评测,分为基础版与拓展版,收录评测数据 19,678 条,并提供完整的系列基线评测模型。

核心术语与使用规范说明

为保持古汉语语言文字学的学术严谨性,本平台在数据组织与文字说明中严格遵循以下专业用语规范:

通假字(Tongjiazi)
古籍文言文本中借用同音或音近字代替正字的用字现象。
说明:通假字属于古籍文本历史用字现象,不同于现代书写错误或别字,也不等同于六书造字法中的假借造字。
正字(Zhengzi)
通假字在具体文言语境中所代表或替代的规范字。资源库中严格采用“正字”标识被通假字。
通假关系(Tongjia Relation)
从通假字指向正字的有向对应关联(通假字 → 正字),附带中古读音、注音、释义及典籍例句。
声旁(Phonetic Component)与形声关系
形声字中表音的构形部件,及其与整字之间的同声符字群关联。

开放数据与接口说明

Swagger UI 文档 →

提供遵循 RESTful 规范的无鉴权、高性能只读 JSON API,核心端点包括:

GET /healthz — 服务健康探针
GET /api/v1/meta — 全站统计摘要
GET /api/v1/zi/:glyph — 通假字综合详情(支持繁简重定向)
GET /api/v1/tongjia/:from/:to — 通假关系、释义、读音资料与引证
GET /api/v1/corpus/:id — 语料详情与标注位置
GET /api/v1/graph/neighborhood?glyph=说&depth=1 — 局部通假邻域图谱
GET /api/v1/graph/connected-component?glyph=说 — 关联汉字字群子网
GET /api/v1/graph/shortest-path?from=说&to=脱 — 两字系联流变最短路径
POST /api/v1/detector/jobs — 提交通假字 AI 识别任务
问题反馈与建议邮箱:zhaoji.wang@mail.bnu.edu.cn
通信作者邮箱:irishu@bnu.edu.cn