评测基准与数据下载
针对文言文献通假现象对机器理解古汉语造成的障碍,本资源库构建了面向古汉语自然语言处理的标准评测基准,并提供论文客观基线实验结果与在线样本查检;全量语料库、知识库与评测集开源数据均提供校验哈希与标准学术引用说明。
评测任务设计与数据分布
判断文言语句中是否包含通假现象,并输出通假字在文本中的位置标签。
在已知通假字位置的前提下,结合上下文语境预测其所对应的正字。
基线模型客观评测结果(摘自论文表 5、6、7)
| 模型 | 模型类型 | 精确率 (Precision) | 召回率 (Recall) | F1 值 |
|---|---|---|---|---|
| DaizhigeBigram (2-gram) | 统计语言模型 | 7.55% | 22.26% | 11.27% |
| SikuBigram (2-gram) | 统计语言模型 | 9.21% | 18.52% | 12.30% |
| DaizhigeTrigram (3-gram) | 统计语言模型 | 7.56% | 18.62% | 10.75% |
| SikuTrigram (3-gram) | 统计语言模型 | 10.00% | 11.80% | 10.83% |
| DaizhigeGPT2 | 预训练生成模型 | 8.59% | 22.74% | 12.47% |
| SikuGPT2 | 预训练生成模型 | 10.84% | 17.47% | 13.38% |
| DaizhigeBERT | 预训练掩码模型 | 20.24% | 55.28% | 29.63% |
| SikuBERT | 预训练掩码模型 | 29.09% | 57.49% | 38.63% |
| TongjiaziDetectionDaizhigeBERT | 本研究微调模型 | 65.02% | 64.40% | 64.71% |
| TongjiaziDetectionSikuBERT | 本研究微调模型 | 64.25% | 69.87% | 66.94% |
| TongjiaziDetectionSikuBERT (无混淆集) | 本研究微调模型 | 61.96% | 70.35% | 65.89% |
| 模型 | 测试设定 | 精确率 (Precision) | 召回率 (Recall) | F1 值 |
|---|---|---|---|---|
| TongjiaziDetectionDaizhigeBERT (无混淆集) | 未登录通假字检测 | 32.94% | 16.10% | 21.63% |
| TongjiaziDetectionSikuBERT (无混淆集) | 未登录通假字检测 | 29.48% | 16.53% | 21.18% |
| 模型 | 基础版准确率 (Based Acc) | 拓展版准确率 (Extended Acc) |
|---|---|---|
| DaizhigeBigram (2-gram) | 34.55% | 13.18% |
| SikuBigram (2-gram) | 40.69% | 14.31% |
| DaizhigeTrigram (3-gram) | 33.11% | 11.38% |
| SikuTrigram (3-gram) | 30.71% | 9.93% |
| DaizhigeGPT2 | 40.79% | 13.99% |
| SikuGPT2 | 43.38% | 14.78% |
| DaizhigeBERT | 35.22% | 12.97% |
| SikuBERT | 42.32% | 14.90% |
| ZhengziRecognitionDaizhigeBERT | 65.64% | 19.88% |
| ZhengziRecognitionSikuBERT | 61.61% | 18.96% |
评测数据集全量检索与在线浏览
收录论文 4 个子任务共 23,935 条标准评测样本,支持关键词长句匹配、自定义分页与单条评测数据 JSON 结构查检。
微臣呵,寸心赤,只有吾皇鑒昭。
子既若是矣,猶與堯争善。
嶺南之葆愛族制,其始亦以分北俚繇,久則氾濫及同種。
訛謬相承,亡復辯訂。
俞者,然也。然其所請也。
虚氣浮響,雜然並作。
臣聞玉不隱瑕,臣不隱情。伏知所進非和氏之璞。
倐爍夕星流,昱奕朝露團。
悍酋乘城,殺傷士甚衆,忠嗣怒,募射者,晟挾一矢殪之,三軍讙奮。
善聽嚮言者,莫如聖人。有瞻言之聖人,言從作乂,而天下無嚮言之咎矣。
开源数据下载
与 GitHub 仓库 frederick-wang/tongjiazi-resources 保持完全一致的三个数据包
BEIJING_NORMAL_UNIVERSITY通假字标注语料库压缩包(内含 corpus.jsonl),收录详加训诂与字音标注的传世典籍文言通假语句。
通假字知识库压缩包,以汉字为节点、通假与形声关系为边,涵盖构形、读音及文献关联数据。
通假字识别评测集压缩包,涵盖通假字检测与正字识别两个核心任务的基础版与拓展版标准测试集。
数据与研究规范引用 (Citation Requirement)
若在学术论文、论著、语言模型评测、字词知识图谱或数字人文研究中使用了本资源库的语料、知识库或评测集,请按国家标准或学科权威规范注明以下文献出处:
王兆基, 张诗睿, 胡韧奋, 等. 古汉语通假字资源库的构建及应用研究[J]. 中文信息学报, 2024, 38(3): 152-162.
王兆基, 张诗睿, 胡韧奋, 张学涛, 2024. 古汉语通假字资源库的构建及应用研究[J]. 中文信息学报, 38(3): 152-162.
@article{wang-etal-2024-tongjiazi,
title = {古汉语通假字资源库的构建及应用研究},
author = {王兆基 and 张诗睿 and 胡韧奋 and 张学涛},
journal = {中文信息学报},
volume = {38},
number = {3},
pages = {152--162},
year = {2024}
}王兆基, 张诗睿, 胡韧奋 & 张学涛. (2024). 古汉语通假字资源库的构建及应用研究. 中文信息学报, 38(3), 152-162.
王兆基, 等. "古汉语通假字资源库的构建及应用研究." 中文信息学报 38.3 (2024): 152-162.
王兆基, 张诗睿, 胡韧奋, 张学涛. 2024. "古汉语通假字资源库的构建及应用研究." 中文信息学报 38 (3): 152–162.
%0 Journal Article %T 古汉语通假字资源库的构建及应用研究 %A 王兆基 %A 张诗睿 %A 胡韧奋 %A 张学涛 %J 中文信息学报 %D 2024 %V 38 %N 3 %P 152-162
