Automatic_Assessment_of_Japanese_Text_Readability

主要内容

这是一篇关于16年发表的日语文本可读性估计的文章,文章思路与结构都很简单,主要介绍了一下三方面的工作,

  • 构建日语可读性语料库
  • 网络上不能断词与断句文本可读性评估
  • 一个实现的简易版的可读性分析器

这篇文章的评估算法很简单,仍然是传统应用于机器学习的语言概率模型,但我觉得之所以他可以发表,在于一个详细的可读性语料库构建思路的详细阐述,而方法只是对这个语料库有效性的验证。

构建日语可读性语料库

分两个步骤:

1. 搜集除英文之外的全部科目的日语教科书,从小学一年级至高中三年级,由于教科书是由教育局编撰发布的,因此可读性必然与各阶段的学生相适应
2. 第二步便是利用OCR技术将课本图片识别成文字。作者发现年级低,课文内容长度短,年级高,长度也随之增加。最终经过拼写错误的纠正获取了一千多篇语料。
3. 除了12个年级的课本对应的12个可读性等级之外,作者考虑更一般的情况,将其他难度在这12个等级之上的文本统统归成第13级,而对应的语料的样本则是来源于名古屋大学和东京大学的大学语文课本。

这个思路和我们之间一直讨论的那个数据搜集思路一样,所以也没什么亮点。

网络上不能断词与断句文本可读性评估

作者可能觉得只是简单的创建一个语料库工作量太小了,所以就强行利用在语料库上训练的模型稍微改造一下,去掉传统可读性评估公式中如K_L、lexile模型中句长或者字长等需要断句或者断词的特征,加入一些其他文本特征,然后应用到网络文本的可读性评估上,并以一个儿童节目(Shukan Kodomo News )网站上的发布的故事帖子作为测试文本进行测试了一下。

感想

比较简单的一个思路,但对于中文语料的评估有点借鉴意义。