面向新媒体领域的错别字自动校对
龚永罡
汪昕宇
付俊英
王蕴琪
1.北京工商大学计算机与信息工程学院 北京 1000482.北京工商大学计算机与信息工程学院 北京 1000483.北京工商大学计算机与信息工程学院 北京 1000484.北京工商大学计算机与信息工程学院 北京 100048
摘要:新媒体平台每天原创新闻发布量巨大,采用人工审核内容中的错别字已经不切实际.本文提出了一种基于n-gram模型与规则相结合的方法,采集上亿篇新闻文章作为训练语料,对分词后的语料进行统计分析形成三元n-gram模型库,基于上下文语境构建错别字混淆集,通过最优化方法计算混淆词在目标场景中的支持度,有效实现错别字的自动检查与纠错.实验结果显示,文章查错召回率为78.9%,准确率为85.1%,具有重要的实际意义和广泛的应用领域.
关键词:n-gram模型混淆集支持度错别字
论文发表日期:2018-01-01
在线出版日期:2026-05-22(本平台首次上网日期,不代表文献的发表时间)
页数:3( 73-75 )
英文信息展开
信息技术与信息化

信息技术与信息化

ISSN:1672-9528
年,卷(期):2018,(10)
所属栏目:计算机应用技术