自动文摘
运用计算机技术摘取文章
自动文摘,利用计算机自动地从原始文献中提取文摘,文摘是全面准确地反映某一文献中心内容地简单连贯的短文。
自动文摘
所谓自动文摘就是利用计算机自动地从原始文献中提取文摘,文摘 是全面准确地反映某一文献中心内容地简单连贯的短文。
自动文摘技术主要有机械文摘和理解文摘两种。机械文摘能够适用于非受限域,这符合当前自然语言处理技术面向真实语料、面向实用化的总趋势,但是由于它局限于对文本表层结构地分析,所以经过近40年的发展已接近技术极限,文摘质量很难再有质的飞跃。理解文摘牺牲领域宽度,换取了理解深度,它作为理论探索的价值很高,但实用性较低,在可预见的未来中前景黯淡。
为了适应大规模真实语料的需要,自动文摘应立足于面向非受域,不断提高文摘质量。篇章结构属于语言学范畴,不触及领域知识,因而基于篇章结构的自动文摘方法不受领域的限制。同时篇章结构比语言表层结构深入了一大步,根据篇章结构能够更准确地探测文章的中心内容所在,因而基于篇章结构的自动文摘能够避免机械文摘的许多不足,保证文摘质量。
自动摘录将文本试为句子的线性序列,将句子视为词的线性序列。它通常分4步进行:
(1)计算词的权值;
(2)计算句子的权值;
(3)将原文中的所有句子按权值高低降序排列,权值最高的若干句子被确定为文摘句;
(4)将所有文摘句按照它们在原文中的出现顺序输出。在自动文摘中,计算词权、句权、选择文摘句的依据是文本的6种形式特征:词频、标题、位置、句法结构、线索词和指示性短语
参考资料
最新修订时间:2024-05-21 17:37
目录
概述
参考资料