您的位置:网站首页 > 《中文科技期刊数据库》 > 工程技术 > 自动化计算机 > 计算机软件 > 摘要

基于自动机理论的PDF文本内容抽取

《计算机应用》2012年 第9期 | 王晓娟 谭建龙 刘燕兵 刘金刚   首都师范大学计算机科学联合研究院 北京100037 中国科学院计算技术研究所 北京100190 中国科学院研究生院 北京100049
★ 收藏 | 分享
  • 第1页
  • 第2页
  • 第3页
  • 第4页
论文服务:
摘 要:现有的从PDF文档抽取文本内容的方法(如PDFBox类库采用的方法)处理速度较低,无法满足高速网络中内容分析的需求,也不能对网络中部分到达的PDF数据包进行流式的处理。为此,提出了基于自动机理论的PDF文本内容抽取方法。该方法通过建立具有层次的关键字自动机,可以快速地抽取完整PDF文档和不完整PDF文档中的文本内容。在中文和英文PDF文档数据集下的实验结果表明,基于自动机理论的PDF文本内容抽取方法耗时仅为PDFBox方法的17%~37%。
【分 类】【工业技术】 > 自动化技术、计算机技术 > 计算技术、计算机技术 > 计算机软件 > 程序设计、软件工程 > 软件工程 > 软件开发
【关键词】 文本内容抽取 自动机 确定的有穷自动机 不完整文档
【出 处】 《计算机应用》2012年 第9期 2491-2495页 共5页
【收 录】 中文科技期刊数据库