首页 | 本学科首页   官方微博 | 高级检索  
     检索      

基于位置敏感哈希的海量文本数据查询算法研究
引用本文:蒋巍.基于位置敏感哈希的海量文本数据查询算法研究[J].科技通报,2013(10).
作者姓名:蒋巍
作者单位:哈尔滨金融学院,哈尔滨,150030
基金项目:黑龙江省教育厅2013年度科学技术研究(面上)项目(12531089)。
摘    要:提出了一种基于位置敏感哈希算法的海量文本数据查询算法,通过位置敏感哈希算法将文本数据的特征向量映射到哈希桶中,从而有效地降低了计算复杂度并提高了数据检索的效率。首先,利用TF-IDF特征表示文本的特征向量,并根据给定的哈希函数集把文本的特征向量映射至哈希桶;接下来,利用哈希表为给定的文本计算出与之对应的直方图,通过直方图距离计算文本的相似度;最后,通过计算目标文本集中的文本与待查询文本的相似度进行文本排序,排序分值高的文本作为相关文本返回给用户。实验结果表明,对比已有方法文本提出的算法在MAP以及查全率-查准率曲线两个测度上都获得了较好的性能。

关 键 词:位置敏感哈希  海量文本数据  哈希桶  排序

Research on Massive Text Data Queries Algorithm Based on Locality Sensitive Hashing
Jiang Wei.Research on Massive Text Data Queries Algorithm Based on Locality Sensitive Hashing[J].Bulletin of Science and Technology,2013(10).
Authors:Jiang Wei
Abstract:
Keywords:locality sensitive hashing  massive text data  hash bucket  ranking
本文献已被 万方数据 等数据库收录!
设为首页 | 免责声明 | 关于勤云 | 加入收藏

Copyright©北京勤云科技发展有限公司  京ICP备09084417号