期刊界 All Journals 搜尽天下杂志传播学术成果专业期刊搜索期刊信息化学术搜索

1.

Penalized Matrix Decomposition Method for Text Clustering

Wang Juan Fan Shaoping Zheng Chunhou 《情报学报》2012,31(9)

文本软聚类是适应学科发展而逐步兴起的一项文本聚类技术,它更加全面地反映文本的特征信息.本文首先分析了文本软聚类技术的现状,提出了基于惩罚性矩阵分解(PMD)的文本软聚类算法,并应用于文本聚类研究.实验结果表明,本文提出的算法具有较好的聚类结果. 相似文献

2.

基于LSI理论的文本自动聚类研究

常娥《图书情报工作》2012,56(11):89-92

结合潜性语义索引（latent semantic index,LSI）理论和K-means聚类法,提出一种改进的文本自动聚类方法,即首先利用N-gram统计法抽取文档关键词,并应用潜性语义索引LSI对构建文档的向量空间模型进行降维,然后采用K-means算法进行文本聚类。实验表明,该算法进行文本聚类的准确度最高可达84.7%。相似文献

3.

基于Spark的旅游舆情热点发现方法研究

黄凌子《信息系统工程》2023,(1):14-17

传统的基于BTM的话题发现方法未考虑大数据条件下,海量短文本中热点话题发现存在的时效性限制问题。基于Spark计算框架、BTM模型和K-means算法,提出了并行旅游舆情热点话题发现算法,通过对旅游评论、微博短文本集的词对生成、文档-话题分布矩阵、文档相似度计算及聚类过程进行基于Spark框架的并行化,缩短了热点话题的发现时间,提高了实时性。实验结果显示本算法加速比和扩展性相比单一BTM模型能进一步提升,适用于旅游舆情热点话题发现的应用需求。相似文献

4.

基于相似网页文本演化的数据溯源

倪静孟宪学《图书情报工作》2016,60(13):134

[目的/意义] 为解决现有网页文本缺乏起源标注的问题,提出一种借助PROV本体发现相似网页文本起源关系的方法。[方法/过程] 通过聚类算法、自动语义标注和关联数据构建等技术的综合应用,结合PROV-POL溯源模型,检测网页文本实体的演变过程,实现文本级和属性级两级溯源方案。[结果/结论] 实验验证了借助语义网技术和数据溯源模型实现网页文本数据溯源的可行性,但实验过程中聚类算法的召回率有待提高。相似文献

5.

网络环境中基于语义聚类的多关键词查询机制

海沫郭树行《图书情报工作》2012,56(20):37-41

为提高多关键词查询的效率并减少多关键词查询的开销,提出一种基于语义聚类的多关键词查询算法——MKQBSC。该算法使得语义相似的节点聚为一类,节点加入、退出或节点的语义改变时,聚类将相应改变。查询请求在相邻的语义聚类之间转发,直至到达语义相似的聚类。仿真实验结果表明:与传统的基于对倒排表求交集的多关键词查询算法相比,MKQBSC算法所需的路由跳数和所产生的消息数更少。相似文献

6.

基于超网络的微博相似度及其在微博舆情主题发现中的应用

梁晓贺田儒雅吴蕾张学福《图书情报工作》2020,64(11):77-86

[目的/意义] 准确地计算微博相似度可以提高微博主题挖掘效率，对舆情治理、保障信息安全具有实践意义。针对微博文本语义稀疏、高维的问题，提出一种融入微博非文本特征的超边相似度算法。[方法/过程] 分析微博舆情发生机制，利用超网络模型表示微博舆情主题形成过程，通过计算各层子网相似度及各层子网对主题形成的贡献度构建超边相似度算法。[结果/结论] 研究发现，论文所提出的相似度方法有助于提升微博舆情信息的主题聚类效果，特别是对于文字性表述相似程度高的微博信息，具有明显的主题区分性。相似文献

7.

基于样本加权的文本聚类算法研究 总被引：3，自引：0，他引：3

章成志师庆辉薛德军《情报学报》2008,27(1):42-48

样本加权聚类算法是一种最近才引起人们注意的算法,还存在一些需要解决的问题,例如,聚类对象之间的结构信息对样本加权聚类是否有帮助,如何将结构信息自动转换为样本或对象的权重?针对该问题,本文以学术论文为聚类对象,以K-Means算法为聚类算法基础,利用论文之间的引用关系计算每篇论文的PageRank值,并将其作为权重,提出一种基于样本加权的新的文本聚类算法.实验结果表明,基于论文PageRank值加权的聚类算法能改善文本聚类效果.该算法可推广到网页的聚类中,利用网页的PageRank进行加权聚类,来改善网页的聚类效果. 相似文献

8.

科学推动下技术机会发现方法研究

韩晓彤朱东华汪雪锋《图书情报工作》2022,(10):19-32

[目的/意义]科学与技术之间的密切关系,使得结合论文与专利进行技术机会分析比使用单一数据更加合理与高效。本文使科学技术关系的生成更自动化,减弱对主观判断的依赖,使技术颗粒更加精细,同时为技术研发人员提供研发建议,将科学研究中汲取的理念应用到相应的技术创新中去。[方法/过程]将论文、专利的摘要文本进行Doc2vec向量表示,通过文本相似性将其关联成网络,再基于Louvain算法生成科技主题聚类,识别科学研究推动的技术机会。最后以3D打印技术为案例进行实证研究。[结果/结论]识别出若干科学研究推动的技术机会,并验证所识别的机会具有一定的技术潜力,证明方法的可行性和有效性。相似文献

9.

一种基于随机n-Grams的文本相似度计算方法 总被引：1，自引：0，他引：1

王贤明胡智文谷琼《情报学报》2013,32(7)

文本相似度计算广泛应用于抄袭检测、自动问答系统、文本聚类等文本应用领域,然而传统的方法往往不具有语言无关性,且要花费大量的时间分析提取文档的特征项.针对目前相关方法的诸多不足,提出了一种基于随机n-Grams(Random n-Gram,记为R-Gram)的长文本相似度算法,该算法具备语言无关性,且可以充分利用短n-Gram的细粒度检测特性和长n-Gram的高效检测特性.实验结果表明:基于R-Gram的文本相似度算法具有快速、操作简单、精度调控灵活等优点,在长文本相似度计算中具有良好的应用价值. 相似文献

10.

分布式环境下的文本聚类研究与实现

赵华茗《现代图书情报技术》2015,(1):82-88

【目的】通过开源工具,构建一种分布式环境下的文本聚类与分类应用平台。【方法】以海量文本的词收敛性为基础,通过词聚类指导文本聚类和分类。过程包括:使用开源分词器等工具进行训练集的文本预处理,结合Mahout数据挖掘平台对处理后的词集进行聚类分析,最后通过相似度算法计算测试文本与词类簇的相似度并分类。【结果】分布式环境下的基于词聚类的文本聚类分类计算方法,可有效解决海量文本的词聚类瓶颈问题。经测试,当训练文本集增加到100,迭代收敛阈值为0.01时,词聚类结果较理想。【局限】测试数据规模有限,仅限于新闻数据,基于其他领域的词聚类效果需要进一步测试、优化、调整。【结论】详细描述基于词聚类的文本聚类分类算法的开发环境构架和关键步骤,有助于研究者对相关开源工具使用及分布式并行环境部署的深入理解。相似文献

11.

基于样本加权的引文网络的社团划分

肖雪王钊伟陈云伟邓勇《图书情报工作》2016,60(20):86-93

[目的/意义] 为提高引文网络的社团划分的准确性,提出一种基于加权的引文网络的社团划分方法。[方法/过程] 以Louvain社团划分方法为算法基础,将科学论文用向量空间模型表示,利用改进的余弦相似度方法计算相邻论文之间的相似度,并将其作为权重,综合考虑论文内容属性与结构属性,提出一种基于样本加权的引文网络社团划分方法。[结果/结论] 该算法将引文网络中论文的文本内容属性与拓扑结构属性结合起来,通过对Scientometrics期刊发表的论文以及主题为CRISPR的论文进行社团划分研究实验,结果表明该方法能改善引文网络社团的划分效果。相似文献

12.

向量空间模型在医学文献相关性研究中的应用

邱宇红郭继军《现代图书情报技术》2007,2(7):63-67

为提高医学文献检索的效率和检索结果输出的有效性，快速客观地为科研人员提供高信度、低冗余的参考文献，实现检索结果按相关度排序输出，就基于向量空间模型的文献相关度计算方案进行探讨，提出基于相关度的医学文献聚类分析和相关度排序。相似文献

13.

基于概念语义网络的词族挖掘研究

杜慧平《图书情报工作》2016,60(21):122-127

[目的/意义] 提出一种新的词族识别方法,用于构建语义工具和辅助检索扩展,以降低编表专家的认知负担,提高语义工具构建和更新的效率。[方法/过程] 首先通过同现统计和相似度计算建立学科领域的概念语义网络,再利用社会网络分析中的Island算法进一步识别该网络中的词族。并以金融学科为例,比较该方法与层次聚类算法、“词素后方一致”方法识别词族的效果。[结果/结论] 结果发现,Island算法的效果优于层次聚类算法,并与“词素后方一致”方法各具优势,可以结合使用,取长补短。相似文献

14.

基于复合词生成的网络热点话题识别及描述算法

李霞王连喜路美秀刘汉锋刘俊延《图书情报工作》2016,60(23):128-134

[目的/意义]在海量网络新闻和微博等新媒体文本中自动识别网络热点话题并抽取有意义词串来描述热点事件,对自动识别和描述网络舆情具有重要的研究意义。[方法/过程]在现有热点描述词抽取方法中,利用关联规则或多元词组合方法在抽取过程中存在噪音词较多和特征词语义被放大或转移等问题。本文提出一种基于复合词生成的描述词抽取方法,在所提取的语义更为精确的描述词集合上使用一趟聚类算法对新闻文本进行聚类,自动识别网络热点话题并对热点话题进行排名。[结果/结论]对腾讯新闻事件文本数据集所做的实验结果表明,本文所提出的方法较传统的词特征抽取方法在聚类结果上具有更好的话题簇识别能力和簇描述能力。相似文献

15.

Clustering small-sized collections of short texts

Lili Kotlerman Ido Dagan Oren Kurland 《Information Retrieval》2018,21(4):273-306

The need to cluster small text corpora composed of a few hundreds of short texts rises in various applications; e.g., clustering top-retrieved documents based on their snippets. This clustering task is challenging due to the vocabulary mismatch between short texts and the insufficient corpus-based statistics (e.g., term co-occurrence statistics) due to the corpus size. We address this clustering challenge using a framework that utilizes a set of external knowledge resources that provide information about term relations. Specifically, we use information induced from the resources to estimate similarity between terms and produce term clusters. We also utilize the resources to expand the vocabulary used in the given corpus and thus enhance term clustering. We then project the texts in the corpus onto the term clusters to cluster the texts. We evaluate various instantiations of the proposed framework by varying the term clustering method used, the approach of projecting the texts onto the term clusters, and the way of applying external knowledge resources. Extensive empirical evaluation demonstrates the merits of our approach with respect to applying clustering algorithms directly on the text corpus, and using state-of-the-art co-clustering and topic modeling methods. 相似文献

16.

惩罚性矩阵分解及其在共词分析中的应用

邵作运李秀霞《图书情报工作》2015,59(13):126

[目的/意义] 基于高维矩阵稀疏降维的思想,提出一种利用惩罚性矩阵分解(Penalized Matrix Decomposition,PMD)实现共词分析的新方法。[方法/过程] 以"学科服务"为研究主题,根据PMD算法原理,在Matlab环境下分别实现特征词的提取、特征词的软聚类以及聚类效果的可视化。[结果/结论] 与传统的共词分析方法对比,PMD算法在共词分析中具有独特的优势:提取的特征词比较全面,聚类数目便于确定,聚类结果易于理解。相似文献

17.

基于聚类分析的期刊多属性评价方法选择研究——聚类结果一致度筛选法

俞立平《图书情报工作》2018,62(21):80-86

[目的/意义]解决学术期刊多属性评价方法众多、评价结果不一致问题。[方法/过程]提出一种基于聚类分析的多属性评价方法选取方法——聚类结果一致度筛选法。其原理是首先对原始评价指标进行聚类,然后采用可行的多属性评价方法进行评价并对评价结果进行二次聚类,最后根据评价结果聚类与原始指标聚类结果一致度的高低来选择评价方法,优先选取聚类结果一致度最高的评价方法。本文基于JCR2015数学期刊,选取11个指标,分别采用加权线性汇总、TOPSIS、VIKOR、主成分分析、调和平均进行评价,然后基于聚类结果一致度进行评价方法选取,发现调和平均的聚类一致度最高。[结果/结论]可以采用该方法对多属性评价方法进行选择;聚类种类设置对结果影响较小;该方法具有较高的稳健性。相似文献

18.

ACTC：一种基于改进的蚁群算法的中文文本聚类算法

刘泉凤《图书情报工作》2009,53(9):108-111

在对标准蚁群算法分析研究基础上,结合中文文本数据的特点,对蚁群算法存在的缺点进行改进,提出一种基于改进的蚁群算法的中文文本聚类方法——ACTC。算法中为每只蚂蚁增加两个记忆体,可以解决原算法中的“未指派现象”;模拟信息素,从而使蚂蚁的移动更具目的性,加快聚类速度;引入“边界点”思想,从而不仅可以消除“停滞现象”,而且能避免“噪声”或异常数据对聚类结果的负面影响;引入动态调整相似度阈值概念,从而使聚类结果更具实际意义。实验证明,从熵值与纯度两个评价函数评价结果看,该算法的聚类效果较好,达到算法改进的目的。相似文献

19.

基于SLCS的元搜索去重技术研究

秦杰谢蕙王春云《图书情报工作》2010,54(15):113-116

针对元搜索结果中的网页重复问题,把基于最长公共子序列（Longest Common Subsequence,简称LCS）的网页去重方法应用到元搜索引擎的去重中,提出基于SLCS(首字母S表示Summary)的元搜索去重方法。在获得网页文档摘要后,根据查询词在语句中出现的次数和语句长度,计算摘要语句集合中每个语句权重,提取权重最大的语句作为网页摘要特征语句,通过比较摘要特征语句间的LCS,计算出结果网页相似性,以提高元搜索引擎的检索质量,实验表明该方法具有较高的准确率。相似文献