Assigning a set of labels to a given text is a classification problem with many real-world applications, such as recommender systems. Two separate research streams address this issue. Hierarchical Text Classification (HTC) focuses on datasets with label pools of hundreds of entries, accompanied by a semantic label hierarchy. In contrast, eXtreme Multi-Label Text Classification (XML) considers very large sets of labels with up to millions of entries but without an explicit hierarchy. In XML methods, it is common to construct an artificial hierarchy in order to deal with the large label space before or during the training process. Here, we investigate how state-of-the-art HTC models perform when trained and tested on XML datasets and vice versa using three benchmark datasets from each of the two streams. Our results demonstrate that XML models, with their internally constructed hierarchy, are very effective HTC models. HTC models, on the other hand, are not equipped to handle the sheer label set size of XML datasets and achieve poor transfer results. We further argue that for a fair comparison in HTC and XML, more than one metric like F1 should be used but complemented with P@k and R-Precision.


翻译:为给定文本分配一组标签是一个具有许多实际应用的分类问题,例如推荐系统。两个独立的研究方向致力于解决此问题。层次化文本分类(HTC)专注于标签池包含数百个条目并伴有语义标签层次结构的数据集。相比之下,极端多标签文本分类(XML)考虑的是非常庞大的标签集,条目数量可达数百万,但没有明确的层次结构。在XML方法中,通常会在训练过程之前或期间构建一个人工层次结构以处理巨大的标签空间。本文中,我们研究了最先进的HTC模型在XML数据集上进行训练和测试时的表现,反之亦然,使用了来自这两个方向各三个基准数据集。我们的结果表明,XML模型凭借其内部构建的层次结构,是非常有效的HTC模型。另一方面,HTC模型无法处理XML数据集庞大的标签集规模,迁移效果较差。我们进一步指出,为了在HTC和XML中进行公平比较,不应仅使用F1等单一指标,而应辅以P@k和R-Precision。

0
下载
关闭预览

相关内容

XPath即为XML路径语言,它是一种用来确定XML(标准通用标记语言的子集)文档中某部分位置的语言。XPath基于XML的树状结构,提供在数据结构树中找寻节点的能力。起初 XPath 的提出的初衷是将其作为一个通用的、介于XPointer与XSLT间的语法模型。但是 XPath 很快的被开发者采用来当作小型查询语言。
专知会员服务
40+阅读 · 2021年5月18日
专知会员服务
17+阅读 · 2021年2月17日
【AAAI2021】用于多标签图像分类的深度语义词典学习
专知会员服务
15+阅读 · 2020年12月30日
【WSDM2021】弱监督下的分层元数据感知文档分类
专知会员服务
11+阅读 · 2020年11月16日
注意力图神经网络的多标签文本分类
专知会员服务
112+阅读 · 2020年3月28日
【资源】NLP多标签文本分类代码实现工具包
专知
40+阅读 · 2019年11月20日
ML通用指南:文本分类详细教程(上)
论智
19+阅读 · 2018年7月29日
手把手教你用Keras进行多标签分类(附代码)
数据派THU
11+阅读 · 2018年7月17日
深度学习在文本分类中的应用
AI研习社
13+阅读 · 2018年1月7日
Tensorflow 文本分类-Python深度学习
Python程序员
12+阅读 · 2017年11月22日
国家自然科学基金
4+阅读 · 2017年12月31日
国家自然科学基金
5+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
7+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
VIP会员
相关基金
国家自然科学基金
4+阅读 · 2017年12月31日
国家自然科学基金
5+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
7+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
Top
微信扫码咨询专知VIP会员