Summaries as Centroids for Interpretable and Scalable Text Clustering - 专知论文

会员服务 ·

0

文本聚类 · 语言模型 · 数据集 · 表示 · K-均值 ·

Summaries as Centroids for Interpretable and Scalable Text Clustering

翻译：以摘要为中心：面向可解释与可扩展文本聚类的中心点表示方法

Jairo Diaz-Rodriguez

from arxiv, Accepted to ICLR 2026

We introduce k-NLPmeans and k-LLMmeans, text-clustering variants of k-means that periodically replace numeric centroids with textual summaries. The key idea, summary-as-centroid, retains k-means assignments in embedding space while producing human-readable, auditable cluster prototypes. The method is LLM-optional: k-NLPmeans uses lightweight, deterministic summarizers, enabling offline, low-cost, and stable operation; k-LLMmeans is a drop-in upgrade that uses an LLM for summaries under a fixed per-iteration budget whose cost does not grow with dataset size. We also present a mini-batch extension for real-time clustering of streaming text. Across diverse datasets, embedding models, and summarization strategies, our approach consistently outperforms classical baselines and approaches the accuracy of recent LLM-based clustering-without extensive LLM calls. Finally, we provide a case study on sequential text streams and release a StackExchange-derived benchmark for evaluating streaming text clustering.

翻译：本文提出了k-NLPmeans与k-LLMmeans两种文本聚类方法，它们作为k-means的变体，通过周期性将数值中心点替换为文本摘要来实现聚类。其核心思想——"摘要即中心点"——在保持嵌入空间中k-means分配机制的同时，生成人类可读、可审计的聚类原型。该方法具备大语言模型可选特性：k-NLPmeans采用轻量级确定性摘要生成器，支持离线、低成本和稳定运行；k-LLMmeans作为即插即用升级方案，在固定单次迭代预算下使用大语言模型生成摘要，其成本不随数据集规模增长。我们还提出了适用于流式文本实时聚类的迷你批次扩展方案。在多样化数据集、嵌入模型和摘要生成策略的测试中，本方法始终优于经典基线模型，并在无需大量大语言模型调用的前提下逼近近期基于大语言模型的聚类精度。最后，我们提供了关于序列文本流的案例研究，并发布了基于StackExchange衍生的基准数据集用于评估流式文本聚类性能。

0

相关内容

文本聚类

文本聚类（Text Clustering）任务则是根据文档之间的内容或主题相似度，将文档集合划分成若干个子集，每个子集内部的文档相似度较高，而子集之间的相似度较低。

可解释聚类综述

可解释聚类综述

专知会员服务

38+阅读 · 2024年9月8日

【阿姆斯特丹博士论文】以人类为中心的语言技术新方向：理解并改进NLP模型，218页pdf

【阿姆斯特丹博士论文】以人类为中心的语言技术新方向：理解并改进NLP模型，218页pdf

专知会员服务

40+阅读 · 2023年5月22日

NeurIPS 2021 Spotlight | 针对有缺失坐标的聚类问题的核心集

NeurIPS 2021 Spotlight | 针对有缺失坐标的聚类问题的核心集

专知会员服务

16+阅读 · 2021年11月27日

SU最新《网络表示学习》综述论文，35页pdf阐述从预处理到特征提取与节点嵌入

SU最新《网络表示学习》综述论文，35页pdf阐述从预处理到特征提取与节点嵌入

专知会员服务

49+阅读 · 2021年10月15日

【AAAI2021】对比聚类，Contrastive Clustering

【AAAI2021】对比聚类，Contrastive Clustering

专知会员服务

78+阅读 · 2021年1月30日

【文本生成现代方法】Modern Methods for Text Generation

【文本生成现代方法】Modern Methods for Text Generation

专知会员服务

44+阅读 · 2020年9月11日

【论文推荐】文本摘要简述

【论文推荐】文本摘要简述

专知会员服务

69+阅读 · 2020年7月20日

【AAAI2020-清华大学】张量图卷积网络文本分类，Tensor Graph Convolutional Networks for Text Classification

【AAAI2020-清华大学】张量图卷积网络文本分类，Tensor Graph Convolutional Networks for Text Classification

专知会员服务

76+阅读 · 2020年1月16日

【元学习 | 论文】元学习聚类，Meta-Learning to Cluster，哥伦比亚大学

【元学习 | 论文】元学习聚类，Meta-Learning to Cluster，哥伦比亚大学

专知会员服务

42+阅读 · 2019年11月21日

NLP基础任务:文本分类近年发展汇总,68页超详细解析

NLP基础任务:文本分类近年发展汇总,68页超详细解析

专知会员服务

74+阅读 · 2019年10月19日

【AAAI2021】对比聚类，Contrastive Clustering

【AAAI2021】对比聚类，Contrastive Clustering

专知

26+阅读 · 2021年1月30日

一文综述经典的深度文本分类方法

一文综述经典的深度文本分类方法

AI100

12+阅读 · 2019年6月8日

面试题：文本摘要中的NLP技术

面试题：文本摘要中的NLP技术

七月在线实验室

15+阅读 · 2019年5月13日

NLP基础任务:文本分类近年发展汇总,68页超详细解析

NLP基础任务:文本分类近年发展汇总,68页超详细解析

专知

167+阅读 · 2019年4月18日

用深度学习做文本摘要

用深度学习做文本摘要

专知

24+阅读 · 2019年3月30日

赛尔原创 | 文本摘要简述

赛尔原创 | 文本摘要简述

哈工大SCIR

22+阅读 · 2019年3月25日

手把手 | 基于TextRank算法的文本摘要（附Python代码）

手把手 | 基于TextRank算法的文本摘要（附Python代码）

大数据文摘

11+阅读 · 2018年12月27日

独家 | 基于TextRank算法的文本摘要（附Python代码）

独家 | 基于TextRank算法的文本摘要（附Python代码）

数据派THU

14+阅读 · 2018年12月21日

深度学习文本分类方法综述（代码）

深度学习文本分类方法综述（代码）

中国人工智能学会

28+阅读 · 2018年6月16日

文本聚类：从非结构化数据快速获取见解

文本聚类：从非结构化数据快速获取见解

Datartisan数据工匠

15+阅读 · 2017年10月12日

基于聚合的社会化短文本信息处理与细粒度倾向性分析

国家自然科学基金

0+阅读 · 2015年12月31日

面向CELP语音压缩域的通用隐写分析方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

多标记文本数据流分类方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

基于复杂语义的个性化图像集摘要研究

国家自然科学基金

0+阅读 · 2015年12月31日

模糊认知集群优化的聚类算法

国家自然科学基金

9+阅读 · 2015年12月31日

面向异构信息网络中实体归类的模糊聚类

国家自然科学基金

1+阅读 · 2015年12月31日

具有簇间分离特性的簇中心平面和子空间聚类方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

半监督进化文本聚类算法在动态多源文本分析上的研究

国家自然科学基金

2+阅读 · 2014年12月31日

面向词汇功能的学术文本语义识别与知识图谱构建

国家自然科学基金

5+阅读 · 2014年12月31日

时间序列数据挖掘中的聚类模型与算法研究

国家自然科学基金

14+阅读 · 2008年12月31日

Khatri-Rao Clustering for Data Summarization

Arxiv

0+阅读 · 3月10日

Incremental Graph Construction Enables Robust Spectral Clustering of Texts

Arxiv

0+阅读 · 3月3日

Impossibility of Depth Reduction in Explainable Clustering

Arxiv

0+阅读 · 3月2日

Prompts to Summaries: Zero-Shot Language-Guided Video Summarization with Large Language and Video Models

Arxiv

0+阅读 · 2月17日

Chain of Summaries: Summarization Through Iterative Questioning

Arxiv

0+阅读 · 2月16日

A Pragmatic Method for Comparing Clusterings with Overlaps and Outliers

Arxiv

0+阅读 · 2月16日

SegNSP: Revisiting Next Sentence Prediction for Linear Text Segmentation

Arxiv

0+阅读 · 2月11日

Text summarization via global structure awareness

Arxiv

0+阅读 · 2月11日

Incremental (k, z)-Clustering on Graphs

Arxiv

0+阅读 · 2月9日

Tight FPT Approximations for Fair $k$-center with Outliers

Arxiv

0+阅读 · 2月5日

VIP会员

文章信息

相关主题

最新内容

ICML 2026 | CFPO：用反事实策略优化提升多模态推理

ICML 2026 | CFPO：用反事实策略优化提升多模态推理

专知会员服务

2+阅读 · 6月23日

综述 | 世界动作模型：少做梦，多行动

综述 | 世界动作模型：少做梦，多行动

专知会员服务

4+阅读 · 6月23日

美以伊冲突：无人机与人工智能的运用

美以伊冲突：无人机与人工智能的运用

专知会员服务

7+阅读 · 6月23日

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

专知会员服务

3+阅读 · 6月23日

《特种部队在透明战场中的生存力》最新报告

《特种部队在透明战场中的生存力》最新报告

专知会员服务

4+阅读 · 6月23日

《自主无人机蜂群协同与控制系统：人工智能赋能的战场协同与自主任务编排平台》

《自主无人机蜂群协同与控制系统：人工智能赋能的战场协同与自主任务编排平台》

专知会员服务

6+阅读 · 6月23日

《人工智能生成的零日漏洞：对未来作战的影响》

《人工智能生成的零日漏洞：对未来作战的影响》

专知会员服务

5+阅读 · 6月23日

《理解伙伴国在防务能力选择中的偏好：探索美国解决方案的替代选择》美智库200页报告

《理解伙伴国在防务能力选择中的偏好：探索美国解决方案的替代选择》美智库200页报告

专知会员服务

3+阅读 · 6月23日

ICML 2026 | 边界嵌入塑形：用自适应对比学习破解图结构纠缠

ICML 2026 | 边界嵌入塑形：用自适应对比学习破解图结构纠缠

专知会员服务

6+阅读 · 6月22日

综述 | 3D场景图：开放挑战与未来方向

综述 | 3D场景图：开放挑战与未来方向

专知会员服务

8+阅读 · 6月22日

《国防工业6.0：全自主作战系统、量子-人工智能融合与新一代战略威慑》

《国防工业6.0：全自主作战系统、量子-人工智能融合与新一代战略威慑》

专知会员服务

8+阅读 · 6月22日

21世纪的无人机战争

21世纪的无人机战争

专知会员服务

4+阅读 · 6月22日

《伊朗与以色列-美国热战及其对数字技术的影响》

《伊朗与以色列-美国热战及其对数字技术的影响》

专知会员服务

6+阅读 · 6月22日

《量子技术的军事任务技术适配与利用》

《量子技术的军事任务技术适配与利用》

专知会员服务

5+阅读 · 6月22日

《美国陆军军官学校（西点军校）本科生科研中生成式人工智能的使用》

《美国陆军军官学校（西点军校）本科生科研中生成式人工智能的使用》

专知会员服务

9+阅读 · 6月22日

相关VIP内容

可解释聚类综述

可解释聚类综述

专知会员服务

38+阅读 · 2024年9月8日

【阿姆斯特丹博士论文】以人类为中心的语言技术新方向：理解并改进NLP模型，218页pdf

【阿姆斯特丹博士论文】以人类为中心的语言技术新方向：理解并改进NLP模型，218页pdf

专知会员服务

40+阅读 · 2023年5月22日

NeurIPS 2021 Spotlight | 针对有缺失坐标的聚类问题的核心集

NeurIPS 2021 Spotlight | 针对有缺失坐标的聚类问题的核心集

专知会员服务

16+阅读 · 2021年11月27日

SU最新《网络表示学习》综述论文，35页pdf阐述从预处理到特征提取与节点嵌入

SU最新《网络表示学习》综述论文，35页pdf阐述从预处理到特征提取与节点嵌入

专知会员服务

49+阅读 · 2021年10月15日

【AAAI2021】对比聚类，Contrastive Clustering

【AAAI2021】对比聚类，Contrastive Clustering

专知会员服务

78+阅读 · 2021年1月30日

【文本生成现代方法】Modern Methods for Text Generation

【文本生成现代方法】Modern Methods for Text Generation

专知会员服务

44+阅读 · 2020年9月11日

【论文推荐】文本摘要简述

【论文推荐】文本摘要简述

专知会员服务

69+阅读 · 2020年7月20日

【AAAI2020-清华大学】张量图卷积网络文本分类，Tensor Graph Convolutional Networks for Text Classification

【AAAI2020-清华大学】张量图卷积网络文本分类，Tensor Graph Convolutional Networks for Text Classification

专知会员服务

76+阅读 · 2020年1月16日

【元学习 | 论文】元学习聚类，Meta-Learning to Cluster，哥伦比亚大学

【元学习 | 论文】元学习聚类，Meta-Learning to Cluster，哥伦比亚大学

专知会员服务

42+阅读 · 2019年11月21日

NLP基础任务:文本分类近年发展汇总,68页超详细解析

NLP基础任务:文本分类近年发展汇总,68页超详细解析

专知会员服务

74+阅读 · 2019年10月19日

热门VIP内容

开通专知VIP会员享更多权益服务

综述 | 世界动作模型：少做梦，多行动

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

ICML 2026 | CFPO：用反事实策略优化提升多模态推理

美以伊冲突：无人机与人工智能的运用

相关资讯

【AAAI2021】对比聚类，Contrastive Clustering

【AAAI2021】对比聚类，Contrastive Clustering

专知

26+阅读 · 2021年1月30日

一文综述经典的深度文本分类方法

一文综述经典的深度文本分类方法

AI100

12+阅读 · 2019年6月8日

面试题：文本摘要中的NLP技术

面试题：文本摘要中的NLP技术

七月在线实验室

15+阅读 · 2019年5月13日

NLP基础任务:文本分类近年发展汇总,68页超详细解析

NLP基础任务:文本分类近年发展汇总,68页超详细解析

专知

167+阅读 · 2019年4月18日

用深度学习做文本摘要

用深度学习做文本摘要

专知

24+阅读 · 2019年3月30日

赛尔原创 | 文本摘要简述

赛尔原创 | 文本摘要简述

哈工大SCIR

22+阅读 · 2019年3月25日

手把手 | 基于TextRank算法的文本摘要（附Python代码）

手把手 | 基于TextRank算法的文本摘要（附Python代码）

大数据文摘

11+阅读 · 2018年12月27日

独家 | 基于TextRank算法的文本摘要（附Python代码）

独家 | 基于TextRank算法的文本摘要（附Python代码）

数据派THU

14+阅读 · 2018年12月21日

深度学习文本分类方法综述（代码）

深度学习文本分类方法综述（代码）

中国人工智能学会

28+阅读 · 2018年6月16日

文本聚类：从非结构化数据快速获取见解

文本聚类：从非结构化数据快速获取见解

Datartisan数据工匠

15+阅读 · 2017年10月12日

相关论文

Khatri-Rao Clustering for Data Summarization

Arxiv

0+阅读 · 3月10日

Incremental Graph Construction Enables Robust Spectral Clustering of Texts

Arxiv

0+阅读 · 3月3日

Impossibility of Depth Reduction in Explainable Clustering

Arxiv

0+阅读 · 3月2日

Prompts to Summaries: Zero-Shot Language-Guided Video Summarization with Large Language and Video Models

Arxiv

0+阅读 · 2月17日

Chain of Summaries: Summarization Through Iterative Questioning

Arxiv

0+阅读 · 2月16日

A Pragmatic Method for Comparing Clusterings with Overlaps and Outliers

Arxiv

0+阅读 · 2月16日

SegNSP: Revisiting Next Sentence Prediction for Linear Text Segmentation

Arxiv

0+阅读 · 2月11日

Text summarization via global structure awareness

Arxiv

0+阅读 · 2月11日

Incremental (k, z)-Clustering on Graphs

Arxiv

0+阅读 · 2月9日

Tight FPT Approximations for Fair $k$-center with Outliers

Arxiv

0+阅读 · 2月5日

相关基金

基于聚合的社会化短文本信息处理与细粒度倾向性分析

国家自然科学基金

0+阅读 · 2015年12月31日

面向CELP语音压缩域的通用隐写分析方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

多标记文本数据流分类方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

基于复杂语义的个性化图像集摘要研究

国家自然科学基金

0+阅读 · 2015年12月31日

模糊认知集群优化的聚类算法

国家自然科学基金

9+阅读 · 2015年12月31日

面向异构信息网络中实体归类的模糊聚类

国家自然科学基金

1+阅读 · 2015年12月31日

具有簇间分离特性的簇中心平面和子空间聚类方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

半监督进化文本聚类算法在动态多源文本分析上的研究

国家自然科学基金

2+阅读 · 2014年12月31日

面向词汇功能的学术文本语义识别与知识图谱构建

国家自然科学基金

5+阅读 · 2014年12月31日

时间序列数据挖掘中的聚类模型与算法研究

国家自然科学基金

14+阅读 · 2008年12月31日

微信扫码咨询专知VIP会员