Operating Elasticsearch clusters at scale demands continuous human expertise spanning the full lifecycle -- from initial deployment through performance tuning, monitoring, failure prediction, and incident recovery. We present the ES Guardian Agent, an autonomous AI SRE system that manages the complete Elasticsearch lifecycle without human intervention through eleven distinct phases: Evaluate, Optimize, Deploy, Calibrate, Stabilize, Alert, Predict, Heal, Learn, and Upgrade. A critical differentiator is its multi-source predictive failure engine, which continuously ingests and correlates metrics trends, application logs, and kernel-level telemetry -- including Linux dmesg streams, NVMe SMART data, NIC bond statistics, and thermal sensors -- to anticipate failures hours before they materialize. By cross-referencing current system signatures against a persistent incident memory of resolved failures, the AI engine stages corrective actions proactively. Through four successive agent architectures -- culminating in a 4,589-line system with five monitoring layers and an iterative AI action loop -- we demonstrate that an LLM equipped with tool-use access can function as a full-lifecycle autonomous SRE targeting six-nines (99.9999%) availability. In production evaluation, the Guardian Agent executed 300 autonomous investigation-and-repair cycles, recovered a cluster from an 18-hour cross-system outage, diagnosed hardware NIC failures across all host nodes, and maintained continuous operational visibility. We establish that data volume per shard -- not tuning -- is the primary determinant of query performance, with latency scaling at 0.26 ms per MB/shard.


翻译:大规模运营Elasticsearch集群需要持续的人工专业知识,涵盖从初始部署到性能调优、监控、故障预测及事件恢复的完整生命周期。我们提出ES Guardian智能体,这是一种自主AI SRE系统,通过十一个不同阶段在无需人工干预的情况下管理完整的Elasticsearch生命周期:评估、优化、部署、校准、稳定、告警、预测、修复、学习与升级。其关键差异化特性在于多源预测性故障引擎,该引擎持续摄取并关联指标趋势、应用日志及内核级遥测数据(包括Linux dmesg流、NVMe SMART数据、网卡绑定统计及热传感器),从而在故障发生前数小时进行预判。通过将当前系统特征与已解决故障的持久化事件记忆进行交叉比对,AI引擎主动编排纠正措施。通过四种递进式智能体架构——最终形成包含五个监控层及迭代AI动作循环的4589行系统——我们证明了配备工具使用能力的LLM可作为实现六九(99.9999%)可用性的全生命周期自主SRE。在生产评估中,Guardian智能体执行了300次自主调查与修复循环,从18小时跨系统宕机中恢复集群,诊断了所有主机节点的硬件网卡故障,并维持了持续运营可见性。我们确立了每分片数据量(而非调优)是查询性能的首要决定因素,延迟以每MB/分片0.26毫秒的比例缩放。

0
下载
关闭预览

相关内容

人工智能杂志AI(Artificial Intelligence)是目前公认的发表该领域最新研究成果的主要国际论坛。该期刊欢迎有关AI广泛方面的论文,这些论文构成了整个领域的进步,也欢迎介绍人工智能应用的论文,但重点应该放在新的和新颖的人工智能方法如何提高应用领域的性能,而不是介绍传统人工智能方法的另一个应用。关于应用的论文应该描述一个原则性的解决方案,强调其新颖性,并对正在开发的人工智能技术进行深入的评估。 官网地址:http://dblp.uni-trier.de/db/journals/ai/
伯克利最新《智能体 AI (Agentic AI)》课程
专知会员服务
48+阅读 · 3月1日
智能体工程(Agent Engineering)
专知会员服务
34+阅读 · 2025年12月31日
AlphaMosaic:人工智能赋能的作战管理系统
专知会员服务
41+阅读 · 2025年8月19日
《探索人类-智能自主系统中共享态势感知理论》
专知会员服务
53+阅读 · 2024年12月4日
AI Agent:基于大模型的自主智能体
专知会员服务
249+阅读 · 2023年9月9日
浅谈群体智能——新一代AI的重要方向
中国科学院自动化研究所
44+阅读 · 2019年10月16日
Elasticsearch地理信息存储及查询之Geo_Point
Analysys易观
13+阅读 · 2018年12月29日
【知识图谱】知识图谱+人工智能=新型网络信息体系
产业智能官
14+阅读 · 2018年11月18日
智能无人作战系统的发展
科技导报
36+阅读 · 2018年6月29日
智能无人机集群技术概述
无人机
46+阅读 · 2018年2月28日
【无人机】无人机的自主与智能控制
产业智能官
53+阅读 · 2017年11月27日
群体智能:新一代人工智能的重要方向
走向智能论坛
12+阅读 · 2017年8月16日
国家自然科学基金
5+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
21+阅读 · 2013年12月31日
国家自然科学基金
24+阅读 · 2011年12月31日
国家自然科学基金
17+阅读 · 2008年12月31日
Arxiv
0+阅读 · 3月24日
VIP会员
最新内容
从看见到认知世界:视觉世界模型综述
专知会员服务
7+阅读 · 5月17日
《高超声速打击武器引发的战略影响》116页
专知会员服务
8+阅读 · 5月17日
《美军不对称战略选择》28页slides
专知会员服务
9+阅读 · 5月17日
《审视 Palantir 监控平台》
专知会员服务
20+阅读 · 5月17日
PALANTIR GOTHAM平台:人工智能赋能作战
专知会员服务
17+阅读 · 5月17日
集成式人工智能:Palantir与认知维度
专知会员服务
11+阅读 · 5月17日
AI原生数据库发展趋势白皮书
专知会员服务
13+阅读 · 5月16日
相关VIP内容
相关资讯
浅谈群体智能——新一代AI的重要方向
中国科学院自动化研究所
44+阅读 · 2019年10月16日
Elasticsearch地理信息存储及查询之Geo_Point
Analysys易观
13+阅读 · 2018年12月29日
【知识图谱】知识图谱+人工智能=新型网络信息体系
产业智能官
14+阅读 · 2018年11月18日
智能无人作战系统的发展
科技导报
36+阅读 · 2018年6月29日
智能无人机集群技术概述
无人机
46+阅读 · 2018年2月28日
【无人机】无人机的自主与智能控制
产业智能官
53+阅读 · 2017年11月27日
群体智能:新一代人工智能的重要方向
走向智能论坛
12+阅读 · 2017年8月16日
相关基金
国家自然科学基金
5+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
21+阅读 · 2013年12月31日
国家自然科学基金
24+阅读 · 2011年12月31日
国家自然科学基金
17+阅读 · 2008年12月31日
Top
微信扫码咨询专知VIP会员