首页
/
行业洞察
/
正文
INDUSTRY INSIGHT · 深度
3步跑通keep:新手友好的AIOps告警管理实战
📅 2026/9/14 11:54:46
✍️ 爱科研究院
👁 阅读 3,247
3步跑通keep新手友好的AIOps告警管理实战【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep凌晨三点手机把你吵醒。同一个数据库连接池打满的故障二十分钟里群里刷了 30 条几乎一样的告警。第 30 条的时候没人知道该点哪一条。告警聚合是这类场景里最该先做的事。keep 是一个开源的智能运维平台把散落在各处的告警收进一个口子去重、关联、值班这些事都替你做。用一句话定义 keep告警界的总机keep 告警的统一入口。Prometheus、Datadog、Grafana 的告警全部汇进同一张列表。keep 告警的降噪器。按指纹判断同一个故障自动合成一条不再刷屏。keep 工作流自动化引擎。「告警来了 → 条件命中 → 执行动作」用一段 YAML 写完。Alertmanager 做到「分组转发」就停了Grafana OnCall 做到「排班通知谁」就停了。keep 额外解决两个问题跨源的告警聚合、去重和关联以及告警进来之后「干什么」的自动化。速览 keep 的五大核心能力统一告警视图左侧按严重度、状态、来源筛选右侧表格列出每条告警的状态和最近接收时间。支持批量操作一个视图看全量。告警去重基于指纹字段做判断选哪些字段参与合并都在界面里配。同一个故障后续再报多少条都折进同一条里。AI 关联分析用 Transformer 模型从你历史的告警和事件里学习关联关系新告警进来自动归组根因浮出来的速度比人快。自动化工作流工作流用 YAML 写界面也能点点点拼出来。触发、步骤、动作、条件全部可组合仓库里就有上百个现成例子。多源接入工具把告警推给 keepkeep 也可以反过来主动从监控源拉。推送和拉取两个 tab各家的流量一眼看清。 用 docker-compose 5 分钟跑起 keep不需要任何配置三步克隆仓库并进入目录。git clone https://gitcode.com/GitHub_Trending/kee/keep cd keep一键拉起容器。docker-compose up -d浏览器打开 http://localhost:3000。看到的就是告警 Feed 页左边筛选面板右边告警列表数据实时刷新。后端 API 在 8080 端口。默认 compose 里数据库用的 SQLite数据落在 state 目录重启不丢。认证方式、数据库连接这些参数细节直接看 README.md不用在这里展开。 接 Prometheus 只需改 3 行配置打开 prometheus/prometheus.yml加一个 alerting 段核心就是指向 keep 后端的那几行alerting: alertmanagers: - static_configs: - targets: - keep-backend:8080Prometheus 的告警触发后会以 Alertmanager 格式发给 keep 后端自动出现在列表里。如果你的 Prometheus 不在同一个 compose 里把 keep-backend 换成 keep 的实际域名或 IP 就行。告警规则照旧写在 Prometheus 的 rule 文件里keep 不改变你的监控侧只负责收。动手写一条 服务宕机发 Slack 的工作流三步触发条件 → 绑定动作 → 保存。触发条件告警名称匹配 highload 时执行也可以改成任意字段过滤。绑定动作接上 Slack provider写好消息模板。保存界面里点 Create a workflow把 YAML 贴进去即可。workflow: id: service-down-to-slack name: 服务宕机通知 triggers: - type: alert filters: - key: name value: highload actions: - name: notify-slack provider: type: slack config: {{ providers.slack }} with: message: {{ alert.name }} down完整语法在 docs/workflows/overview.mdx上百个跑通的例子在 examples/workflows/照着抄最快。想接 LLM 做分析把 provider 类型换成 openai 或 anthropic 就行结构不用动。进阶让 keep 替你值班的 3 个玩法告警分组防风暴按 provider 写去重规则一个故障只出一条风暴变滴答。LLM 根因初判工作流步骤里挂 LLM provider告警先让它读一遍、给出初判人来确认。生产部署K8s 部署方式在 docs/deployment 目录数据库换成 PostgreSQL 做持久化再打开认证。这些都只是冰山一角。源码就摆在明面keep/workflowmanager/ 是执行引擎keep/providers/ 是所有集成读源码比读文档更快。把 keep 放进你的值班流程如果你是被多源告警淹没的小团队或个人keep 最适合你。建议先拿测试环境跑一周看看能合并、去掉多少噪音。平时定期看一眼 CHANGELOG.md追新特性不费劲。【免费下载链接】keepThe open-source AIOps and alert management platform项目地址: https://gitcode.com/GitHub_Trending/kee/keep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📌 标签:
工业官网
设计趋势
AI 建站
SEO
获取完整报告 →
RELATED ARTICLES
推荐阅读
2026/9/14 11:54:46
Modbus TCP联调避坑指南:参数看着对却不行?寄存器、字节序与Unit ID全解析
2026/9/14 11:54:46
COMSOL中手性介质建模:本构关系与电磁仿真实践
2026/9/14 11:49:46
SAP ABAP双ALV表格联动展示实现方案
2026/9/14 12:34:50
DeepCode Workflows 的 User-in-Loop 交互处理器:Hook 机制、插件式注册与前后端事件桥接实战指南
2026/9/14 12:34:50
Claude Code Agent子智能体机制解析与实践
2026/9/14 12:34:50
Java字符串反转:5种实现方法与性能对比
2026/9/14 12:34:50
Grist:部署与使用关系型电子表格的完整指南
2026/9/14 12:34:50
Dify 1.17 精简部署实战:Docker Compose 配置到模型接入全指南
2026/9/14 12:29:50
MongoDB 分片过滤场景下 DISTINCT_SCAN 计划缓存行为深度解析:基于 shard_filtering_plan_cache Golden Test
2026/9/14 0:03:40
KCF目标跟踪算法与OTB工程实现:毕业设计实战解析
2026/9/14 0:03:40
Megatron-LM 推理实战指南:基于 Megatron Core 高层 API 的离线推理与 OpenAI 兼容服务
2026/9/14 0:03:40
语音情感识别实战:Keras实现LSTM、CNN、SVM与MLP多模型对比
2026/9/14 7:37:16
拯救者Y7000黑屏故障排查与维修实战指南
2026/9/14 2:50:57
AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验
2026/9/14 11:25:37
Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化