产品技术提示词 (共 2,000 条结果)

在当前分类下为您检索最优质的 AI 提示词指令。

设计自动化巡检机器人脚本
变被动报警为主动体检,提前发现隐患。
优化事故定位与根因分析效率
缩短MTTK(平均知晓时间),快速找到故障源头。
制定服务依赖关系梳理图谱
绘制全景架构图,识别强弱依赖与单点风险。
构建SRE混沌工程实验计划
建立常态化的故障演练机制,主动发现系统脆弱点。
设计基础设施即代码IaC管理
规范Terraform/Ansible代码,实现基础设施的版本化与自动化。
优化服务健康检查探针逻辑
精细化设计K8s Probes,防止“假死”或“雪崩”。
制定关键指标异常检测算法
利用统计学或机器学习算法自动发现“异常”,替代静态阈值。
构建SRE运维统一操作平台
整合分散的工具,打造“一站式”运维门户。
设计全链路追踪TraceID规范
统一异构系统的追踪标准,确保端到端的可观测性。
优化日志级别与留存策略
解决日志量爆炸、成本高昂且查询慢的问题。
制定变更管理风险评估标准
量化变更风险,实施分级管控(Change Freeze/Approval)。
构建容量规划与预测模型
科学预测资源需求,避免资源浪费或容量不足。
设计SRE应急响应作战手册
针对特定故障场景的标准化操作指南(Playbook)。
优化系统可观测性埋点覆盖
确保监控数据的完整性,覆盖RED(流量/错误/延迟)与USE(利用率/饱和度/错误)指标。
制定告警降噪与抑制规则
解决“狼来了”效应,让SRE只关注真正需要处理的问题。
构建自动化故障修复脚本库
将人工Runbook转化为可执行代码,实现自愈(Self-Healing)。
设计事故复盘Postmortem模板
建立“免责(Blameless)”复盘文化,从失败中学习。
优化SRE值班轮换On-call流程
设计人性化的On-call机制,减轻值班疲劳,防止SRE离职。
制定错误预算ErrorBudget消耗策略
明确当系统稳定性下降时,研发与运维应采取的具体行动。
设定服务等级目标SLO阈值
协助SRE团队定义科学的SLO,平衡系统稳定性与迭代速度。
1 81 82 83 84 85 100