# Build Production Observability Systems

Fragmented telemetry obscures service health and delays incident response. This skill designs metrics, logs, traces, SLOs, dashboards, alerts, and operational workflows.

## Install

```bash
npx skillstore add sickn33/observability-engineer
```

## Metadata

- Status: approved
- Slug: sickn33-observability-engineer
- Skillstore revision: r2
- Version status: missing
- Tree hash: 4b0e36c52b54daa8b6b7f64e401ea9f27c050a991ad96f313076f8826dfd5443
- Author: sickn33
- GitHub username: sickn33
- License: MIT
- Repository: https://github.com/sickn33/antigravity-awesome-skills/tree/main/skills/observability-engineer
- Ref: 81e05e636292629114b76cbb3922fbe57672fc02
- Supported tools: Claude, Codex, Claude Code
- Audit status: complete
- Agent install advisory: allowed
- Manual install advisory: allowed
- Artifact signature: available
- Audit attestation: unavailable
- Human verification: not\_verified
- Quality score: 78
- Quality tier: bronze
- Public page: https://skillstore.pages.dev/skills/sickn33-observability-engineer
- Manifest: https://skillstore.pages.dev/api/skills/sickn33-observability-engineer/manifest

## Capabilities

- Designs monitoring architectures for cloud, Kubernetes, microservice, serverless, and hybrid environments.
- Defines SLIs, SLOs, error budgets, burn-rate alerts, and reliability reporting.
- Plans metrics, structured logging, distributed tracing, sampling, retention, and telemetry correlation.
- Creates dashboard, alert-routing, runbook, escalation, and post-incident analysis strategies.
- Evaluates observability tools, costs, compliance requirements, access controls, and data residency.
- Develops OpenTelemetry collection, processing, and multi-backend export designs.

## Use Cases

- Define service reliability targets: Convert critical user journeys into measurable SLIs, SLOs, error budgets, and burn-rate alerts.
- Investigate production regressions: Correlate metrics, logs, and traces to isolate latency, availability, and dependency failures.
- Govern enterprise telemetry: Plan retention, access controls, data residency, reporting, and monitoring costs across complex environments.

## Prompt Templates

### Create a service monitoring plan

```
Create an observability plan for [service]. Include critical user journeys, key metrics, dashboard sections, alert thresholds, and required context.
```

### Define service objectives

```
Define SLIs, SLOs, error budgets, and burn-rate alerts for [service] using these user journeys and reliability expectations: [details].
```

### Analyze an incident

```
Analyze this incident evidence: [metrics, logs, traces]. Identify likely causes, missing signals, validation steps, and an investigation sequence.
```

### Design an enterprise telemetry platform

```
Design a multi-region OpenTelemetry architecture for [environment]. Address collection, sampling, routing, retention, data residency, failure handling, costs, rollout, and validation.
```

## Limitations

- Requires environment details, telemetry samples, reliability targets, and operational constraints for specific recommendations.
- Does not directly deploy infrastructure, query live systems, or validate production behavior.
- Cannot replace security, compliance, or legal review for regulated telemetry.
- Recommendations require testing for scale, cost, signal quality, and alert noise.

## Best Practices

- Provide service architecture, user journeys, current telemetry, traffic patterns, and reliability targets.
- Validate recommendations with production-like load, failure tests, and representative telemetry.
- Review telemetry for secrets, personal data, retention obligations, and access-control requirements.

## Anti Patterns

- Do not collect every available signal without a clear reliability or operational purpose.
- Do not page responders for conditions without user impact, urgency, ownership, and a defined action.
- Do not adopt generated configurations without environment-specific testing, capacity review, and rollback planning.

## Security Audit

- Audited at: 2026-08-04T16:29:49.859\+00:00
- Summary: All three static findings are false positives caused by benign observability and access-control language. SKILL.md contains guidance only, with no commands, prompt injection, credential collection, or exfiltration intent.

## Stats

- Views: 142
- Downloads: 11
- Favorites: 0
- Popularity score: 0
