# Build Production Observability Systems

Teams often lack consistent visibility across metrics, logs, traces, and service health. This skill creates practical monitoring architectures, implementation plans, dashboards, alerts, and SLO guidance.

## Install

```bash
npx skillstore add sickn33/observability-monitoring-monitor-setup
```

## Metadata

- Status: approved
- Slug: sickn33-observability-monitoring-monitor-setup
- Skillstore revision: r2
- Version status: missing
- Tree hash: 6e0e2c0c3d23eab4468142063be1c2b76530478dc0074b5deeeeb0c8f02d13bb
- Author: sickn33
- GitHub username: sickn33
- License: MIT
- Repository: https://github.com/sickn33/antigravity-awesome-skills/tree/main/skills/observability-monitoring-monitor-setup
- Ref: 81e05e636292629114b76cbb3922fbe57672fc02
- Supported tools: Claude, Codex, Claude Code
- Audit status: complete
- Agent install advisory: allowed
- Manual install advisory: allowed
- Artifact signature: available
- Audit attestation: unavailable
- Human verification: not\_verified
- Risk factors: external\_commands, network, env\_access
- Quality score: 70
- Public page: https://skillstore.pages.dev/skills/sickn33-observability-monitoring-monitor-setup
- Manifest: https://skillstore.pages.dev/api/skills/sickn33-observability-monitoring-monitor-setup/manifest

## Capabilities

- Assesses existing monitoring coverage and identifies gaps across metrics, logs, traces, dashboards, and alerts.
- Designs monitoring architectures using Prometheus, Grafana, OpenTelemetry, Jaeger, Fluentd, Elasticsearch, and Alertmanager patterns.
- Defines service metrics, PromQL queries, dashboard panels, alert thresholds, and notification routes.
- Creates SLO targets, error-budget queries, and burn-rate alert guidance.
- Provides instrumentation examples for TypeScript and Python services.
- Outlines Terraform-based deployment patterns for monitoring components.

## Use Cases

- Establish Startup Monitoring: Create a focused metrics, dashboard, alert, and tracing plan for a growing service platform.
- Standardize Service Observability: Define reusable instrumentation, SLO, and dashboard conventions across multiple application teams.
- Improve Incident Visibility: Review current telemetry and propose actionable alerts, correlated traces, and diagnostic dashboards.

## Prompt Templates

### Create a Basic Monitoring Plan

```
Create a monitoring plan for [service]. Cover key metrics, one dashboard, essential alerts, and simple verification steps.
```

### Design an Observability Stack

```
Design an observability architecture for [environment] with [services]. Include metrics, logs, traces, storage, access controls, deployment phases, and validation.
```

### Define SLOs and Alerts

```
Define user-focused SLIs and SLOs for [service]. Add error budgets, multi-window burn-rate alerts, ownership, escalation, and runbook requirements.
```

### Audit Production Observability

```
Audit the observability design described below. Identify coverage gaps, cardinality risks, sensitive logging, alert fatigue, failure modes, costs, and phased remediations: [details].
```

## Limitations

- Generated configurations require validation against installed versions, infrastructure, and organizational policies.
- The skill does not deploy services, inspect live telemetry, or verify production permissions.
- Example thresholds and retention values are starting points, not universal production defaults.
- Logging examples require additional secret redaction and privacy controls.

## Best Practices

- Start with user-impact signals and service objectives before adding infrastructure metrics.
- Control metric label cardinality and define telemetry retention from expected volume and investigation needs.
- Test alerts, dashboards, trace correlation, redaction, and collector failure behavior before production rollout.

## Anti Patterns

- Do not page on every threshold breach without user impact, ownership, and a response action.
- Do not place secrets, personal data, or unrestricted request context in logs or telemetry attributes.
- Do not adopt example configurations without version checks, capacity estimates, access controls, and environment-specific validation.

## Security Audit

- Audited at: 2026-08-04T16:32:37.194\+00:00
- Summary: All 20 static findings are false positives caused by documentation syntax, internal service URLs, and ordinary environment configuration. One medium-risk semantic issue remains: the logging example lacks redaction guidance for arbitrary context and exception details.

## Stats

- Views: 106
- Downloads: 9
- Favorites: 0
- Popularity score: 0
