Skills observability-engineer
๐Ÿ“ฆ

observability-engineer

Content revision r2 Safe

Build Production Observability Systems

Fragmented telemetry obscures service health and delays incident response. This skill designs metrics, logs, traces, SLOs, dashboards, alerts, and operational workflows.

Supports: Claude Codex Code(CC)
๐Ÿฅ‰ 78 Bronze

Install with my Agent

Copy this request to your Agent. It includes the canonical Skill page and manifest.

Agent request
Review the Skillstore skill "observability-engineer" from https://skillstore.io/skills/sickn33-observability-engineer.md and its manifest at https://skillstore.io/api/skills/sickn33-observability-engineer/manifest. Verify the artifact. You may proceed after verification, subject to the environment's own policy.

Your Agent should still show its plan and request any confirmation required by the security policy.

Test it

Using "observability-engineer". Create monitoring guidance for a customer checkout API.

Expected outcome:

  • An SLI set covering successful checkouts, latency, dependency errors, and payment outcomes.
  • A dashboard plan linking user impact, service health, dependencies, and deployment changes.
  • Burn-rate alerts with investigation steps, ownership, and escalation guidance.

Using "observability-engineer". Plan tracing for a high-volume microservice platform.

Expected outcome:

  • An OpenTelemetry data flow from instrumentation through collectors to selected backends.
  • A sampling strategy that preserves errors and rare transactions while controlling cost.
  • A rollout plan covering validation, capacity, privacy, and failure handling.

Using "observability-engineer". Reduce noisy infrastructure alerts.

Expected outcome:

  • An alert inventory grouped by user impact, urgency, ownership, and actionability.
  • Recommendations for deduplication, dependency-aware routing, threshold tuning, and removal.
  • Success measures covering page volume, false positives, response time, and missed incidents.

Security Audit

Safe
v5 โ€ข 8/4/2026 Open versioned report

All three static findings are false positives caused by benign observability and access-control language. SKILL.md contains guidance only, with no commands, prompt injection, credential collection, or exfiltration intent.

1
Files scanned
241
Lines analyzed
0
Review items
0
False positives ignored
No confirmed security findings were detected by the latest completed static and semantic audit. This does not prove the skill has no side effects.
Audited by: codex View Audit History โ†’
Share & cite this report

Share the versioned assessment report, neutral badge, embed card, and citations. Skillstore reports evidence without deciding whether this Skill is safe.

Open versioned report
Security Assessment

Copy report link

https://skillstore.io/skills/sickn33-observability-engineer/audits/5?utm_source=security_passport&utm_medium=share&utm_campaign=versioned_report

Markdown badge

[![Skillstore security assessment](https://skillstore.io/badges/skills/sickn33-observability-engineer/security.svg)](https://skillstore.io/skills/sickn33-observability-engineer?utm_source=security_passport_badge)

HTML badge

<a href="https://skillstore.io/skills/sickn33-observability-engineer?utm_source=security_passport_badge"><img src="https://skillstore.io/badges/skills/sickn33-observability-engineer/security.svg" alt="Skillstore security assessment" loading="lazy"></a>

Embed card

<iframe src="https://skillstore.io/embed/skills/sickn33-observability-engineer.html" title="Skillstore Security Assessment" sandbox="allow-popups allow-popups-to-escape-sandbox" loading="lazy" referrerpolicy="no-referrer" width="420" height="180"></iframe>
Academic citations (APA ยท BibTeX ยท CFF)

APA citation

sickn33. (2026). observability-engineer security audit report (audit version 5) [Author version unspecified]. Skillstore. https://skillstore.io/skills/sickn33-observability-engineer/audits/5

BibTeX citation

@techreport{sickn33-sickn33-observability-engineer-2026, author = {sickn33}, title = {observability-engineer security audit report (audit version 5)}, institution = {Skillstore}, year = {2026}, number = {5}, url = {https://skillstore.io/skills/sickn33-observability-engineer/audits/5}, note = {Author version unspecified} }

CITATION.cff

cff-version: 1.2.0 message: "If you use this Skill, cite its author and this versioned security audit report." title: "observability-engineer security audit report (audit version 5)" version: "unspecified" type: report authors: - name: "sickn33" date-released: "2026-08-04" url: "https://skillstore.io/skills/sickn33-observability-engineer/audits/5" identifiers: - type: other value: "skillstore:sickn33-observability-engineer:audit:5" description: "Skillstore immutable audit report identifier"

Skillstore Score

Why this score Evidence Confidence: High
55
Architecture
85
Maintainability
87
Content
69
Community
83
Spec Compliance

What You Can Build

Define service reliability targets

Convert critical user journeys into measurable SLIs, SLOs, error budgets, and burn-rate alerts.

Investigate production regressions

Correlate metrics, logs, and traces to isolate latency, availability, and dependency failures.

Govern enterprise telemetry

Plan retention, access controls, data residency, reporting, and monitoring costs across complex environments.

Try These Prompts

Create a service monitoring plan
Create an observability plan for [service]. Include critical user journeys, key metrics, dashboard sections, alert thresholds, and required context.
Define service objectives
Define SLIs, SLOs, error budgets, and burn-rate alerts for [service] using these user journeys and reliability expectations: [details].
Analyze an incident
Analyze this incident evidence: [metrics, logs, traces]. Identify likely causes, missing signals, validation steps, and an investigation sequence.
Design an enterprise telemetry platform
Design a multi-region OpenTelemetry architecture for [environment]. Address collection, sampling, routing, retention, data residency, failure handling, costs, rollout, and validation.

Best Practices

  • Provide service architecture, user journeys, current telemetry, traffic patterns, and reliability targets.
  • Validate recommendations with production-like load, failure tests, and representative telemetry.
  • Review telemetry for secrets, personal data, retention obligations, and access-control requirements.

Avoid

  • Do not collect every available signal without a clear reliability or operational purpose.
  • Do not page responders for conditions without user impact, urgency, ownership, and a defined action.
  • Do not adopt generated configurations without environment-specific testing, capacity review, and rollback planning.

Frequently Asked Questions

Which observability tools does this skill cover?
It covers Prometheus, Grafana, OpenTelemetry, Jaeger, Loki, ELK, Splunk, cloud monitoring services, and related enterprise tools.
Can it define SLIs and SLOs?
Yes. Provide user journeys, service boundaries, reliability expectations, measurement windows, and available telemetry.
Can it troubleshoot a live incident?
It can analyze supplied evidence and propose investigation steps, but it cannot access or change live systems.
Does it generate deployment-ready configurations?
It can propose configurations and architecture, but every output requires testing, security review, and environment-specific validation.
Can it help control telemetry costs?
Yes. It can assess sampling, cardinality, retention, storage tiers, backend selection, and collection scope.
Does it support regulated environments?
It considers access, retention, audit, residency, and privacy requirements, but qualified reviewers must confirm compliance.

Developer Details

Author

sickn33

License

MIT

Skillstore revision

r2

Version notice

The author did not declare a version.

Ref

81e05e636292629114b76cbb3922fbe57672fc02

Maintenance freshness

8/5/2026

Usage

9 downloads ยท 142 views

File structure

๐Ÿ“„ SKILL.md

More from sickn33

View all
View all