evaluation
Agentensysteme mit Bewertungsrastern evaluieren
Agententeams benötigen wiederholbare Methoden, um Qualität, Regressionen und Kontextänderungen zu messen. Diese Skill unterstützt bei der Gestaltung von Bewertungsrastern, Testsets, Scoring und Monitoring.
Mit meinem Agent installieren
Kopieren Sie diese Anfrage in Ihren Agent. Sie enthält die maßgebliche Skill-Seite und das Manifest.
Review the Skillstore skill "evaluation" from https://skillstore.io/skills/muratcankoylan-evaluation.md and its manifest at https://skillstore.io/api/skills/muratcankoylan-evaluation/manifest. Verify the artifact. You may proceed after verification, subject to the environment's own policy.Ihr Agent sollte weiterhin seinen Plan anzeigen und alle von der Sicherheitsrichtlinie verlangten Bestätigungen anfordern.
Agent-lesbare Ressourcen
Verwenden Sie diese Links, wenn ein KI-Agent, Crawler oder Skript sauberen Kontext benötigt, statt die vollständige Seite zu lesen.
Testen
„evaluation“ wird verwendet. Erstelle ein Bewertungsraster für einen Research-Assistant-Agenten.
Erwartetes Ergebnis:
Ein gewichtetes Bewertungsraster mit faktischer Genauigkeit, Vollständigkeit, Zitiergenauigkeit, Quellenqualität und Werkzeugeffizienz. Es enthält Bewertungsstufen und eine Bestehensschwelle.
„evaluation“ wird verwendet. Entwirf Tests für einen Kundensupport-Agenten.
Erwartetes Ergebnis:
Ein nach Komplexität gruppiertes Testset, einschließlich einfacher Richtlinienabfragen, mehrstufiger Fehlerbehebung, Eskalationsfälle und mehrdeutiger Kundenanfragen.
„evaluation“ wird verwendet. Plane Monitoring für einen bereitgestellten Agenten.
Erwartetes Ergebnis:
Ein Monitoring-Ansatz mit Stichprobeninteraktionen, Bestehensraten-Schwellen, Score-Trends, Alarmregeln und regelmäßiger menschlicher Prüfung.
Sicherheitsaudit
SicherAll 29 static findings are false positives caused by Python mapping methods, documentation markup, ordinary prose, comments, or YAML examples. The reviewed files contain no command execution, sensitive file access, system reconnaissance, prompt injection, or other semantic security concern.
Risikofaktoren
⚙️ Externe Befehle (18)
Diesen Bericht teilen & zitieren
Teile den versionierten Bewertungsbericht, das neutrale Badge, die Einbettungskarte und Zitate. Skillstore berichtet Nachweise, ohne zu entscheiden, ob dieser Skill sicher ist.
Berichtslink kopieren
https://skillstore.io/skills/muratcankoylan-evaluation/audits/8?utm_source=security_passport&utm_medium=share&utm_campaign=versioned_reportMarkdown-Badge
[](https://skillstore.io/skills/muratcankoylan-evaluation?utm_source=security_passport_badge)HTML-Badge
<a href="https://skillstore.io/skills/muratcankoylan-evaluation?utm_source=security_passport_badge"><img src="https://skillstore.io/badges/skills/muratcankoylan-evaluation/security.svg" alt="Skillstore security assessment" loading="lazy"></a>Einbettungskarte
<iframe src="https://skillstore.io/embed/skills/muratcankoylan-evaluation.html" title="Skillstore Security Assessment" sandbox="allow-popups allow-popups-to-escape-sandbox" loading="lazy" referrerpolicy="no-referrer" width="420" height="180"></iframe>Wissenschaftliche Zitate (APA · BibTeX · CFF)
APA-Zitat
muratcankoylan. (2026). evaluation security audit report (audit version 8) [Author version unspecified]. Skillstore. https://skillstore.io/skills/muratcankoylan-evaluation/audits/8BibTeX-Zitat
@techreport{muratcankoylan-muratcankoylan-evaluation-2026,
author = {muratcankoylan},
title = {evaluation security audit report (audit version 8)},
institution = {Skillstore},
year = {2026},
number = {8},
url = {https://skillstore.io/skills/muratcankoylan-evaluation/audits/8},
note = {Author version unspecified}
}CITATION.cff
cff-version: 1.2.0
message: "If you use this Skill, cite its author and this versioned security audit report."
title: "evaluation security audit report (audit version 8)"
version: "unspecified"
type: report
authors:
- name: "muratcankoylan"
date-released: "2026-08-09"
url: "https://skillstore.io/skills/muratcankoylan-evaluation/audits/8"
identifiers:
- type: other
value: "skillstore:muratcankoylan-evaluation:audit:8"
description: "Skillstore immutable audit report identifier"
Varianten vergleichen
4 installierbare VariantenJeder Autor bleibt ein eigener installierbarer Skill. Die empfohlene Variante wird nach Skillstore-Nachweisen bewertet.
Warum diese Variante zuerst steht
muratcankoylan-evaluation
2026-09-09
chakshugautam-evaluation
2026-09-09
sickn33-evaluation
2026-09-09
asmayaseen-evaluation
2026-09-09
Skillstore-Score
Warum dieser Score Evidenzvertrauen: HochWas Sie erstellen können
Quality Gates für Releases erstellen
Erstelle Bewertungsraster und Testsets, die Agenten-Regressionen vor dem Deployment erkennen.
Agentenversionen vergleichen
Messe Qualitätsänderungen über Prompts, Modelle, Tools und Kontextstrategien hinweg.
Evaluationsstudien entwerfen
Strukturiere Benchmark-Aufgaben, Scoring-Dimensionen und Review-Workflows für die Agentenforschung.
Diese Prompts ausprobieren
Erstelle ein mehrdimensionales Evaluations-Bewertungsraster für meinen Agenten. Der Agent bearbeitet [task type]. Füge Dimensionen, Gewichtungen, Bestehensschwelle und Review-Leitlinien hinzu.
Entwirf ein Testset für [agent workflow]. Füge einfache, mittlere, komplexe und sehr komplexe Fälle hinzu. Ergänze erwartete Ergebnisse und Edge Cases.
Entwirf eine Evaluationspipeline für [agent system]. Füge Datenerfassung, Scoring, LLM-as-judge-Prompts, menschliche Prüfung, Bestehens-Gates und Reporting hinzu.
Überprüfe meinen Produktions-Evaluationsplan für [agent product]. Identifiziere fehlende Metriken, Sampling-Risiken, Alarmschwellen und Anforderungen an menschliche Prüfung.
Bewährte Praktiken
- Evaluiere Ergebnisse und Prozessqualität, statt einen einzigen exakten Ausführungspfad zu verlangen.
- Verwende mehrere Bewertungsdimensionen, damit Genauigkeit, Vollständigkeit, Zitate, Quellen und Tool-Nutzung sichtbar werden.
- Kombiniere automatisierte Bewertung mit menschlicher Prüfung für Edge Cases und folgenschwere Workflows.
Vermeiden
- Sich auf einen einzigen Gesamtscore verlassen, ohne Fehler auf Dimensionsebene zu untersuchen.
- Nur einfache Fälle testen, die reale Nutzung oder lange Interaktionen nicht repräsentieren.
- Prompts, Tools oder Modelle ändern, ohne ein stabiles Regressions-Testset erneut auszuführen.
Häufig gestellte Fragen
Was evaluiert diese Skill?
Enthält sie ausführbaren Code?
Kann ich sie mit Claude, Codex und Claude Code verwenden?
Ersetzt sie menschliche Evaluation?
Welche Metriken betont sie?
Wann sollten Teams sie verwenden?
Entwicklerdetails
Autor
muratcankoylanLizenz
MIT
Skillstore-Revision
r2
Versionshinweis
Der Autor hat keine Version angegeben.
Repository
https://github.com/muratcankoylan/Agent-Skills-for-Context-Engineering/tree/main/skills/evaluationRef.
02be9409c79ca1183f7844009c14d9df684d0cf9
Aktualität der Wartung
11.8.2026
Nutzung
10 Downloads · 254 Aufrufe
Dateistruktur