pinchbench
OpenClaw-Agenten mit PinchBench benchmarken
Modellteams benötigen wiederholbare Nachweise zur Agentenleistung. PinchBench führt strukturierte OpenClaw-Aufgaben aus und erstellt vergleichbare Scores für Analyse und Leaderboard-Einreichung.
Diesen Skill nicht automatisch installieren.
Die maßgebliche Richtlinie verlangt vor jeder Installationsaktion eine Prüfung durch einen Bediener.
Mit meinem Agent installieren
Kopieren Sie diese Anfrage in Ihren Agent. Sie enthält die maßgebliche Skill-Seite und das Manifest.
Review the Skillstore skill "pinchbench" from https://skillstore.io/skills/pinchbench-pinchbench.md and its manifest at https://skillstore.io/api/skills/pinchbench-pinchbench/manifest. Verify the artifact. Do not auto-install. Inspect the skill and report your findings, then wait for an operator or manual installation decision.Ihr Agent sollte weiterhin seinen Plan anzeigen und alle von der Sicherheitsrichtlinie verlangten Bestätigungen anfordern.
Agent-lesbare Ressourcen
Verwenden Sie diese Links, wenn ein KI-Agent, Crawler oder Skript sauberen Kontext benötigt, statt die vollständige Seite zu lesen.
Testen
„pinchbench“ wird verwendet. Führe die automatisierte Suite für ein Modell aus, ohne hochzuladen.
Erwartetes Ergebnis:
Der Lauf endet mit Scores pro Aufgabe, einem Gesamtscore, Token-Nutzung, Kostenmetriken und einem lokalen Ergebnisdateipfad.
„pinchbench“ wird verwendet. Vergleiche zwei gespeicherte Benchmark-Läufe.
Erwartetes Ergebnis:
Der Vergleich hebt Score-Unterschiede, fehlgeschlagene Aufgaben, Änderungen der Ausführungszeit und Tradeoffs bei der Kosteneffizienz hervor.
„pinchbench“ wird verwendet. Entwirf eine neue Benchmark-Aufgabe für E-Mail-Triage.
Erwartetes Ergebnis:
Der Aufgabenentwurf enthält einen Prompt, erwartetes Verhalten, Bewertungskriterien und automatisierte Prüfungen für wiederholbares Scoring.
Sicherheitsaudit
KritischPinchBench is a legitimate benchmark runner, but it is not low risk. Confirmed issues include pipe-to-shell dependency installation, unsandboxed task grading code, external agent execution, token handling, and host metadata upload. Many documentation and task-rubric alerts are false positives, while binary assets remain manual-review blind spots.
Bestätigte Sicherheitsbedenken (6)
Elemente der Fähigkeitsprüfung (29)
Dies sind echte lokale Fähigkeiten, die für diese Fähigkeit erwartet werden können; daher müssen sie überprüft werden, werden jedoch nicht als bestätigtes bösartiges Verhalten gezählt.
Risikofaktoren
⚙️ Externe Befehle (50)
🌐 Netzwerkzugriff (13)
📁 Dateisystemzugriff (12)
⚡ Enthält Skripte (2)
🔑 Umgebungsvariablen (13)
Erkannte Muster
Diesen Bericht teilen & zitieren
Teile den versionierten Bewertungsbericht, das neutrale Badge, die Einbettungskarte und Zitate. Skillstore berichtet Nachweise, ohne zu entscheiden, ob dieser Skill sicher ist.
Berichtslink kopieren
https://skillstore.io/skills/pinchbench-pinchbench/audits/5?utm_source=security_passport&utm_medium=share&utm_campaign=versioned_reportMarkdown-Badge
[](https://skillstore.io/skills/pinchbench-pinchbench?utm_source=security_passport_badge)HTML-Badge
<a href="https://skillstore.io/skills/pinchbench-pinchbench?utm_source=security_passport_badge"><img src="https://skillstore.io/badges/skills/pinchbench-pinchbench/security.svg" alt="Skillstore security assessment" loading="lazy"></a>Einbettungskarte
<iframe src="https://skillstore.io/embed/skills/pinchbench-pinchbench.html" title="Skillstore Security Assessment" sandbox="allow-popups allow-popups-to-escape-sandbox" loading="lazy" referrerpolicy="no-referrer" width="420" height="180"></iframe>Wissenschaftliche Zitate (APA · BibTeX · CFF)
APA-Zitat
pinchbench. (2026). pinchbench security audit report (audit version 5) [Author version 1.0.0]. Skillstore. https://skillstore.io/skills/pinchbench-pinchbench/audits/5BibTeX-Zitat
@techreport{pinchbench-pinchbench-pinchbench-2026,
author = {pinchbench},
title = {pinchbench security audit report (audit version 5)},
institution = {Skillstore},
year = {2026},
number = {5},
url = {https://skillstore.io/skills/pinchbench-pinchbench/audits/5},
note = {Author version 1.0.0}
}CITATION.cff
cff-version: 1.2.0
message: "If you use this Skill, cite its author and this versioned security audit report."
title: "pinchbench security audit report (audit version 5)"
version: "1.0.0"
type: report
authors:
- name: "pinchbench"
date-released: "2026-07-09"
url: "https://skillstore.io/skills/pinchbench-pinchbench/audits/5"
identifiers:
- type: other
value: "skillstore:pinchbench-pinchbench:audit:5"
description: "Skillstore immutable audit report identifier"
Skillstore-Score
Warum dieser Score Evidenzvertrauen: MittelWas Sie erstellen können
Modellleistung vergleichen
Führe dieselbe OpenClaw-Aufgabensuite über mehrere Modelle hinweg aus und vergleiche Scores, Kosten und Abschlusszeit.
OpenClaw-Workflows auf Regressionen testen
Prüfe, ob aktuelle Änderungen an Agent, Skill oder Umgebung die Qualität der Aufgabenerledigung beeinflussen.
Neue Benchmark-Aufgaben entwerfen
Nutze die Aufgabenvorlage und Bewertungsmuster, um wiederholbare Evaluationen für neue Agenten-Workflows hinzuzufügen.
Diese Prompts ausprobieren
Führe PinchBench mit MODEL auf der automatisierten Suite aus und speichere die Ergebnisse lokal, ohne sie hochzuladen.
Führe PinchBench für MODEL_A und MODEL_B auf derselben Aufgabensuite aus und fasse anschließend Unterschiede bei Score, Kosten und Timing zusammen.
Prüfe die neuesten PinchBench-Ergebnisse und identifiziere Aufgaben mit einem Score unter 0.5, inklusive wahrscheinlicher Ursachen und nächster Debugging-Schritte.
Erstelle eine fokussierte PinchBench-Suite für Workflow-Automatisierungsaufgaben, füge Bewertungskriterien hinzu und erkläre, wie sie sicher ausgeführt wird.
Bewährte Praktiken
- Führe Läufe mit deaktiviertem Upload aus, bis du verstehst, welche Daten eingereicht werden.
- Verwende einen dedizierten Benchmark-Workspace und Test-Zugangsdaten für Modellanbieter.
- Prüfe den Bewertungscode benutzerdefinierter Aufgaben, bevor du seine lokale Ausführung erlaubst.
Vermeiden
- Führe die vollständige Suite nicht auf einem primären Workspace aus, bevor ein Plausibilitätscheck erfolgt ist.
- Lade Benchmark-Ergebnisse nicht hoch, bevor Metadaten und Token-Einstellungen geprüft wurden.
- Füge keine benutzerdefinierten Aufgaben mit breitem Dateisystem- oder Shell-Zugriff im Bewertungscode hinzu.
Häufig gestellte Fragen
Was evaluiert PinchBench?
Welche Tools unterstützt dieser Skill?
Erfordert es Netzwerkzugriff?
Wo werden Ergebnisse gespeichert?
Kann ich nur ausgewählte Aufgaben ausführen?
Was sollte ich vor der Veröffentlichung prüfen?
Entwicklerdetails
Autor
pinchbenchLizenz
MIT
Autorenversion
v1.0.0
Skillstore-Revision
r1
Ref.
3e4b6c31a74a3bd1a291c98cf585d720cb9fbc88
Aktualität der Wartung
18.7.2026
Nutzung
16 Downloads · 290 Aufrufe
Dateistruktur