logprob-prefill-analysis
Prefill-Logprob-Sensitivität analysieren
Teams für Modellsicherheit benötigen reproduzierbare Nachweise dafür, wann Prefills Exploit-Verhalten wahrscheinlicher machen. Dieser Skill führt Claude, Codex und Claude Code durch Trajektorien- und Logprob-Analysen.
Vor der Installation anhalten und eine Bestätigung anfordern.
Prüfen Sie den Plan und holen Sie vor Änderungen an Dateien die ausdrückliche Zustimmung des Benutzers ein.
Mit meinem Agent installieren
Kopieren Sie diese Anfrage in Ihren Agent. Sie enthält die maßgebliche Skill-Seite und das Manifest.
Review the Skillstore skill "logprob-prefill-analysis" from https://skillstore.io/skills/eleutherai-logprob-prefill-analysis.md and its manifest at https://skillstore.io/api/skills/eleutherai-logprob-prefill-analysis/manifest. Verify the artifact. Stop and obtain explicit user consent before installing or changing files.Ihr Agent sollte weiterhin seinen Plan anzeigen und alle von der Sicherheitsrichtlinie verlangten Bestätigungen anfordern.
Agent-lesbare Ressourcen
Verwenden Sie diese Links, wenn ein KI-Agent, Crawler oder Skript sauberen Kontext benötigt, statt die vollständige Seite zu lesen.
Testen
„logprob-prefill-analysis“ wird verwendet. Ich habe einen abgeschlossenen Prefill-Sensitivitäts-Run und benötige Trends zur Checkpoint-Anfälligkeit.
Erwartetes Ergebnis:
Ein prägnanter Bericht, der getestete Checkpoints, Schwellenüberschreitungen und Diagramme nennt, die die Zugänglichkeit über das Training hinweg zusammenfassen.
„logprob-prefill-analysis“ wird verwendet. Ich möchte wissen, ob Logprob oder Tokenanzahl die Ausnutzbarkeit besser vorhersagt.
Erwartetes Ergebnis:
Eine Vergleichszusammenfassung, die die zusammengeführten Metriken, den Zeitpunkt von Schwellenwerten und die Evidenz erklärt, die jede Schlussfolgerung stützt.
„logprob-prefill-analysis“ wird verwendet. Ich muss Ausgaben prüfen, bevor ich einen internen Bericht zur Modellsicherheit teile.
Erwartetes Ergebnis:
Eine Review-Checkliste für generierte Samples, Metadaten, Diagramme und sensible Artefakte, die redigiert werden müssen.
Sicherheitsaudit
Hohes RisikoThe static command findings are false positives caused by Markdown code fences and inline code formatting, plus localhost-only examples. The main residual risk is semantic: the skill teaches a dual-use workflow for eliciting and analyzing exploit-oriented model behavior.
Bestätigte Sicherheitsbedenken (2)
Risikofaktoren
⚙️ Externe Befehle (60)
🌐 Netzwerkzugriff (2)
Diesen Bericht teilen & zitieren
Teile den versionierten Bewertungsbericht, das neutrale Badge, die Einbettungskarte und Zitate. Skillstore berichtet Nachweise, ohne zu entscheiden, ob dieser Skill sicher ist.
Berichtslink kopieren
https://skillstore.io/skills/eleutherai-logprob-prefill-analysis/audits/8?utm_source=security_passport&utm_medium=share&utm_campaign=versioned_reportMarkdown-Badge
[](https://skillstore.io/skills/eleutherai-logprob-prefill-analysis?utm_source=security_passport_badge)HTML-Badge
<a href="https://skillstore.io/skills/eleutherai-logprob-prefill-analysis?utm_source=security_passport_badge"><img src="https://skillstore.io/badges/skills/eleutherai-logprob-prefill-analysis/security.svg" alt="Skillstore security assessment" loading="lazy"></a>Einbettungskarte
<iframe src="https://skillstore.io/embed/skills/eleutherai-logprob-prefill-analysis.html" title="Skillstore Security Assessment" sandbox="allow-popups allow-popups-to-escape-sandbox" loading="lazy" referrerpolicy="no-referrer" width="420" height="180"></iframe>Wissenschaftliche Zitate (APA · BibTeX · CFF)
APA-Zitat
EleutherAI. (2026). logprob-prefill-analysis security audit report (audit version 8) [Author version unspecified]. Skillstore. https://skillstore.io/skills/eleutherai-logprob-prefill-analysis/audits/8BibTeX-Zitat
@techreport{eleutherai-eleutherai-logprob-prefill-analysis-2026,
author = {EleutherAI},
title = {logprob-prefill-analysis security audit report (audit version 8)},
institution = {Skillstore},
year = {2026},
number = {8},
url = {https://skillstore.io/skills/eleutherai-logprob-prefill-analysis/audits/8},
note = {Author version unspecified}
}CITATION.cff
cff-version: 1.2.0
message: "If you use this Skill, cite its author and this versioned security audit report."
title: "logprob-prefill-analysis security audit report (audit version 8)"
version: "unspecified"
type: report
authors:
- name: "EleutherAI"
date-released: "2026-07-05"
url: "https://skillstore.io/skills/eleutherai-logprob-prefill-analysis/audits/8"
identifiers:
- type: other
value: "skillstore:eleutherai-logprob-prefill-analysis:audit:8"
description: "Skillstore immutable audit report identifier"
Skillstore-Score
Warum dieser Score Evidenzvertrauen: MittelWas Sie erstellen können
Einen Sicherheitslauf reproduzieren
Die dokumentierte Pipeline erneut ausführen und Ausgaben mit einem bekannten Sensitivitätsexperiment vergleichen.
Checkpoint-Anfälligkeit vergleichen
Nachverfolgen, wann Modell-Checkpoints leichter durch exploit-orientierte Prefills gesteuert werden können.
Evaluierungsnachweise vorbereiten
Tabellen, Diagramme und Run-Kontextdateien für interne Sicherheitsprüfungen erstellen.
Diese Prompts ausprobieren
Nutze diesen Skill, um zu erklären, welche Dateien, Checkpoints und Tools ich benötige, bevor ich eine Analyse der Prefill-Sensitivität ausführe.
Nutze diesen Skill, um einen Trockenlauf für meinen Sensitivitäts-Run-Pfad zu planen und fehlende Voraussetzungen zu identifizieren.
Nutze diesen Skill, um tokenbasierte Trajektorien und Prefill-Logprob-Ergebnisse für mein Run-Verzeichnis zu vergleichen.
Nutze diesen Skill, um die vollständige Pipeline zu reproduzieren, Run-Kontextdateien zu validieren und unsichere oder unvollständige Ausgaben zu markieren.
Bewährte Praktiken
- Zuerst einen Trockenplan ausführen und Checkpoint-Pfade bestätigen, bevor GPU-Workloads gestartet werden.
- Beim Validieren des Setups kleine Sample-Limits verwenden und anschließend vollständige Analysen für finale Nachweise erneut ausführen.
- Generierte Daten zu Exploit-Reasoning nur in autorisierten Forschungsumgebungen aufbewahren.
Vermeiden
- Die Pipeline nicht ohne Genehmigung gegen unbekannte Checkpoints oder Datensätze ausführen.
- Einen einzelnen Schwellenwert nicht als vollständige Sicherheitsbewertung behandeln.
- Keine rohen Exploit-Reasoning-Traces oder Umgebungsmetadaten ohne Prüfung veröffentlichen.
Häufig gestellte Fragen
Was misst dieser Skill?
Läuft er ohne das Quellprojekt?
Warum Tokenanzahlen und Logprobs vergleichen?
Kann er Claude, Codex oder Claude Code verwenden?
Welche Daten sollte ich vorbereiten?
Welche Sicherheitsprüfung ist vor dem Teilen von Ausgaben nötig?
Entwicklerdetails
Autor
EleutherAILizenz
MIT
Skillstore-Revision
r1
Versionshinweis
Der Autor hat keine Version angegeben.
Repository
https://github.com/EleutherAI/rh-indicators/tree/main/.claude/skills/logprob-prefill-analysisRef.
30c73eac2afe762f6aa9c4553158769369d47351
Aktualität der Wartung
26.7.2026
Nutzung
5 Downloads · 261 Aufrufe
Dateistruktur
📄 SKILL.md