pufferlib
高速なPufferLib RLワークフローを構築
強化学習プロジェクトでは、学習速度、環境設計、ポリシー構造を慎重に設定する必要があります。このスキルは、実践的な実装のためのPufferLibワークフロー、テンプレート、リファレンスガイダンスを提供します。
自分のエージェントでインストール
このリクエストをエージェントにコピーしてください。正規の Skill ページとマニフェストが含まれています。
Review the Skillstore skill "pufferlib" from https://skillstore.io/skills/davila7-pufferlib.md and its manifest at https://skillstore.io/api/skills/davila7-pufferlib/manifest. Verify the artifact. You may proceed after verification, subject to the environment's own policy.エージェントは引き続き計画を提示し、セキュリティポリシーで必要な確認を求める必要があります。
エージェントが読めるリソース
AI エージェント、クローラー、スクリプトがページ全体ではなく整理されたコンテキストを必要とする場合は、これらのリンクを使ってください。
テストする
「pufferlib」を使用しています。 PufferLibでProcgen CoinRun PPOエージェントをトレーニングする。
期待される結果:
- 推奨される並列環境数を含む環境セットアップ。
- ポリシー選択、ロギング、チェックポイント、評価を扱うトレーニングワークフロー。
- 報酬、観測、スループット、保存済みモデルの検証手順。
「pufferlib」を使用しています。 協調ナビゲーション環境を作成する。
期待される結果:
- エージェントごとの観測、離散行動、共有エピソード状態を含むPufferEnv設計。
- 距離、目標達成、時間制限に関する報酬設計ガイダンス。
- リセット動作、ステップ出力、マルチエージェントのdoneフラグのテストチェックリスト。
「pufferlib」を使用しています。 私のRLトレーニングが想定より遅い。
期待される結果:
- 環境コスト、ワーカー数、バッチサイズ、デバイス使用を扱うボトルネックレビュー。
- ベクトル化、プロファイリング、任意のネイティブ最適化に関する優先順位付き調整計画。
セキュリティ監査
中リスクAll 77 static alerts are false positives caused by RL environment names, Markdown formatting, ordinary assertions, documentation links, and expected checkpoint setup. One medium-risk credential issue remains because a Neptune token is accepted on the command line and can enter WandB configuration through vars(args). No prompt injection or malicious intent was found.
確認済みのセキュリティ上の懸念 (1)
リスク要因
📁 ファイルシステムへのアクセス (1)
⚙️ 外部コマンド (41)
🌐 ネットワークアクセス (2)
このレポートを共有・引用
バージョン付き評価レポート、中立的なバッジ、埋め込みカード、引用を共有できます。Skillstore は証拠を報告しますが、この Skill が安全かどうかは判断しません。
レポートリンクをコピー
https://skillstore.io/skills/davila7-pufferlib/audits/9?utm_source=security_passport&utm_medium=share&utm_campaign=versioned_reportMarkdownバッジ
[](https://skillstore.io/skills/davila7-pufferlib?utm_source=security_passport_badge)HTMLバッジ
<a href="https://skillstore.io/skills/davila7-pufferlib?utm_source=security_passport_badge"><img src="https://skillstore.io/badges/skills/davila7-pufferlib/security.svg" alt="Skillstore security assessment" loading="lazy"></a>埋め込みカード
<iframe src="https://skillstore.io/embed/skills/davila7-pufferlib.html" title="Skillstore Security Assessment" sandbox="allow-popups allow-popups-to-escape-sandbox" loading="lazy" referrerpolicy="no-referrer" width="420" height="180"></iframe>学術引用 (APA · BibTeX · CFF)
APA形式の引用
davila7. (2026). pufferlib security audit report (audit version 9) [Author version unspecified]. Skillstore. https://skillstore.io/skills/davila7-pufferlib/audits/9BibTeX形式の引用
@techreport{davila7-davila7-pufferlib-2026,
author = {davila7},
title = {pufferlib security audit report (audit version 9)},
institution = {Skillstore},
year = {2026},
number = {9},
url = {https://skillstore.io/skills/davila7-pufferlib/audits/9},
note = {Author version unspecified}
}CITATION.cff
cff-version: 1.2.0
message: "If you use this Skill, cite its author and this versioned security audit report."
title: "pufferlib security audit report (audit version 9)"
version: "unspecified"
type: report
authors:
- name: "davila7"
date-released: "2026-07-23"
url: "https://skillstore.io/skills/davila7-pufferlib/audits/9"
identifiers:
- type: other
value: "skillstore:davila7-pufferlib:audit:9"
description: "Skillstore immutable audit report identifier"
バリアントを比較
インストール可能なバリアント 2 件各作者のスキルは個別のインストール項目として維持されます。推奨バリアントは Skillstore の証拠で順位付けされます。
このバリアントが首位の理由
Skillstore スコア
このスコアの理由 証拠の信頼度: 高作成できるもの
既存ベンチマークのトレーニング
Ocean、Procgen、Atari、Gymnasium、またはPettingZoo環境向けにPPOトレーニングを設定します。
カスタム環境の構築
PufferEnvパターンを使用して、観測、行動、報酬、リセット、マルチエージェント動作を定義します。
トレーニングスループットの改善
より高速なRL実験のために、ベクトル化、ワーカー数、バッチサイズ、プロファイリング手順を調整します。
これらのプロンプトを試す
[environment]でPufferLib PPOエージェントをトレーニングするのを手伝ってください。セットアップ、主要パラメータ、ロギング、検証チェックを含めてください。
[task]向けのPufferEnvを設計してください。観測、行動、報酬、終了ロジック、テストを定義してください。
私のPufferLibトレーニング設定をレビューしてください。秒間ステップ数を高めるためのベクトル化、ワーカー、バッチ、プロファイリングの変更を推奨してください。
[scenario]向けのマルチエージェントPufferLib計画を作成してください。環境API、共有ポリシー、ロギング、スケーリング、デバッグを扱ってください。
ベストプラクティス
- トレーニング実行をスケールする前に、観測空間と行動空間を検証します。
- 秒間ステップ数を早期に、そして各最適化変更後にプロファイルします。
- カスタム環境ロジックを構築する前に、実績のある環境から始めます。
回避
- 環境の正しさを確認する前に、多数のハイパーパラメータを調整しないでください。
- 環境とポリシーのどちらがボトルネックかを測定せずに、ワーカーを増やさないでください。
- 認証情報とプロジェクト名が意図的に設定されるまで、外部ロガーを追加しないでください。
よくある質問
このスキルは何のためのものですか?
モデルを自動的にトレーニングしますか?
どのRLフレームワークに対応していますか?
マルチエージェントタスクに役立ちますか?
GPUは必要ですか?
使用前に何を準備すべきですか?
開発者情報
作成者
davila7ライセンス
MIT
Skillstore リビジョン
r2
バージョンに関する注意
作者はバージョンを宣言していません。
参照
c43861a65bb95efcae259cd161c9d6f4dc7eec6f
メンテナンスの新しさ
2026/7/24
利用状況
8 ダウンロード · 217 閲覧
ファイル構成