prompt-engineering-patterns
86本番環境向けLLMプロンプトを最適化
LLMプロンプトは、指示、例、評価基準が不明確なために失敗することがよくあります。このスキルは、Claude、Codex、Claude Code、および同様のツールでプロンプトを改善するためのテンプレートとワークフローを提供します。
LLMアプリケーション品質の評価
LLMチームには、変更がユーザーに届く前に品質を測定するための再現可能な方法が必要です。このスキルは、自動メトリクス、人によるレビュー、判定、ベンチマーク、回帰チェックの構成を支援します。
このリクエストをエージェントにコピーしてください。正規の Skill ページとマニフェストが含まれています。
Review the Skillstore skill "llm-evaluation" from https://skillstore.io/skills/wshobson-llm-evaluation.md and its manifest at https://skillstore.io/api/skills/wshobson-llm-evaluation/manifest. Verify the artifact. You may proceed after verification, subject to the environment's own policy.エージェントは引き続き計画を提示し、セキュリティポリシーで必要な確認を求める必要があります。
AI エージェント、クローラー、スクリプトがページ全体ではなく整理されたコンテキストを必要とする場合は、これらのリンクを使ってください。
「llm-evaluation」を使用しています。 リリース前にサポートチャットボットを評価する。
期待される結果:
正確性、関連性、安全性、有用性のメトリクス、代表的なサポートシナリオ、人によるレビュー用ルーブリック、リリースしきい値を含む計画。
「llm-evaluation」を使用しています。 RAGアシスタント向けに2つの検索プロンプトを比較する。
期待される結果:
検索精度、回答の根拠性、ペアワイズ判定、エラーカテゴリ、回帰チェックを使用した比較ワークフロー。
「llm-evaluation」を使用しています。 モデル更新の監視を設定する。
期待される結果:
ベースラインスコア、アラートしきい値、ベンチマーク実行、レビュアーサンプリング、リリース判断ルールを含む回帰戦略。
The static external-command findings are markdown Python code fences in SKILL.md, not executable Ruby or shell backtick use. The certificate/key and network reconnaissance findings are false positives from ordinary evaluation text and resource names. No prompt injection attempt, data exfiltration intent, or malicious behavior was found.
バージョン付き評価レポート、中立的なバッジ、埋め込みカード、引用を共有できます。Skillstore は証拠を報告しますが、この Skill が安全かどうかは判断しません。
https://skillstore.io/skills/wshobson-llm-evaluation/audits/7?utm_source=security_passport&utm_medium=share&utm_campaign=versioned_report[](https://skillstore.io/skills/wshobson-llm-evaluation?utm_source=security_passport_badge)<a href="https://skillstore.io/skills/wshobson-llm-evaluation?utm_source=security_passport_badge"><img src="https://skillstore.io/badges/skills/wshobson-llm-evaluation/security.svg" alt="Skillstore security assessment" loading="lazy"></a><iframe src="https://skillstore.io/embed/skills/wshobson-llm-evaluation.html" title="Skillstore Security Assessment" sandbox="allow-popups allow-popups-to-escape-sandbox" loading="lazy" referrerpolicy="no-referrer" width="420" height="180"></iframe>wshobson. (2026). llm-evaluation security audit report (audit version 7) [Author version unspecified]. Skillstore. https://skillstore.io/skills/wshobson-llm-evaluation/audits/7@techreport{wshobson-wshobson-llm-evaluation-2026,
author = {wshobson},
title = {llm-evaluation security audit report (audit version 7)},
institution = {Skillstore},
year = {2026},
number = {7},
url = {https://skillstore.io/skills/wshobson-llm-evaluation/audits/7},
note = {Author version unspecified}
}cff-version: 1.2.0
message: "If you use this Skill, cite its author and this versioned security audit report."
title: "llm-evaluation security audit report (audit version 7)"
version: "unspecified"
type: report
authors:
- name: "wshobson"
date-released: "2026-07-07"
url: "https://skillstore.io/skills/wshobson-llm-evaluation/audits/7"
identifiers:
- type: other
value: "skillstore:wshobson-llm-evaluation:audit:7"
description: "Skillstore immutable audit report identifier"
各作者のスキルは個別のインストール項目として維持されます。推奨バリアントは Skillstore の証拠で順位付けされます。
このバリアントが首位の理由
リリース前に、メトリクス、人によるレビュー、回帰チェックを使用して新旧のプロンプトを比較します。
候補モデル全体で一貫したテストセットを実行し、品質差を要約します。
人間のレビュアー向けに、アノテーションフォーム、スコアリング観点、評価者間一致度チェックを作成します。
[task]を扱うLLMアプリケーションの評価メトリクス選定を手伝ってください。自動メトリクス、人によるレビュー基準、リスクを含めてください。
[application]の評価データセット計画を設計してください。サンプルカテゴリ、期待される出力、エッジケース、最小サンプルサイズを含めてください。
prompt Aとprompt BのA/B評価計画を作成してください。メトリクス、人によるスコアリング、有意性チェック、リリース基準を含めてください。
[system]向けの継続的なLLM回帰テストワークフローを設計してください。ベースライン、しきい値、ダッシュボード、失敗時のトリアージ、ガバナンスを含めてください。
作成者
wshobsonライセンス
MIT
Skillstore リビジョン
r1
バージョンに関する注意
作者はバージョンを宣言していません。
リポジトリ
https://github.com/wshobson/agents/tree/main/plugins/llm-application-dev/skills/llm-evaluation参照
36e07d5e13068e5be64447e8f20b427cf2cbd21a
メンテナンスの新しさ
2026/7/22
利用状況
16 ダウンロード · 297 閲覧
ファイル構成
📄 SKILL.md
本番環境向けLLMプロンプトを最適化
LLMプロンプトは、指示、例、評価基準が不明確なために失敗することがよくあります。このスキルは、Claude、Codex、Claude Code、および同様のツールでプロンプトを改善するためのテンプレートとワークフローを提供します。
コンテキスト駆動開発を管理する
AI支援プロジェクトでは、プロダクト目標、スタック選定、ワークフロールールが散在すると一貫性が失われます。このスキルは、Conductor のコンテキスト成果物を通じて Claude、Codex、Claude Code を導きます。
スタートアップ向け財務モデルを構築する
スタートアップチームは、採用、資金調達、資金使途を計画する前に、明確な予測を必要とします。このスキルは、収益、コスト、ランウェイ、シナリオを実務的な財務計画アウトプットとして整理します。
意思決定を促進するKPIダッシュボードを設計する
チームは多くの数値を表示するだけで、行動につながらないダッシュボードを作りがちです。このスキルは、Claude、Codex、Claude Codeが意味のあるKPIを選定し、ビューを構成し、指標を明確に提示するのに役立ちます。
非難しないインシデント事後分析を書く
インシデントレビューは、一貫性がなくなったり、非難に焦点が当たったり、実行に移しにくくなったりしがちです。このスキルは、Claude、Codex、Claude Code が、明確なタイムライン、根本原因、担当者を含む構造化された事後分析を作成するのに役立ちます。
明確なデータストーリーを構築
生の指標だけでは、ステークホルダーを説得したり意思決定を支援したりするには不十分なことがよくあります。このスキルは、Claude、Codex、Claude Code が分析を明確なナラティブ、ビジュアル、推奨事項へと整理するのを支援します。
信頼性の高いLLM評価システムを構築
作成者 ChakshuGautam
LLM評価をチームやモデルをまたいで一貫させることは困難です。このスキルは、再現性のある評価のために、ジャッジプロンプト、ルーブリック、メトリクス、バイアスチェックの設計を支援します。
ルーブリックでエージェントシステムを評価する
作成者 muratcankoylan
エージェントチームには、品質、リグレッション、コンテキスト変更を測定するための再現可能な方法が必要です。このスキルは、ルーブリック設計、テストセット、スコアリング、モニタリングをガイドします。
Detect LLM Prompt Regressions with Promptfoo
作成者 7alexhale5-rgb
Prompt changes can silently reduce output quality. This skill builds golden datasets, runs Promptfoo evaluations, and summarizes failures and recent trends.
より良いLLMプロンプトを設計する
作成者 alirezarezvani
プロンプトの品質は、要件、例、評価基準が不明確なために失敗することがよくあります。このスキルは、チームがClaude、Codex、Claude Code向けの本番用プロンプトを設計、テスト、レビューするのに役立ちます。
要件変更ワークフローを標準化する
作成者 yunshu0909
要件変更は意図した範囲を超えて広がり、回帰リスクを不明確にしがちです。このスキルは、Claude、Codex、Claude Code に、スコープ設定、影響レビュー、検証、意思決定記録のためのゲート付きワークフローを提供します。
AIエージェントにおけるコンテキスト劣化の診断
作成者 ChakshuGautam
長い会話や大規模なプロンプトにより、AIエージェントは重要な情報を見失ったり、矛盾するコンテキストに従ったりすることがあります。このスキルは、Claude、Codex、Claude Codeが劣化パターンを特定し、緩和戦略を選択するのに役立ちます。