tool-design
81信頼性の高いエージェントツールを設計する
ツール名、入力、出力、エラーが曖昧だと、エージェントは失敗します。このスキルは、ツールの説明、スキーマ、レスポンス形式、テストのための実践的なパターンを提供します。
信頼性の高いエージェント評価を構築する
エージェントシステムは、実行ごとに妥当な動作が変わり得るため、テストが困難です。このスキルは、再現性のある評価のためのルーブリック、指標、ワークフローを提供します。
このリクエストをエージェントにコピーしてください。正規の Skill ページとマニフェストが含まれています。
Review the Skillstore skill "evaluation" from https://skillstore.io/skills/asmayaseen-evaluation.md and its manifest at https://skillstore.io/api/skills/asmayaseen-evaluation/manifest. Verify the artifact. You may proceed after verification, subject to the environment's own policy.エージェントは引き続き計画を提示し、セキュリティポリシーで必要な確認を求める必要があります。
AI エージェント、クローラー、スクリプトがページ全体ではなく整理されたコンテキストを必要とする場合は、これらのリンクを使ってください。
「evaluation」を使用しています。 引用付きで事実に関する質問に回答するリサーチエージェントを評価する。
期待される結果:
事実の正確性、引用の正確性、ソース品質、完全性、ツール効率性に対する重み付きスコアを含むルーブリック。
「evaluation」を使用しています。 新しいコンテキスト戦略によってエージェントのパフォーマンスが向上したかを確認する。
期待される結果:
共通のテストケース、ベースラインスコア、変更後のスコア、リグレッションメモを含む比較計画。
「evaluation」を使用しています。 エージェントサポートワークフロー向けの本番モニタリングを作成する。
期待される結果:
サンプリングされた会話、定期評価、アラートしきい値、人間によるレビューチェックポイントを含むモニタリング手法。
All ten static alerts are false positives caused by dictionary key iteration, Markdown code fences, or explanatory prose. The skill contains no network, subprocess, credential access, or prompt injection behavior. A low-severity privacy concern remains because production monitoring stores unredacted query and output previews in memory.
バージョン付き評価レポート、中立的なバッジ、埋め込みカード、引用を共有できます。Skillstore は証拠を報告しますが、この Skill が安全かどうかは判断しません。
https://skillstore.io/skills/asmayaseen-evaluation/audits/9?utm_source=security_passport&utm_medium=share&utm_campaign=versioned_report[](https://skillstore.io/skills/asmayaseen-evaluation?utm_source=security_passport_badge)<a href="https://skillstore.io/skills/asmayaseen-evaluation?utm_source=security_passport_badge"><img src="https://skillstore.io/badges/skills/asmayaseen-evaluation/security.svg" alt="Skillstore security assessment" loading="lazy"></a><iframe src="https://skillstore.io/embed/skills/asmayaseen-evaluation.html" title="Skillstore Security Assessment" sandbox="allow-popups allow-popups-to-escape-sandbox" loading="lazy" referrerpolicy="no-referrer" width="420" height="180"></iframe>Asmayaseen. (2026). evaluation security audit report (audit version 9) [Author version unspecified]. Skillstore. https://skillstore.io/skills/asmayaseen-evaluation/audits/9@techreport{asmayaseen-asmayaseen-evaluation-2026,
author = {Asmayaseen},
title = {evaluation security audit report (audit version 9)},
institution = {Skillstore},
year = {2026},
number = {9},
url = {https://skillstore.io/skills/asmayaseen-evaluation/audits/9},
note = {Author version unspecified}
}cff-version: 1.2.0
message: "If you use this Skill, cite its author and this versioned security audit report."
title: "evaluation security audit report (audit version 9)"
version: "unspecified"
type: report
authors:
- name: "Asmayaseen"
date-released: "2026-07-23"
url: "https://skillstore.io/skills/asmayaseen-evaluation/audits/9"
identifiers:
- type: other
value: "skillstore:asmayaseen-evaluation:audit:9"
description: "Skillstore immutable audit report identifier"
各作者のスキルは個別のインストール項目として維持されます。推奨バリアントは Skillstore の証拠で順位付けされます。
このバリアントが首位の理由
muratcankoylan-evaluation
2026-09-09
chakshugautam-evaluation
2026-09-09
合格しきい値と重み付き品質軸を使用して、リリース前にエージェントの変更を評価します。
一貫したテストと指標を使って、プロンプト、ツール、メモリ、コンテキストウィンドウを比較します。
ライブのやり取りをサンプリングし、スコア傾向を追跡して、リグレッションを早期に検出します。
私のエージェント向けにシンプルな評価ルーブリックを作成してください。事実の正確性、完全性、ツール効率性を含め、明確な合格基準を示してください。
このエージェントワークフロー向けのテストセットを設計してください。シンプル、中程度、複雑、長時間実行のタスクと、期待される結果を含めてください。
重み付きルーブリックを使用して、2つのエージェント設定を比較してください。スコアの変化、リグレッション、考えられる原因を報告してください。
本番エージェント向けの継続的評価計画を作成してください。サンプリング、LLM-as-judgeレビュー、人間によるレビュー、アラート、傾向レポートを含めてください。
作成者
Asmayaseenライセンス
MIT
Skillstore リビジョン
r2
バージョンに関する注意
作者はバージョンを宣言していません。
参照
89edfdc710d0846129dcee6a929477b04f08052c
メンテナンスの新しさ
2026/7/24
利用状況
11 ダウンロード · 279 閲覧
ファイル構成
信頼性の高いエージェントツールを設計する
ツール名、入力、出力、エラーが曖昧だと、エージェントは失敗します。このスキルは、ツールの説明、スキーマ、レスポンス形式、テストのための実践的なパターンを提供します。
ソフトウェアの問題を体系的にデバッグする
構造化されていないバグ修正は時間を浪費し、本当の失敗原因を隠すことがあります。このスキルは Claude、Codex、Claude Code に、証拠に基づく根本原因分析をガイドします。
本番サービスの信頼性を向上させる
本番運用チームには、明確な信頼性目標と再現可能なインシデント対応の実践が必要です。このスキルは、SLO、エラーバジェット、アラート、ポストモーテムのためのSREテンプレートを提供します。
Next.jsでshadcn/uiインターフェースを構築
Reactチームには、モダンなNext.jsで機能する一貫したUIパターンが必要です。このスキルは、shadcn/uiのセットアップガイダンス、コンポーネント例、フォームバリデーション、テーブル、サイドバー、ダークモードパターンを提供します。
ストリーミングAIチャットインターフェイスを構築する
ユーザーが進捗、応答状態、UIの変化を確認できない場合、リアルタイムAIチャットは壊れているように感じられます。このスキルは、Claude、Codex、Claude Codeに、ストリーミングのライフサイクル、進捗イベント、クライアント効果、クライアントツールのパターンを提供します。
コンテキスト劣化を診断する
長い AI セッションでは、コンテキストが増えたり、競合したり、注意をそらす素材が含まれたりすると、精度が低下することがあります。このスキルは、Claude、Codex、Claude Code が劣化パターンを特定し、実用的な緩和手順を選ぶのに役立ちます。
LLMアプリケーション品質の評価
作成者 wshobson
LLMチームには、変更がユーザーに届く前に品質を測定するための再現可能な方法が必要です。このスキルは、自動メトリクス、人によるレビュー、判定、ベンチマーク、回帰チェックの構成を支援します。
要件変更ワークフローを標準化する
作成者 yunshu0909
要件変更は意図した範囲を超えて広がり、回帰リスクを不明確にしがちです。このスキルは、Claude、Codex、Claude Code に、スコープ設定、影響レビュー、検証、意思決定記録のためのゲート付きワークフローを提供します。
Red-Green-RefactorでTDDを導くガイド
作成者 mattpocock
テストファーストの作業は、チームが内部実装をテストしたり、最初に多くのテストを書きすぎたりすると、壊れやすくなりがちです。このスキルは、Codex、Claude、Claude Codeに対して、振る舞いに焦点を当てたred-green-refactorサイクルをガイドします。
ProptestでRustのプロパティテストを設計する
作成者 EmilLindfors
有用なプロパティやジェネレーターが常に明らかとは限らないため、プロパティベーステストは適用が難しい場合があります。このスキルは、Claude、Codex、またはClaude CodeがRustコード向けに的を絞ったproptest戦略を提案するのに役立ちます。
構造化されたトリアージでバグを修正
作成者 Crearize
バックエンドとフロントエンドにまたがるデバッグでは、コンテキストが失われたりリグレッションテストを見落としたりすることがあります。このスキルは、根本原因分析、最小限の修正、検証、プルリクエストへの引き継ぎをガイドします。
DevOpsデリバリーを調整
作成者 Brownbull
DevOpsの作業は、パイプライン、インフラストラクチャ、モニタリング、デプロイ判断にまたがることがよくあります。このスキルは、それらのタスクをチェックリスト、引き継ぎ、ロールアウト計画として整理します。