context-degradation
81AIエージェントにおけるコンテキスト劣化の診断
長い会話や大規模なプロンプトにより、AIエージェントは重要な情報を見失ったり、矛盾するコンテキストに従ったりすることがあります。このスキルは、Claude、Codex、Claude Codeが劣化パターンを特定し、緩和戦略を選択するのに役立ちます。
信頼性の高いLLM評価システムを構築
LLM評価をチームやモデルをまたいで一貫させることは困難です。このスキルは、再現性のある評価のために、ジャッジプロンプト、ルーブリック、メトリクス、バイアスチェックの設計を支援します。
このリクエストをエージェントにコピーしてください。正規の Skill ページとマニフェストが含まれています。
Review the Skillstore skill "advanced-evaluation" from https://skillstore.io/skills/chakshugautam-advanced-evaluation.md and its manifest at https://skillstore.io/api/skills/chakshugautam-advanced-evaluation/manifest. Verify the artifact. You may proceed after verification, subject to the environment's own policy.エージェントは引き続き計画を提示し、セキュリティポリシーで必要な確認を求める必要があります。
AI エージェント、クローラー、スクリプトがページ全体ではなく整理されたコンテキストを必要とする場合は、これらのリンクを使ってください。
「advanced-evaluation」を使用しています。 明確さと有用性について、2つのチャットボット回答を比較する。
期待される結果:
回答順序の入れ替え、明確な基準、同点ルール、信頼度キャリブレーションを含むペアワイズ評価計画。
「advanced-evaluation」を使用しています。 プルリクエストレビューにおけるコードの可読性のルーブリックを作成する。
期待される結果:
観察可能な特性、スコアリングガイドライン、生成コードまたはドメイン固有コード向けのエッジケースを含む5段階ルーブリック。
「advanced-evaluation」を使用しています。 自動ジャッジが人間のレビュアーと一致しているかを測定する。
期待される結果:
一致率、カッパ係数、順位相関、体系的な不一致の分析を使用したメトリクス選定計画。
All 37 static findings are false positives after context review. The flagged shell execution is markdown fencing, and the network findings are research citations, not runtime calls. No prompt injection or exfiltration intent was found.
バージョン付き評価レポート、中立的なバッジ、埋め込みカード、引用を共有できます。Skillstore は証拠を報告しますが、この Skill が安全かどうかは判断しません。
https://skillstore.io/skills/chakshugautam-advanced-evaluation/audits/8?utm_source=security_passport&utm_medium=share&utm_campaign=versioned_report[](https://skillstore.io/skills/chakshugautam-advanced-evaluation?utm_source=security_passport_badge)<a href="https://skillstore.io/skills/chakshugautam-advanced-evaluation?utm_source=security_passport_badge"><img src="https://skillstore.io/badges/skills/chakshugautam-advanced-evaluation/security.svg" alt="Skillstore security assessment" loading="lazy"></a><iframe src="https://skillstore.io/embed/skills/chakshugautam-advanced-evaluation.html" title="Skillstore Security Assessment" sandbox="allow-popups allow-popups-to-escape-sandbox" loading="lazy" referrerpolicy="no-referrer" width="420" height="180"></iframe>ChakshuGautam. (2026). advanced-evaluation security audit report (audit version 8) [Author version unspecified]. Skillstore. https://skillstore.io/skills/chakshugautam-advanced-evaluation/audits/8@techreport{chakshugautam-chakshugautam-advanced-evaluation-2026,
author = {ChakshuGautam},
title = {advanced-evaluation security audit report (audit version 8)},
institution = {Skillstore},
year = {2026},
number = {8},
url = {https://skillstore.io/skills/chakshugautam-advanced-evaluation/audits/8},
note = {Author version unspecified}
}cff-version: 1.2.0
message: "If you use this Skill, cite its author and this versioned security audit report."
title: "advanced-evaluation security audit report (audit version 8)"
version: "unspecified"
type: report
authors:
- name: "ChakshuGautam"
date-released: "2026-07-06"
url: "https://skillstore.io/skills/chakshugautam-advanced-evaluation/audits/8"
identifiers:
- type: other
value: "skillstore:chakshugautam-advanced-evaluation:audit:8"
description: "Skillstore immutable audit report identifier"
各作者のスキルは個別のインストール項目として維持されます。推奨バリアントは Skillstore の証拠で順位付けされます。
このバリアントが首位の理由
chakshugautam-advanced-evaluation
2026-09-09
muratcankoylan-advanced-evaluation
2026-09-09
ペアワイズ判定と位置バイアスチェックを使って、プロンプトのバリエーションからの出力を比較します。
一貫したレビューのために、明確なスコアレベル、エッジケース、根拠要件を定義します。
一致メトリクスを選択し、自動スコアと人間の判断の差分を追跡します。
このタスクに適した評価方法を選ぶのを手伝ってください: [task]。直接スコアリング、ペアワイズ比較、参照ベース評価のどれが最も適しているかを説明してください。
[domain]における[criterion]について、1から5のルーブリックを作成してください。レベル説明、観察可能なシグナル、エッジケースのガイダンスを含めてください。
2つのモデル回答に対するペアワイズ評価ワークフローを設計してください。位置入れ替え、同点処理、信頼度スコアリング、失敗ケースを含めてください。
この評価パイプラインをレビューしてください: [pipeline]。バイアスリスク、不足しているメトリクス、弱いプロンプト、検証ギャップ、具体的な改善点を特定してください。
作成者
ChakshuGautamライセンス
MIT
Skillstore リビジョン
r1
バージョンに関する注意
作者はバージョンを宣言していません。
参照
dd4a3ef9f20ddf38830950b4bb713df96b431fd6
メンテナンスの新しさ
2026/7/22
利用状況
7 ダウンロード · 389 閲覧
ファイル構成
AIエージェントにおけるコンテキスト劣化の診断
長い会話や大規模なプロンプトにより、AIエージェントは重要な情報を見失ったり、矛盾するコンテキストに従ったりすることがあります。このスキルは、Claude、Codex、Claude Codeが劣化パターンを特定し、緩和戦略を選択するのに役立ちます。
AIコンテキストウィンドウを最適化
長時間のAIセッションでは、トークンを浪費し、応答が遅くなり、重要なコンテキストを失うことがあります。このスキルは、Claude、Codex、Claude Codeに、コンテキストの圧縮、マスキング、キャッシュ、予算管理のための実用的なパターンを提供します。
長いエージェントコンテキストを確実に圧縮する
長いエージェントセッションでは、コンテキストが過度に積極的に圧縮されると、重要なファイル、判断、次のステップが失われます。このスキルは、トークン使用量を削減しながら利用可能なコンテキストを保持するための、構造化された圧縮と評価の方法を提供します。
エージェントのコンテキスト管理を最適化
プロンプト、ツール、履歴、検索取得がコンテキストを奪い合うと、エージェントシステムは信頼性を損なうことがあります。このスキルは、コンテキストの構成要素と、予算管理、段階的開示、検証のための実践的なパターンを説明します。
マルチエージェントアーキテクチャの設計
すべてのタスクを1つのコンテキストウィンドウで扱うと、複雑なエージェント作業は失敗することがあります。このスキルは、Claude、Codex、Claude Code が明確なハンドオフを備えたエージェントシステムを設計するのに役立ちます。
より優れたエージェントツールを設計する
エージェントツールは、説明、スキーマ、エラーが不明確な場合に失敗します。このスキルは、より明確なツールインターフェースとより小さなツールセットのための実践的なパターンを提供します。
LLMアプリケーション品質の評価
作成者 wshobson
LLMチームには、変更がユーザーに届く前に品質を測定するための再現可能な方法が必要です。このスキルは、自動メトリクス、人によるレビュー、判定、ベンチマーク、回帰チェックの構成を支援します。
ルーブリックでエージェントシステムを評価する
作成者 muratcankoylan
エージェントチームには、品質、リグレッション、コンテキスト変更を測定するための再現可能な方法が必要です。このスキルは、ルーブリック設計、テストセット、スコアリング、モニタリングをガイドします。
MLワークフローに潜むアンチパターンを検証
作成者 Doyajin174
MLプロジェクトは一見正確に見えても、データリーケージや弱い評価によって重大な欠陥が隠れていることがあります。このスキルは、分割、指標、トレーニング、デプロイ準備状況を体系的にチェックするためのガイドを提供します。
本番環境向けLLMプロンプトを最適化
作成者 wshobson
LLMプロンプトは、指示、例、評価基準が不明確なために失敗することがよくあります。このスキルは、Claude、Codex、Claude Code、および同様のツールでプロンプトを改善するためのテンプレートとワークフローを提供します。
より良いLLMプロンプトを設計する
作成者 alirezarezvani
プロンプトの品質は、要件、例、評価基準が不明確なために失敗することがよくあります。このスキルは、チームがClaude、Codex、Claude Code向けの本番用プロンプトを設計、テスト、レビューするのに役立ちます。
WebアプリのQAカバレッジを改善する
作成者 alirezarezvani
現代のチームには、デリバリーを遅らせることなく、明確なテスト戦略と実践的な自動化が必要です。このスキルは、Claude、Codex、Claude Codeがテストを計画し、カバレッジをレビューし、QAワークフローをスキャフォールドするのに役立ちます。