advanced-evaluation
信頼性の高いLLM評価システムを構築する
LLM評価の品質は、判定者が曖昧なルーブリックや偏った比較を使うと低下しがちです。このスキルは、Claude、Codex、Claude Codeに対して、スコアリング、ペアワイズレビュー、バイアス緩和、指標選定をガイドします。
自分のエージェントでインストール
このリクエストをエージェントにコピーしてください。正規の Skill ページとマニフェストが含まれています。
Review the Skillstore skill "advanced-evaluation" from https://skillstore.io/skills/muratcankoylan-advanced-evaluation.md and its manifest at https://skillstore.io/api/skills/muratcankoylan-advanced-evaluation/manifest. Verify the artifact. You may proceed after verification, subject to the environment's own policy.エージェントは引き続き計画を提示し、セキュリティポリシーで必要な確認を求める必要があります。
エージェントが読めるリソース
AI エージェント、クローラー、スクリプトがページ全体ではなく整理されたコンテキストを必要とする場合は、これらのリンクを使ってください。
テストする
「advanced-evaluation」を使用しています。 チームはカスタマーサポート返信の正確性と有用性を採点する必要があります。
期待される結果:
このスキルは、事実の正確性、完全性、トーン、実行可能性について、個別に重み付けされた基準を使った直接スコアリングを推奨します。
「advanced-evaluation」を使用しています。 2つのチャットボット回答の違いは主にスタイルと明確さです。
期待される結果:
このスキルは、位置の入れ替え、同点処理、一貫性に基づく信頼度を含むペアワイズ比較を推奨します。
「advanced-evaluation」を使用しています。 判定者は全体として人間と一致しますが、簡潔な回答では失敗します。
期待される結果:
このスキルは長さバイアスのリスクを特定し、明示的な簡潔性基準に加えて、応答長ごとの不一致分析を推奨します。
セキュリティ監査
中リスクAll 44 static alerts are false positives caused by Markdown formatting, ordinary collection methods, evaluation terminology, and research links. The local example script only calculates and prints demonstration results. However, evaluator prompts interpolate untrusted candidate responses without explicit prompt-injection isolation, which could permit scoring manipulation.
確認済みのセキュリティ上の懸念 (1)
リスク要因
⚙️ 外部コマンド (33)
🌐 ネットワークアクセス (4)
このレポートを共有・引用
バージョン付き評価レポート、中立的なバッジ、埋め込みカード、引用を共有できます。Skillstore は証拠を報告しますが、この Skill が安全かどうかは判断しません。
レポートリンクをコピー
https://skillstore.io/skills/muratcankoylan-advanced-evaluation/audits/8?utm_source=security_passport&utm_medium=share&utm_campaign=versioned_reportMarkdownバッジ
[](https://skillstore.io/skills/muratcankoylan-advanced-evaluation?utm_source=security_passport_badge)HTMLバッジ
<a href="https://skillstore.io/skills/muratcankoylan-advanced-evaluation?utm_source=security_passport_badge"><img src="https://skillstore.io/badges/skills/muratcankoylan-advanced-evaluation/security.svg" alt="Skillstore security assessment" loading="lazy"></a>埋め込みカード
<iframe src="https://skillstore.io/embed/skills/muratcankoylan-advanced-evaluation.html" title="Skillstore Security Assessment" sandbox="allow-popups allow-popups-to-escape-sandbox" loading="lazy" referrerpolicy="no-referrer" width="420" height="180"></iframe>学術引用 (APA · BibTeX · CFF)
APA形式の引用
muratcankoylan. (2026). advanced-evaluation security audit report (audit version 8) [Author version unspecified]. Skillstore. https://skillstore.io/skills/muratcankoylan-advanced-evaluation/audits/8BibTeX形式の引用
@techreport{muratcankoylan-muratcankoylan-advanced-evaluation-2026,
author = {muratcankoylan},
title = {advanced-evaluation security audit report (audit version 8)},
institution = {Skillstore},
year = {2026},
number = {8},
url = {https://skillstore.io/skills/muratcankoylan-advanced-evaluation/audits/8},
note = {Author version unspecified}
}CITATION.cff
cff-version: 1.2.0
message: "If you use this Skill, cite its author and this versioned security audit report."
title: "advanced-evaluation security audit report (audit version 8)"
version: "unspecified"
type: report
authors:
- name: "muratcankoylan"
date-released: "2026-08-09"
url: "https://skillstore.io/skills/muratcankoylan-advanced-evaluation/audits/8"
identifiers:
- type: other
value: "skillstore:muratcankoylan-advanced-evaluation:audit:8"
description: "Skillstore immutable audit report identifier"
バリアントを比較
インストール可能なバリアント 2 件各作者のスキルは個別のインストール項目として維持されます。推奨バリアントは Skillstore の証拠で順位付けされます。
このバリアントが首位の理由
chakshugautam-advanced-evaluation
2026-09-09
muratcankoylan-advanced-evaluation
2026-09-09
Skillstore スコア
このスコアの理由 証拠の信頼度: 高作成できるもの
モデル応答を比較する
トーン、明確さ、有用性、または好ましさの品質について、より良い回答を選ぶためにペアワイズレビューを使用します。
評価ルーブリックを構築する
再現性のあるレビューのために、明確なスコア水準、観察可能な基準、エッジケースのガイダンスを作成します。
判定者の信頼性を監査する
自動判定の結果を人間のラベルと照合し、体系的なバイアスパターンを見つけます。
これらのプロンプトを試す
[task] の評価方法を選ぶのを手伝ってください。出力は [objective or subjective] です。最適な指標とその理由を説明してください。
[domain] における [criterion] のバランスの取れたルーブリックを作成してください。[scale] スケールを使用し、エッジケースのガイダンスを含めてください。
[criteria] について Response A と Response B を比較してください。位置バイアスの緩和を含め、最終的な信頼度を説明してください。
[product workflow] の評価パイプラインを設計してください。検証、判定者選定、バイアス制御、指標、人間によるレビューのトリガーを含めてください。
ベストプラクティス
- すべての自動スコアの前に、根拠に基づく正当化を必須にします。
- ペアワイズ比較では応答順を入れ替え、判断前に結果を元の対応関係へ戻します。
- 意思決定に使用する前に、自動判定者の出力を人間のラベルと照合して検証します。
回避
- 関連性の低い多数の基準に対して、曖昧な品質スコアを1つだけ使う。
- 位置バイアスを確認せずに、単一回のペアワイズ判定を信頼する。
- 体系的な失敗ケースを調べずに、高い一致率だけで十分だとみなす。
よくある質問
このスキルは何のためのものですか?
評価を自動的に実行しますか?
直接スコアリングはいつ使うべきですか?
ペアワイズ比較はいつ使うべきですか?
評価者バイアスをどのように減らしますか?
人間による評価を置き換えられますか?
開発者情報
作成者
muratcankoylanライセンス
MIT
Skillstore リビジョン
r2
バージョンに関する注意
作者はバージョンを宣言していません。
参照
02be9409c79ca1183f7844009c14d9df684d0cf9
メンテナンスの新しさ
2026/8/11
利用状況
11 ダウンロード · 391 閲覧