content-creator
88ブランドに一貫したマーケティングコンテンツを作成
マーケティングチームには、チャネルを横断して一貫性を保つコンテンツが必要です。このスキルは、ブランドボイスとSEOに合わせてコンテンツを計画、執筆、分析、最適化するのに役立ちます。
信頼性の高い指標で LLM アプリケーションを評価する
LLM チームには、品質、安全性、リグレッションを測定するための再現可能な方法が必要です。このスキルは、指標、人間によるレビュー、LLM ジャッジ、ベンチマーク、A/B テストを用いた評価スイートの設計を支援します。
このリクエストをエージェントにコピーしてください。正規の Skill ページとマニフェストが含まれています。
Review the Skillstore skill "llm-evaluation" from https://skillstore.io/skills/sickn33-llm-evaluation.md and its manifest at https://skillstore.io/api/skills/sickn33-llm-evaluation/manifest. Verify the artifact. You may proceed after verification, subject to the environment's own policy.エージェントは引き続き計画を提示し、セキュリティポリシーで必要な確認を求める必要があります。
AI エージェント、クローラー、スクリプトがページ全体ではなく整理されたコンテキストを必要とする場合は、これらのリンクを使ってください。
「llm-evaluation」を使用しています。 リリース前にカスタマーサポートチャットボットを評価する。
期待される結果:
意図の正確性、根拠性、安全性レビュー、人間による評価フォーム、ベースラインしきい値、週次リグレッションレポートを含むバランスの取れた計画。
「llm-evaluation」を使用しています。 2つの retrieval-augmented generation プロンプトを比較する。
期待される結果:
関連性、回答の忠実性、ペアワイズ判定、信頼区間、明示的な昇格判断ルールを使用した比較ワークフロー。
「llm-evaluation」を使用しています。 プロンプト変更後の品質低下を検出する。
期待される結果:
ベースラインスコア、相対変化しきい値、失敗例、推奨される調査手順を含むリグレッションチェックリスト。
All static findings appear to be false positives from Markdown backticks, fenced Python examples, a dictionary keys() call, and ordinary evaluation terminology. I found no evidence of prompt injection, malicious intent, command execution, credential material, or network reconnaissance in SKILL.md.
バージョン付き評価レポート、中立的なバッジ、埋め込みカード、引用を共有できます。Skillstore は証拠を報告しますが、この Skill が安全かどうかは判断しません。
https://skillstore.io/skills/sickn33-llm-evaluation/audits/4?utm_source=security_passport&utm_medium=share&utm_campaign=versioned_report[](https://skillstore.io/skills/sickn33-llm-evaluation?utm_source=security_passport_badge)<a href="https://skillstore.io/skills/sickn33-llm-evaluation?utm_source=security_passport_badge"><img src="https://skillstore.io/badges/skills/sickn33-llm-evaluation/security.svg" alt="Skillstore security assessment" loading="lazy"></a><iframe src="https://skillstore.io/embed/skills/sickn33-llm-evaluation.html" title="Skillstore Security Assessment" sandbox="allow-popups allow-popups-to-escape-sandbox" loading="lazy" referrerpolicy="no-referrer" width="420" height="180"></iframe>sickn33. (2026). llm-evaluation security audit report (audit version 4) [Author version unspecified]. Skillstore. https://skillstore.io/skills/sickn33-llm-evaluation/audits/4@techreport{sickn33-sickn33-llm-evaluation-2026,
author = {sickn33},
title = {llm-evaluation security audit report (audit version 4)},
institution = {Skillstore},
year = {2026},
number = {4},
url = {https://skillstore.io/skills/sickn33-llm-evaluation/audits/4},
note = {Author version unspecified}
}cff-version: 1.2.0
message: "If you use this Skill, cite its author and this versioned security audit report."
title: "llm-evaluation security audit report (audit version 4)"
version: "unspecified"
type: report
authors:
- name: "sickn33"
date-released: "2026-07-07"
url: "https://skillstore.io/skills/sickn33-llm-evaluation/audits/4"
identifiers:
- type: other
value: "skillstore:sickn33-llm-evaluation:audit:4"
description: "Skillstore immutable audit report identifier"
各作者のスキルは個別のインストール項目として維持されます。推奨バリアントは Skillstore の証拠で順位付けされます。
このバリアントが首位の理由
新しい LLM ワークフローをデプロイする前に、ベースライン指標とリグレッションチェックを作成します。
ペアワイズ判定、A/B テスト、指標トラッキングを使用して、より強力なバリアントを選択します。
専門レビュアー向けに、アノテーションの観点、評価尺度、一致度チェックを定義します。
[task] を行う LLM アプリケーションの評価指標を選ぶのを手伝ってください。自動指標、人間によるレビューの観点、必要なデータを含めてください。
現在の LLM ワークフロー向けのベースライン評価計画を設計してください。テストケース、指標、合格しきい値、結果を時系列で追跡する方法を含めてください。
バリアント A とバリアント B を比較するための評価アプローチを作成してください。ペアワイズ判定基準、統計的検定、意思決定ルールを含めてください。
[product] 向けの本番 LLM 評価フレームワークを設計してください。自動指標、人間による評価、LLM-as-judge チェック、リグレッション検出、CI/CD 統合を含めてください。
作成者
sickn33ライセンス
MIT
Skillstore リビジョン
r1
バージョンに関する注意
作者はバージョンを宣言していません。
参照
816c62b2546ddb1c6a0453e7c781b5e095117819
メンテナンスの新しさ
2026/7/18
利用状況
9 ダウンロード · 89 閲覧
ファイル構成
📄 SKILL.md
ブランドに一貫したマーケティングコンテンツを作成
マーケティングチームには、チャネルを横断して一貫性を保つコンテンツが必要です。このスキルは、ブランドボイスとSEOに合わせてコンテンツを計画、執筆、分析、最適化するのに役立ちます。
実証済みパターンでLLMプロンプトを改善
一貫性のないプロンプトは時間を浪費し、AIの出力を信頼しにくくします。このスキルは、再利用可能なパターン、例、評価手順、最適化ワークフローを使ってプロンプト設計を支援します。
スケーラブルなソフトウェアアーキテクチャを設計する
アーキテクチャ上の意思決定は、Web、モバイル、バックエンド、クラウドシステム全体で比較するのが困難です。このスキルは、レポート、依存関係レビュー、トレードオフ文書化のための構造化されたガイドとローカルのスキャフォールドスクリプトを提供します。
シニアレベルのパターンでフルスタックアプリを構築
チームには、モダンなWebアプリケーション向けに一貫したセットアップ、アーキテクチャ、レビュー指針が必要です。このスキルは、React、Next.js、Node.js、GraphQL、PostgreSQLプロジェクト向けのスキャフォールダー、ワークフローのリファレンス、品質向上のためのプロンプトを提供します。
Prompt EngineerでAIプロンプトを最適化
目標が曖昧だったり複雑だったりすると、明確なプロンプトを書くのは困難です。このスキルは、実績のあるプロンプトフレームワークを使って、粗い依頼を構造化されたプロンプトに変換します。
リサーチインサイトでプロダクト業務の優先順位を決める
プロダクトチームには、機能の順位付け、インタビューの統合、意思決定の文書化をより速く行う方法が必要です。このスキルは、構造化された計画のために、RICEスコアリング、インタビュー分析、PRDテンプレートを提供します。
プロファイリングによる Go パフォーマンスの最適化
作成者 89jobrien
Go サービスは、明確な根拠がないまま低速化したりメモリ使用量が増えたりすることがあります。このスキルは、プロファイリング、割り当て分析、並行処理のチューニング、ベンチマーク主導の最適化をガイドします。
より良いLLMプロンプトを設計する
作成者 alirezarezvani
プロンプトの品質は、要件、例、評価基準が不明確なために失敗することがよくあります。このスキルは、チームがClaude、Codex、Claude Code向けの本番用プロンプトを設計、テスト、レビューするのに役立ちます。
AIエージェントにおけるコンテキスト劣化の診断
作成者 ChakshuGautam
長い会話や大規模なプロンプトにより、AIエージェントは重要な情報を見失ったり、矛盾するコンテキストに従ったりすることがあります。このスキルは、Claude、Codex、Claude Codeが劣化パターンを特定し、緩和戦略を選択するのに役立ちます。
コード複雑度を分析
作成者 CuriousLearner
複雑なコードはレビュー、テスト、保守が困難です。このスキルは、Claude、Codex、Claude Code が複雑度メトリクスを測定し、的を絞ったリファクタリング指針を作成するのに役立ちます。
プロファイリングによる Python パフォーマンスの最適化
作成者 wshobson
低速な Python サービスやデータジョブは、測定なしでは修正が困難です。このスキルは、Claude、Codex、Claude Code がプロファイリング、ベンチマーキング、メモリ分析、 targeted optimization を進めるための指針を提供します。
Detect LLM Prompt Regressions with Promptfoo
作成者 7alexhale5-rgb
Prompt changes can silently reduce output quality. This skill builds golden datasets, runs Promptfoo evaluations, and summarizes failures and recent trends.