Навыки evaluation
📦

evaluation

Ревизия содержимого r2 Безопасно ⚙️ Внешние команды🌐 Доступ к сети

Оценивайте агентные системы

Агентные системы сложно тестировать, потому что корректные запуски могут идти разными путями. Этот навык помогает создавать рубрики, тестовые наборы, методы оценки и регрессионные проверки для надежной оценки качества.

Поддерживает: Claude Codex Code(CC)
🥉 78 Бронза

Установить с помощью моего Агента

Скопируйте этот запрос в своего Агента. Он содержит каноническую страницу Skill и манифест.

Запрос агента
Review the Skillstore skill "evaluation" from https://skillstore.io/skills/sickn33-evaluation.md and its manifest at https://skillstore.io/api/skills/sickn33-evaluation/manifest. Verify the artifact. You may proceed after verification, subject to the environment's own policy.

Ваш Агент по-прежнему должен показать план и запросить все подтверждения, требуемые политикой безопасности.

Ресурсы для AI-агентов

Используйте эти ссылки, когда AI-агенту, crawler или script нужен чистый контекст вместо полной страницы.

Протестировать

Использование «evaluation». Мне нужно оценить исследовательского агента перед релизом.

Ожидаемый результат:

Рубрика, охватывающая фактическую точность, качество цитирования, полноту, качество источников и эффективность использования инструментов, а также пороги релиза и заметки для проверки.

Использование «evaluation». Я изменил схему контекста и мне нужно доказательство, что качество улучшилось.

Ожидаемый результат:

План сравнения с использованием того же тестового набора, взвешенных оценок качества, использования токенов, количества вызовов инструментов и регрессионных проверок.

Использование «evaluation». Мне нужен мониторинг качества агента в продакшене.

Ожидаемый результат:

План выборки, структура дашборда метрик, пороги оповещений и процесс сочетания автоматизированных оценок с проверкой человеком.

Аудит безопасности

Безопасно

All nine static findings are false positives caused by Markdown fences, descriptive prose, integration names, and a source metadata URL. The skill is documentation-only and contains no executable commands, network requests, reconnaissance behavior, or prompt injection.

1
Просканировано файлов
244
Проанализировано строк
0
Пункты проверки
0
Ложные срабатывания проигнорированы

Факторы риска

⚙️ Внешние команды (3)
🌐 Доступ к сети (1)
Последний завершенный статический и семантический аудит не обнаружил подтвержденных проблем безопасности. Это не доказывает отсутствие побочных эффектов у навыка.
Поделиться и цитировать этот отчет

Делитесь версионным отчетом об оценке, нейтральным значком, встраиваемой карточкой и цитатами. Skillstore публикует доказательства, не решая, безопасен ли этот Skill.

Открыть версионный отчет
Оценка безопасности

Копировать ссылку на отчёт

https://skillstore.io/skills/sickn33-evaluation/audits/5?utm_source=security_passport&utm_medium=share&utm_campaign=versioned_report

Значок Markdown

[![Skillstore security assessment](https://skillstore.io/badges/skills/sickn33-evaluation/security.svg)](https://skillstore.io/skills/sickn33-evaluation?utm_source=security_passport_badge)

Значок HTML

<a href="https://skillstore.io/skills/sickn33-evaluation?utm_source=security_passport_badge"><img src="https://skillstore.io/badges/skills/sickn33-evaluation/security.svg" alt="Skillstore security assessment" loading="lazy"></a>

Встраиваемая карточка

<iframe src="https://skillstore.io/embed/skills/sickn33-evaluation.html" title="Skillstore Security Assessment" sandbox="allow-popups allow-popups-to-escape-sandbox" loading="lazy" referrerpolicy="no-referrer" width="420" height="180"></iframe>
Академические ссылки (APA · BibTeX · CFF)

Цитата APA

sickn33. (2026). evaluation security audit report (audit version 5) [Author version unspecified]. Skillstore. https://skillstore.io/skills/sickn33-evaluation/audits/5

Цитата BibTeX

@techreport{sickn33-sickn33-evaluation-2026, author = {sickn33}, title = {evaluation security audit report (audit version 5)}, institution = {Skillstore}, year = {2026}, number = {5}, url = {https://skillstore.io/skills/sickn33-evaluation/audits/5}, note = {Author version unspecified} }

CITATION.cff

cff-version: 1.2.0 message: "If you use this Skill, cite its author and this versioned security audit report." title: "evaluation security audit report (audit version 5)" version: "unspecified" type: report authors: - name: "sickn33" date-released: "2026-07-23" url: "https://skillstore.io/skills/sickn33-evaluation/audits/5" identifiers: - type: other value: "skillstore:sickn33-evaluation:audit:5" description: "Skillstore immutable audit report identifier"

Сравнить варианты

4 устанавливаемых вариантов

Навык каждого автора остаётся отдельным устанавливаемым вариантом. Рекомендуемый вариант ранжируется по данным Skillstore.

Почему этот вариант первый

Самая высокая оценка Skillstore
muratcankoylan Рекомендуется

muratcankoylan-evaluation

Оценка Skillstore 81
Достоверность доказательств Высокий
Использование в Skillstore 14
Обновлено

2026-09-09

chakshugautam-evaluation

Оценка Skillstore 80
Достоверность доказательств Высокий
Использование в Skillstore 10
Обновлено

2026-09-09

sickn33 Текущий

sickn33-evaluation

Оценка Skillstore 78
Достоверность доказательств Высокий
Использование в Skillstore 12
Обновлено

2026-09-09

asmayaseen-evaluation

Оценка Skillstore 77
Достоверность доказательств Высокий
Использование в Skillstore 14
Обновлено

2026-09-09

Оценка Skillstore

Почему такая оценка Достоверность доказательств: Высокий
55
Архитектура
85
Сопровождаемость
87
Контент
69
Сообщество
83
Соответствие спецификации

Что вы можете построить

Создать контрольные пороги качества релиза

Определите критерии прохождения и регрессионные проверки перед выпуском изменений в агентный рабочий процесс.

Сравнить стратегии контекста

Измерьте, как разные схемы контекста, варианты памяти и наборы инструментов влияют на качество агента.

Мониторить поведение в продакшене

Отбирайте примеры реальных взаимодействий и отслеживайте тенденции качества по точности, полноте и эффективности использования инструментов.

Попробуйте эти промпты

Определить цели оценки
Помогите мне определить цели оценки для агента, который выполняет [task]. Включите параметры качества, режимы отказа и простой порог прохождения.
Построить рубрику
Создайте многомерную рубрику для оценки [agent output type]. Включите уровни оценок, веса и рекомендации для проверяющих людей.
Спроектировать тестовый набор
Спроектируйте тестовый набор для [agent workflow]. Включите простые, средние, сложные и очень сложные случаи с ожидаемыми результатами.
Проанализировать результаты оценки
Проанализируйте эти результаты оценки для [agent version]. Выявите регрессии, вероятные причины, пределы уверенности и следующие эксперименты для запуска.

Лучшие практики

  • Оценивайте результаты и качество процесса вместо требования одного точного пути выполнения.
  • Используйте реалистичные задачи из продакшен-использования и включайте известные пограничные случаи.
  • Отслеживайте тенденции во времени и сравнивайте результаты со стабильной базовой линией.

Избегать

  • Использование одной агрегированной оценки без проверки важных параметров качества.
  • Тестирование только простых примеров, которые не отражают реальные запросы пользователей.
  • Доверие автоматизированным оценкам судьи без калибровки или выборочных проверок человеком.

Часто задаваемые вопросы

Что помогает оценивать этот навык?
Он помогает оценивать выходные данные агентов, использование инструментов, стратегии контекста, регрессии и тенденции качества в продакшене.
Включает ли он исполняемый код?
Нет. Он предоставляет рекомендации по проектированию оценки и иллюстративные примеры, а не упакованный тестовый раннер.
Могу ли я использовать его с Claude, Codex и Claude Code?
Да. Рекомендации носят общий характер и могут поддерживать рабочие процессы в Claude, Codex и Claude Code.
Следует ли использовать только LLM-as-judge?
Нет. Автоматизированную оценку следует калибровать и дополнять проверкой человеком для сценариев с высоким влиянием.
Как выбирать тестовые случаи?
Начните с реальных паттернов использования, добавьте пограничные случаи и охватите несколько уровней сложности.
Каково главное ограничение?
Навык не может предоставить предметную истину или определить бизнес-специфические пороги прохождения без ввода от пользователя.

Сведения для разработчиков

Автор

sickn33

Лицензия

MIT

Ревизия Skillstore

r2

Примечание о версии

Автор не указал версию.

Ссылка

88a8e9a07f4c54ab105c1c41b6267c287146b07b

Актуальность поддержки

26.07.2026

Использование

9 загрузок · 147 просмотров

Структура файлов

📄 SKILL.md

Больше от sickn33

Показать все
📦

content-creator

88

Создание маркетингового контента в едином стиле бренда

Маркетинговым командам нужен контент, который остается согласованным во всех каналах. Этот навык помогает планировать, писать, анализировать и оптимизировать контент с учетом голоса бренда и SEO.

Письмо и контент Просмотр
📦

prompt-engineering-patterns

85

Улучшайте LLM-промпты с помощью проверенных паттернов

Непоследовательные промпты тратят время и снижают доверие к результатам AI. Этот навык помогает проектировать промпты с использованием переиспользуемых паттернов, примеров, этапов оценки и рабочих процессов оптимизации.

Продуктивность Просмотр
📦

senior-architect

81

Проектируйте масштабируемые архитектуры ПО

Архитектурные решения сложно сравнивать для веб-, мобильных, backend- и облачных систем. Этот навык предоставляет структурированные руководства и локальные скрипты-заготовки для отчетов, анализа зависимостей и документирования компромиссов.

Кодинг и разработка Просмотр
📦

senior-fullstack

81

Создавайте fullstack-приложения с senior-паттернами

Командам нужны единые рекомендации по настройке, архитектуре и ревью для современных веб-приложений. Этот skill предоставляет scaffolders, справочные материалы по рабочим процессам и quality prompts для проектов на React, Next.js, Node.js, GraphQL и PostgreSQL.

Кодинг и разработка Просмотр
📦

product-manager-toolkit

80

Приоритизируйте продуктовую работу с помощью исследовательских инсайтов

Продуктовым командам нужны более быстрые способы ранжировать функции, обобщать интервью и документировать решения. Этот навык предоставляет RICE-оценку, анализ интервью и шаблоны PRD для структурированного планирования.

Продуктивность Просмотр
Показать все
📦

req-change-workflow

81

Стандартизация рабочих процессов изменения требований

от yunshu0909

Изменения требований часто выходят за пределы предполагаемого объема и создают неясный регрессионный риск. Этот навык дает Claude, Codex и Claude Code поэтапный рабочий процесс для определения объема, анализа влияния, валидации и фиксации решений.

Кодинг и разработка Просмотр
📦

context-degradation

81

Диагностика деградации контекста в ИИ-агентах

от ChakshuGautam

Длинные диалоги и большие промпты могут приводить к тому, что ИИ-агенты теряют важную информацию или следуют противоречивому контексту. Этот навык помогает Claude, Codex и Claude Code выявлять паттерны деградации и выбирать стратегии смягчения.

Кодинг и разработка Просмотр
📦

multi-agent-patterns

80

Проектирование многоагентных AI-систем

от muratcankoylan

Многоагентные системы сложно проектировать, потому что координация, изоляция контекста и режимы отказа взаимосвязаны. Этот навык дает практические шаблоны, компромиссы и примеры для создания надежных команд агентов.

Кодинг и разработка Просмотр
📦

fix-bug

79

Исправление ошибок с помощью структурированного триажа

от Crearize

Отладка backend и frontend может терять контекст и пропускать регрессионные тесты. Этот навык направляет анализ первопричины, минимальные исправления, проверку и передачу pull request.

Кодинг и разработка Просмотр
📦

refactor-code

77

Безопасный рефакторинг кода

от Crearize

Рефакторинг может улучшить код, но при широких изменениях способен привести к регрессиям. Этот навык помогает проводить поэтапный анализ, небольшие правки, тестирование, планирование отката и подготовку понятных отчетов.

Кодинг и разработка Просмотр