Навыки advanced-evaluation
📦

advanced-evaluation

Ревизия содержимого r2 Средний риск ⚙️ Внешние команды🌐 Доступ к сети

Создавайте надежные системы оценки LLM

Качество оценки LLM часто снижается, когда судьи используют расплывчатые рубрики или предвзятые сравнения. Этот навык помогает Claude, Codex и Claude Code выполнять оценивание, парное сравнение, снижение предвзятости и выбор метрик.

Поддерживает: Claude Codex Code(CC)
📊 73 Адекватно

Установить с помощью моего Агента

Скопируйте этот запрос в своего Агента. Он содержит каноническую страницу Skill и манифест.

Запрос агента
Review the Skillstore skill "advanced-evaluation" from https://skillstore.io/skills/muratcankoylan-advanced-evaluation.md and its manifest at https://skillstore.io/api/skills/muratcankoylan-advanced-evaluation/manifest. Verify the artifact. You may proceed after verification, subject to the environment's own policy.

Ваш Агент по-прежнему должен показать план и запросить все подтверждения, требуемые политикой безопасности.

Ресурсы для AI-агентов

Используйте эти ссылки, когда AI-агенту, crawler или script нужен чистый контекст вместо полной страницы.

Протестировать

Использование «advanced-evaluation». Команде нужно оценивать ответы службы поддержки клиентов по точности и полезности.

Ожидаемый результат:

Навык рекомендует прямое оценивание с отдельными взвешенными критериями для фактической точности, полноты, тона и практической применимости.

Использование «advanced-evaluation». Два ответа чат-бота отличаются главным образом стилем и ясностью.

Ожидаемый результат:

Навык рекомендует парное сравнение с перестановкой позиций, обработкой ничьих и уверенностью на основе согласованности.

Использование «advanced-evaluation». Судья в целом совпадает с людьми, но ошибается на кратких ответах.

Ожидаемый результат:

Навык выявляет риск предвзятости к длине и рекомендует явные критерии лаконичности, а также анализ расхождений по длине ответа.

Аудит безопасности

Средний риск

All 44 static alerts are false positives caused by Markdown formatting, ordinary collection methods, evaluation terminology, and research links. The local example script only calculates and prints demonstration results. However, evaluator prompts interpolate untrusted candidate responses without explicit prompt-injection isolation, which could permit scoring manipulation.

6
Просканировано файлов
1,784
Проанализировано строк
0
Пункты проверки
0
Ложные срабатывания проигнорированы

Подтверждённые проблемы безопасности (1)

Средний
Evaluator Prompt Injection Exposure
The examples interpolate candidate responses directly into judge prompts without telling the judge to treat embedded directives as untrusted data. A crafted response could manipulate scores or bypass rubric instructions.
The prompt templates visibly place candidate-controlled text in evaluator context without instruction-isolation guidance. This is a recognized scoring-integrity weakness, although exploitation depends on the judge model.
Поделиться и цитировать этот отчет

Делитесь версионным отчетом об оценке, нейтральным значком, встраиваемой карточкой и цитатами. Skillstore публикует доказательства, не решая, безопасен ли этот Skill.

Открыть версионный отчет
Оценка безопасности

Копировать ссылку на отчёт

https://skillstore.io/skills/muratcankoylan-advanced-evaluation/audits/8?utm_source=security_passport&utm_medium=share&utm_campaign=versioned_report

Значок Markdown

[![Skillstore security assessment](https://skillstore.io/badges/skills/muratcankoylan-advanced-evaluation/security.svg)](https://skillstore.io/skills/muratcankoylan-advanced-evaluation?utm_source=security_passport_badge)

Значок HTML

<a href="https://skillstore.io/skills/muratcankoylan-advanced-evaluation?utm_source=security_passport_badge"><img src="https://skillstore.io/badges/skills/muratcankoylan-advanced-evaluation/security.svg" alt="Skillstore security assessment" loading="lazy"></a>

Встраиваемая карточка

<iframe src="https://skillstore.io/embed/skills/muratcankoylan-advanced-evaluation.html" title="Skillstore Security Assessment" sandbox="allow-popups allow-popups-to-escape-sandbox" loading="lazy" referrerpolicy="no-referrer" width="420" height="180"></iframe>
Академические ссылки (APA · BibTeX · CFF)

Цитата APA

muratcankoylan. (2026). advanced-evaluation security audit report (audit version 8) [Author version unspecified]. Skillstore. https://skillstore.io/skills/muratcankoylan-advanced-evaluation/audits/8

Цитата BibTeX

@techreport{muratcankoylan-muratcankoylan-advanced-evaluation-2026, author = {muratcankoylan}, title = {advanced-evaluation security audit report (audit version 8)}, institution = {Skillstore}, year = {2026}, number = {8}, url = {https://skillstore.io/skills/muratcankoylan-advanced-evaluation/audits/8}, note = {Author version unspecified} }

CITATION.cff

cff-version: 1.2.0 message: "If you use this Skill, cite its author and this versioned security audit report." title: "advanced-evaluation security audit report (audit version 8)" version: "unspecified" type: report authors: - name: "muratcankoylan" date-released: "2026-08-09" url: "https://skillstore.io/skills/muratcankoylan-advanced-evaluation/audits/8" identifiers: - type: other value: "skillstore:muratcankoylan-advanced-evaluation:audit:8" description: "Skillstore immutable audit report identifier"

Сравнить варианты

2 устанавливаемых вариантов

Навык каждого автора остаётся отдельным устанавливаемым вариантом. Рекомендуемый вариант ранжируется по данным Skillstore.

Почему этот вариант первый

Самая высокая оценка Skillstore
ChakshuGautam Рекомендуется

chakshugautam-advanced-evaluation

Оценка Skillstore 81
Достоверность доказательств Высокий
Использование в Skillstore 10
Обновлено

2026-09-09

muratcankoylan Текущий

muratcankoylan-advanced-evaluation

Оценка Skillstore 73
Достоверность доказательств Высокий
Использование в Skillstore 12
Обновлено

2026-09-09

Оценка Skillstore

Почему такая оценка Достоверность доказательств: Высокий
68
Архитектура
85
Сопровождаемость
87
Контент
73
Сообщество
83
Соответствие спецификации

Что вы можете построить

Сравнение ответов моделей

Используйте парное сравнение, чтобы выбрать лучший ответ по тону, ясности, полезности или качеству предпочтения.

Создание оценочных рубрик

Создавайте понятные уровни оценивания, наблюдаемые критерии и рекомендации по пограничным случаям для повторяемых проверок.

Аудит надежности судьи

Сравнивайте результаты автоматизированного судьи с человеческими метками и находите систематические паттерны предвзятости.

Попробуйте эти промпты

Выбрать метод оценки
Помогите мне выбрать метод оценки для [task]. Выводы являются [objective or subjective]. Объясните лучшую метрику и почему.
Создать оценочную рубрику
Создайте сбалансированную рубрику для [criterion] в [domain]. Используйте шкалу [scale] и включите рекомендации по пограничным случаям.
Сравнить два вывода модели
Сравните Response A и Response B по [criteria]. Включите снижение позиционной предвзятости и объясните итоговую уверенность.
Спроектировать оценочный pipeline
Спроектируйте оценочный pipeline для [product workflow]. Включите валидацию, выбор судьи, контроль предвзятости, метрики и триггеры проверки человеком.

Лучшие практики

  • Требуйте обоснование на основе доказательств перед каждой автоматизированной оценкой.
  • Меняйте порядок ответов в парных сравнениях и сопоставляйте результаты обратно перед принятием решения.
  • Проверяйте выводы автоматизированного судьи по человеческим меткам, прежде чем использовать их для принятия решений.

Избегать

  • Использование одной расплывчатой оценки качества для множества несвязанных критериев.
  • Доверие одному проходу парного сравнения без проверки позиционной предвзятости.
  • Считать высокое согласие достаточным без анализа систематических случаев сбоев.

Часто задаваемые вопросы

Для чего нужен этот навык?
Он помогает проектировать оценки LLM-as-judge для оценивания, сравнения, рубрик, метрик и снижения предвзятости.
Запускает ли он оценки автоматически?
Он предоставляет паттерны и примеры. Пользователи должны связать подход с выбранными API моделей и данными.
Когда следует использовать прямое оценивание?
Используйте прямое оценивание, когда критерии объективны, например соответствие формату, точность, безопасность или следование инструкциям.
Когда следует использовать парное сравнение?
Используйте парное сравнение для суждений о предпочтениях, например о тоне, ясности, убедительности или стиле.
Как он снижает предвзятость оценщика?
Он рекомендует перестановку позиций, явные указания по длине, слепую проверку, межмодельное судейство и калибровку уверенности.
Может ли он заменить человеческую оценку?
Нет. Его следует калибровать по человеческим суждениям и направлять случаи с низкой уверенностью на проверку человеком.

Сведения для разработчиков

Автор

muratcankoylan

Лицензия

MIT

Ревизия Skillstore

r2

Примечание о версии

Автор не указал версию.

Ссылка

02be9409c79ca1183f7844009c14d9df684d0cf9

Актуальность поддержки

11.08.2026

Использование

11 загрузок · 391 просмотров

Больше от muratcankoylan

Показать все
📦

context-compression

81

Надежное сжатие длинного контекста агента

В длинных AI-сессиях теряются критически важные решения, изменения файлов и следующие шаги, когда окна контекста заполняются. Этот навык предоставляет структурированные методы сжатия и оценочные проверки для Claude, Codex и Claude Code.

Продуктивность Просмотр
📦

evaluation

81

Оценивайте агентные системы с помощью рубрик

Командам, работающим с агентами, нужны воспроизводимые способы измерять качество, регрессии и изменения контекста. Этот навык помогает проектировать рубрики, тестовые наборы, оценивание и мониторинг.

Данные и аналитика Просмотр
📦

context-degradation

80

Диагностика деградации контекста ИИ

Долгие сеансы работы с ИИ могут скрывать важный контекст и приводить к неправильным ответам агентов. Этот навык помогает выявлять паттерны деградации и выбирать стратегии смягчения для рабочих процессов Claude, Codex и Claude Code.

Исследования и обучение Просмотр
📦

context-optimization

80

Эффективная оптимизация контекстных окон

Длительные агентные сессии могут расходовать токены впустую, замедлять ответы и терять важный контекст. Этот навык дает Claude, Codex и Claude Code практические методы сжатия, маскирования, кэширования и разделения контекста.

Продуктивность Просмотр
📦

multi-agent-patterns

80

Проектирование многоагентных AI-систем

Многоагентные системы сложно проектировать, потому что координация, изоляция контекста и режимы отказа взаимосвязаны. Этот навык дает практические шаблоны, компромиссы и примеры для создания надежных команд агентов.

Кодинг и разработка Просмотр
📦

tool-design

80

Проектируйте инструменты агентов, которые модели используют надежно

Инструменты агентов дают сбои, когда описания, схемы и сообщения об ошибках неоднозначны. Этот навык дает практические шаблоны для более понятных API инструментов, более безопасной консолидации и лучшего тестирования.

Кодинг и разработка Просмотр
Показать все
📦

llm-evaluation

78

Оценка качества LLM-приложений

от wshobson

Командам, работающим с LLM, нужны повторяемые способы измерять качество до того, как изменения попадут к пользователям. Этот навык помогает структурировать автоматизированные метрики, экспертную оценку, судейство, бенчмарки и регрессионные проверки.

Данные и аналитика Просмотр
📦

prompt-engineering-patterns

86

Оптимизация промптов LLM для продакшена

от wshobson

Промпты LLM часто дают сбой из-за неясных инструкций, примеров и критериев оценки. Этот навык предоставляет шаблоны и рабочие процессы для улучшения промптов в Claude, Codex, Claude Code и похожих инструментах.

Продуктивность Просмотр
📦

senior-prompt-engineer

81

Проектируйте более качественные LLM-промпты

от alirezarezvani

Качество промптов часто страдает из-за неясных требований, примеров и критериев оценки. Этот навык помогает командам проектировать, тестировать и проверять production-промпты для Claude, Codex и Claude Code.

Кодинг и разработка Просмотр
📦

when-optimizing-prompts-use-prompt-architect

79

Оптимизируйте AI-промпты с помощью Prompt Architect

от DNYoussef

Слабые промпты приводят к нестабильным AI-результатам и замедляют циклы проверки. Этот навык предоставляет структурированный процесс для улучшения промптов, их тестирования и документирования изменений.

Продуктивность Просмотр
📦

analyzing-docs

78

Аудит покрытия документации

от C0ntr0lledCha0s

Командам нужны ясные доказательства пробелов в документации перед релизами и передачей проектов. Этот навык проверяет покрытие, качество и приоритеты с помощью структурированного рабочего процесса аудита.

Документация Просмотр