Навыки llm-evaluation
📦

llm-evaluation

Ревизия содержимого r1 Безопасно ⚙️ Внешние команды

Оценивайте LLM-приложения с помощью надежных метрик

Командам, работающим с LLM, нужны воспроизводимые способы измерять качество, безопасность и регрессии. Этот навык помогает проектировать наборы оценок с метриками, экспертной проверкой, LLM-судьями, бенчмарками и A/B-тестами.

Поддерживает: Claude Codex Code(CC)
🥉 78 Бронза

Установить с помощью моего Агента

Скопируйте этот запрос в своего Агента. Он содержит каноническую страницу Skill и манифест.

Запрос агента
Review the Skillstore skill "llm-evaluation" from https://skillstore.io/skills/sickn33-llm-evaluation.md and its manifest at https://skillstore.io/api/skills/sickn33-llm-evaluation/manifest. Verify the artifact. You may proceed after verification, subject to the environment's own policy.

Ваш Агент по-прежнему должен показать план и запросить все подтверждения, требуемые политикой безопасности.

Ресурсы для AI-агентов

Используйте эти ссылки, когда AI-агенту, crawler или script нужен чистый контекст вместо полной страницы.

Протестировать

Использование «llm-evaluation». Оценить чат-бота службы поддержки перед релизом.

Ожидаемый результат:

Сбалансированный план с точностью распознавания намерений, обоснованностью на источниках, проверкой безопасности, формами человеческой оценки, базовыми порогами и еженедельными отчетами о регрессиях.

Использование «llm-evaluation». Сравнить два промпта для retrieval-augmented generation.

Ожидаемый результат:

Процесс сравнения с использованием релевантности, верности ответа источникам, попарной оценки, доверительных интервалов и явного правила принятия решения о продвижении.

Использование «llm-evaluation». Обнаружить падение качества после изменения промпта.

Ожидаемый результат:

Чеклист регрессии с базовыми оценками, порогами относительного изменения, неудачными примерами и рекомендуемыми шагами расследования.

Аудит безопасности

Безопасно

All static findings appear to be false positives from Markdown backticks, fenced Python examples, a dictionary keys() call, and ordinary evaluation terminology. I found no evidence of prompt injection, malicious intent, command execution, credential material, or network reconnaissance in SKILL.md.

1
Просканировано файлов
484
Проанализировано строк
0
Пункты проверки
0
Ложные срабатывания проигнорированы
Последний завершенный статический и семантический аудит не обнаружил подтвержденных проблем безопасности. Это не доказывает отсутствие побочных эффектов у навыка.
Поделиться и цитировать этот отчет

Делитесь версионным отчетом об оценке, нейтральным значком, встраиваемой карточкой и цитатами. Skillstore публикует доказательства, не решая, безопасен ли этот Skill.

Открыть версионный отчет
Оценка безопасности

Копировать ссылку на отчёт

https://skillstore.io/skills/sickn33-llm-evaluation/audits/4?utm_source=security_passport&utm_medium=share&utm_campaign=versioned_report

Значок Markdown

[![Skillstore security assessment](https://skillstore.io/badges/skills/sickn33-llm-evaluation/security.svg)](https://skillstore.io/skills/sickn33-llm-evaluation?utm_source=security_passport_badge)

Значок HTML

<a href="https://skillstore.io/skills/sickn33-llm-evaluation?utm_source=security_passport_badge"><img src="https://skillstore.io/badges/skills/sickn33-llm-evaluation/security.svg" alt="Skillstore security assessment" loading="lazy"></a>

Встраиваемая карточка

<iframe src="https://skillstore.io/embed/skills/sickn33-llm-evaluation.html" title="Skillstore Security Assessment" sandbox="allow-popups allow-popups-to-escape-sandbox" loading="lazy" referrerpolicy="no-referrer" width="420" height="180"></iframe>
Академические ссылки (APA · BibTeX · CFF)

Цитата APA

sickn33. (2026). llm-evaluation security audit report (audit version 4) [Author version unspecified]. Skillstore. https://skillstore.io/skills/sickn33-llm-evaluation/audits/4

Цитата BibTeX

@techreport{sickn33-sickn33-llm-evaluation-2026, author = {sickn33}, title = {llm-evaluation security audit report (audit version 4)}, institution = {Skillstore}, year = {2026}, number = {4}, url = {https://skillstore.io/skills/sickn33-llm-evaluation/audits/4}, note = {Author version unspecified} }

CITATION.cff

cff-version: 1.2.0 message: "If you use this Skill, cite its author and this versioned security audit report." title: "llm-evaluation security audit report (audit version 4)" version: "unspecified" type: report authors: - name: "sickn33" date-released: "2026-07-07" url: "https://skillstore.io/skills/sickn33-llm-evaluation/audits/4" identifiers: - type: other value: "skillstore:sickn33-llm-evaluation:audit:4" description: "Skillstore immutable audit report identifier"

Сравнить варианты

2 устанавливаемых вариантов

Навык каждого автора остаётся отдельным устанавливаемым вариантом. Рекомендуемый вариант ранжируется по данным Skillstore.

Почему этот вариант первый

Больше использования в Skillstore
wshobson Рекомендуется

wshobson-llm-evaluation

Оценка Skillstore 78
Достоверность доказательств Высокий
Использование в Skillstore 21
Обновлено

2026-09-09

sickn33 Текущий

sickn33-llm-evaluation

Оценка Skillstore 78
Достоверность доказательств Высокий
Использование в Skillstore 12
Обновлено

2026-09-09

Оценка Skillstore

Почему такая оценка Достоверность доказательств: Высокий
55
Архитектура
85
Сопровождаемость
87
Контент
68
Сообщество
83
Соответствие спецификации

Что вы можете построить

Создать оценочный контроль перед релизом

Создайте базовые метрики и регрессионные проверки перед развертыванием нового LLM-процесса.

Сравнить варианты промптов и моделей

Используйте попарную оценку, A/B-тестирование и отслеживание метрик, чтобы выбрать более сильные варианты.

Спроектировать программы экспертной проверки

Определите измерения аннотации, шкалы оценок и проверки согласованности для экспертов-рецензентов.

Попробуйте эти промпты

Выбрать стартовые метрики
Помогите мне выбрать метрики оценки для LLM-приложения, которое выполняет [task]. Включите автоматизированные метрики, измерения экспертной проверки и данные, которые мне нужны.
Создать план базовой оценки
Спроектируйте план базовой оценки для нашего текущего LLM-процесса. Включите тестовые случаи, метрики, пороговые значения прохождения и способ отслеживать результаты со временем.
Сравнить два варианта
Создайте подход к оценке для сравнения варианта A и варианта B. Включите критерии попарной оценки, статистическое тестирование и правила принятия решения.
Создать производственную систему оценки
Спроектируйте производственный фреймворк оценки LLM для [product]. Включите автоматизированные метрики, человеческую оценку, проверки LLM-as-judge, обнаружение регрессий и интеграцию с CI/CD.

Лучшие практики

  • Используйте несколько метрик, соответствующих цели продукта и пользовательскому риску.
  • Поддерживайте стабильный базовый датасет и со временем добавляйте реальные случаи сбоев.
  • Сочетайте автоматизированную оценку с экспертной проверкой для процессов с высоким влиянием.

Избегать

  • Не оптимизируйте только одну метрику, игнорируя пользовательские результаты.
  • Не делайте выводы на основе крошечных или нерепрезентативных тестовых наборов.
  • Не используйте LLM-судей без четких рубрик и выборочных проверок.

Часто задаваемые вопросы

Какие типы LLM-систем может оценивать этот навык?
Он поддерживает чат-ботов, RAG-системы, задачи классификации, суммаризацию, варианты промптов и сравнения моделей.
Запускает ли этот навык оценки автоматически?
Нет. Он предоставляет рекомендации и примеры фрагментов кода для построения оценочных процессов.
Может ли он заменить экспертную проверку?
Нет. Он рекомендует сочетать автоматизированные метрики с человеческим суждением для тонких проверок качества и безопасности.
Включает ли он бенчмарк-датасеты?
Нет. Просканированный пакет включает только SKILL.md. Упомянутые файлы бенчмарков отсутствовали в структуре файлов.
Могу ли я использовать его с Claude Code или Codex?
Да. В метаданных указана поддержка Claude, Codex и Claude Code.
Что следует подготовить перед его использованием?
Подготовьте репрезентативные тестовые случаи, ожидаемые результаты, цели продукта, зоны риска и любые базовые результаты.

Сведения для разработчиков

Автор

sickn33

Лицензия

MIT

Ревизия Skillstore

r1

Примечание о версии

Автор не указал версию.

Ссылка

816c62b2546ddb1c6a0453e7c781b5e095117819

Актуальность поддержки

18.07.2026

Использование

9 загрузок · 89 просмотров

Структура файлов

📄 SKILL.md

Больше от sickn33

Показать все
📦

content-creator

88

Создание маркетингового контента в едином стиле бренда

Маркетинговым командам нужен контент, который остается согласованным во всех каналах. Этот навык помогает планировать, писать, анализировать и оптимизировать контент с учетом голоса бренда и SEO.

Письмо и контент Просмотр
📦

prompt-engineering-patterns

85

Улучшайте LLM-промпты с помощью проверенных паттернов

Непоследовательные промпты тратят время и снижают доверие к результатам AI. Этот навык помогает проектировать промпты с использованием переиспользуемых паттернов, примеров, этапов оценки и рабочих процессов оптимизации.

Продуктивность Просмотр
📦

senior-architect

81

Проектируйте масштабируемые архитектуры ПО

Архитектурные решения сложно сравнивать для веб-, мобильных, backend- и облачных систем. Этот навык предоставляет структурированные руководства и локальные скрипты-заготовки для отчетов, анализа зависимостей и документирования компромиссов.

Кодинг и разработка Просмотр
📦

senior-fullstack

81

Создавайте fullstack-приложения с senior-паттернами

Командам нужны единые рекомендации по настройке, архитектуре и ревью для современных веб-приложений. Этот skill предоставляет scaffolders, справочные материалы по рабочим процессам и quality prompts для проектов на React, Next.js, Node.js, GraphQL и PostgreSQL.

Кодинг и разработка Просмотр
📦

product-manager-toolkit

80

Приоритизируйте продуктовую работу с помощью исследовательских инсайтов

Продуктовым командам нужны более быстрые способы ранжировать функции, обобщать интервью и документировать решения. Этот навык предоставляет RICE-оценку, анализ интервью и шаблоны PRD для структурированного планирования.

Продуктивность Просмотр
Показать все
📦

golang-performance

82

Оптимизация производительности Go с помощью профилирования

от 89jobrien

Сервисы Go могут становиться медленными или потреблять много памяти без очевидных доказательств причины. Этот навык помогает с профилированием, анализом аллокаций, настройкой конкурентности и оптимизацией на основе бенчмарков.

Кодинг и разработка Просмотр
📦

senior-prompt-engineer

81

Проектируйте более качественные LLM-промпты

от alirezarezvani

Качество промптов часто страдает из-за неясных требований, примеров и критериев оценки. Этот навык помогает командам проектировать, тестировать и проверять production-промпты для Claude, Codex и Claude Code.

Кодинг и разработка Просмотр
📦

context-degradation

81

Диагностика деградации контекста в ИИ-агентах

от ChakshuGautam

Длинные диалоги и большие промпты могут приводить к тому, что ИИ-агенты теряют важную информацию или следуют противоречивому контексту. Этот навык помогает Claude, Codex и Claude Code выявлять паттерны деградации и выбирать стратегии смягчения.

Кодинг и разработка Просмотр
📦

python-performance-optimization

77

Оптимизация производительности Python с помощью профилирования

от wshobson

Медленные Python-сервисы и задачи обработки данных трудно исправлять без измерений. Этот навык помогает Claude, Codex и Claude Code выполнять профилирование, бенчмаркинг, анализ памяти и целевую оптимизацию.

Кодинг и разработка Просмотр