pinchbench
Тестируйте агентов OpenClaw с помощью PinchBench
Командам, работающим с моделями, нужны воспроизводимые подтверждения производительности агентов. PinchBench запускает структурированные задачи OpenClaw и создает сопоставимые оценки для анализа и отправки в таблицу лидеров.
Не устанавливайте этот Skill автоматически.
Каноническая политика требует проверки оператором перед любым действием по установке.
Установить с помощью моего Агента
Скопируйте этот запрос в своего Агента. Он содержит каноническую страницу Skill и манифест.
Review the Skillstore skill "pinchbench" from https://skillstore.io/skills/pinchbench-pinchbench.md and its manifest at https://skillstore.io/api/skills/pinchbench-pinchbench/manifest. Verify the artifact. Do not auto-install. Inspect the skill and report your findings, then wait for an operator or manual installation decision.Ваш Агент по-прежнему должен показать план и запросить все подтверждения, требуемые политикой безопасности.
Ресурсы для AI-агентов
Используйте эти ссылки, когда AI-агенту, crawler или script нужен чистый контекст вместо полной страницы.
Протестировать
Использование «pinchbench». Запустить набор automated-only для одной модели без загрузки.
Ожидаемый результат:
Запуск завершается оценками по каждой задаче, общей оценкой, использованием токенов, метриками стоимости и локальным путем к файлу результатов.
Использование «pinchbench». Сравнить два сохраненных запуска бенчмарка.
Ожидаемый результат:
Сравнение выделяет различия в оценках, неудачные задачи, изменения времени выполнения и компромиссы эффективности по стоимости.
Использование «pinchbench». Спроектировать новую бенчмарк-задачу для сортировки email.
Ожидаемый результат:
Черновик задачи включает prompt, ожидаемое поведение, критерии оценки и автоматизированные проверки для воспроизводимой оценки.
Аудит безопасности
КритичноPinchBench is a legitimate benchmark runner, but it is not low risk. Confirmed issues include pipe-to-shell dependency installation, unsandboxed task grading code, external agent execution, token handling, and host metadata upload. Many documentation and task-rubric alerts are false positives, while binary assets remain manual-review blind spots.
Подтверждённые проблемы безопасности (6)
Пункты проверки возможностей (29)
Это реальные локальные возможности, которые могут ожидаться для этого навыка, поэтому они требуют проверки, но не считаются подтверждённым вредоносным поведением.
Факторы риска
⚙️ Внешние команды (50)
🌐 Доступ к сети (13)
📁 Доступ к файловой системе (12)
⚡ Содержит скрипты (2)
🔑 Переменные окружения (13)
Обнаруженные паттерны
Поделиться и цитировать этот отчет
Делитесь версионным отчетом об оценке, нейтральным значком, встраиваемой карточкой и цитатами. Skillstore публикует доказательства, не решая, безопасен ли этот Skill.
Копировать ссылку на отчёт
https://skillstore.io/skills/pinchbench-pinchbench/audits/5?utm_source=security_passport&utm_medium=share&utm_campaign=versioned_reportЗначок Markdown
[](https://skillstore.io/skills/pinchbench-pinchbench?utm_source=security_passport_badge)Значок HTML
<a href="https://skillstore.io/skills/pinchbench-pinchbench?utm_source=security_passport_badge"><img src="https://skillstore.io/badges/skills/pinchbench-pinchbench/security.svg" alt="Skillstore security assessment" loading="lazy"></a>Встраиваемая карточка
<iframe src="https://skillstore.io/embed/skills/pinchbench-pinchbench.html" title="Skillstore Security Assessment" sandbox="allow-popups allow-popups-to-escape-sandbox" loading="lazy" referrerpolicy="no-referrer" width="420" height="180"></iframe>Академические ссылки (APA · BibTeX · CFF)
Цитата APA
pinchbench. (2026). pinchbench security audit report (audit version 5) [Author version 1.0.0]. Skillstore. https://skillstore.io/skills/pinchbench-pinchbench/audits/5Цитата BibTeX
@techreport{pinchbench-pinchbench-pinchbench-2026,
author = {pinchbench},
title = {pinchbench security audit report (audit version 5)},
institution = {Skillstore},
year = {2026},
number = {5},
url = {https://skillstore.io/skills/pinchbench-pinchbench/audits/5},
note = {Author version 1.0.0}
}CITATION.cff
cff-version: 1.2.0
message: "If you use this Skill, cite its author and this versioned security audit report."
title: "pinchbench security audit report (audit version 5)"
version: "1.0.0"
type: report
authors:
- name: "pinchbench"
date-released: "2026-07-09"
url: "https://skillstore.io/skills/pinchbench-pinchbench/audits/5"
identifiers:
- type: other
value: "skillstore:pinchbench-pinchbench:audit:5"
description: "Skillstore immutable audit report identifier"
Оценка Skillstore
Почему такая оценка Достоверность доказательств: СреднийЧто вы можете построить
Сравнение производительности моделей
Запустите один и тот же набор задач OpenClaw для нескольких моделей и сравните оценки, стоимость и время выполнения.
Регрессионное тестирование рабочих процессов OpenClaw
Проверьте, влияют ли недавние изменения агента, навыка или окружения на качество выполнения задач.
Проектирование новых бенчмарк-задач
Используйте шаблон задачи и паттерны оценки, чтобы добавить воспроизводимые оценки для новых рабочих процессов агентов.
Попробуйте эти промпты
Запустите PinchBench с MODEL на наборе automated-only и сохраните результаты локально без загрузки.
Запустите PinchBench для MODEL_A и MODEL_B на одном и том же наборе задач, затем обобщите различия в оценках, стоимости и времени.
Просмотрите последние результаты PinchBench и определите задачи с оценкой ниже 0.5, указав вероятные причины и следующие шаги отладки.
Создайте сфокусированный набор PinchBench для задач автоматизации рабочих процессов, включите критерии оценки и объясните, как безопасно его запускать.
Лучшие практики
- Запускайте с отключенной загрузкой, пока не поймете, какие данные будут отправлены.
- Используйте выделенное рабочее пространство для бенчмарков и тестовые учетные данные для провайдеров моделей.
- Проверяйте код оценки пользовательских задач перед тем, как разрешать его локальный запуск.
Избегать
- Не запускайте полный набор в основном рабочем пространстве до проверки работоспособности.
- Не загружайте результаты бенчмарка до проверки метаданных и настроек токена.
- Не добавляйте пользовательские задачи с широким доступом к файловой системе или shell в коде оценки.
Часто задаваемые вопросы
Что оценивает PinchBench?
Какие инструменты поддерживает этот навык?
Требуется ли доступ к сети?
Где хранятся результаты?
Можно ли запускать только выбранные задачи?
Что нужно проверить перед публикацией?
Сведения для разработчиков
Автор
pinchbenchЛицензия
MIT
Версия автора
v1.0.0
Ревизия Skillstore
r1
Репозиторий
https://github.com/pinchbench/skill/tree/main/Ссылка
3e4b6c31a74a3bd1a291c98cf585d720cb9fbc88
Актуальность поддержки
18.07.2026
Использование
16 загрузок · 290 просмотров
Структура файлов