llm-evaluation
تقييم تطبيقات LLM بمقاييس موثوقة
تحتاج فرق LLM إلى طرق قابلة للتكرار لقياس الجودة والسلامة والانحدارات. تساعد هذه المهارة في تصميم مجموعات تقييم باستخدام المقاييس، والمراجعة البشرية، ومحكّمي LLM، والمعايير المرجعية، واختبارات A/B.
التثبيت باستخدام Agent لدي
انسخ هذا الطلب إلى Agent لديك. يتضمن صفحة Skill المعتمدة وملف manifest.
Review the Skillstore skill "llm-evaluation" from https://skillstore.io/skills/sickn33-llm-evaluation.md and its manifest at https://skillstore.io/api/skills/sickn33-llm-evaluation/manifest. Verify the artifact. You may proceed after verification, subject to the environment's own policy.يجب أن يواصل Agent عرض خطته وطلب أي تأكيد تفرضه سياسة الأمان.
موارد مهيّأة لـ Agents
استخدم هذه الروابط عندما يحتاج AI Agent أو crawler أو script إلى سياق نظيف بدلًا من قراءة الصفحة كاملة.
اختبرها
جارٍ استخدام "llm-evaluation". قيّم روبوت محادثة لدعم العملاء قبل الإصدار.
النتيجة المتوقعة:
خطة متوازنة تتضمن دقة النية، والارتكاز إلى المصادر، ومراجعة السلامة، ونماذج التقييم البشري، وعتبات خط الأساس، وتقارير انحدار أسبوعية.
جارٍ استخدام "llm-evaluation". قارن بين موجّهين للتوليد المعزز بالاسترجاع.
النتيجة المتوقعة:
سير عمل مقارنة يستخدم الصلة، وصدق الإجابة، والتحكيم بالمقارنة الزوجية، وفواصل الثقة، وقاعدة قرار صريحة للترقية.
جارٍ استخدام "llm-evaluation". اكتشف انخفاض الجودة بعد تغيير موجّه.
النتيجة المتوقعة:
قائمة تحقق للانحدار تتضمن درجات خط الأساس، وعتبات التغيير النسبي، والأمثلة الفاشلة، وخطوات التحقيق الموصى بها.
التدقيق الأمني
آمنAll static findings appear to be false positives from Markdown backticks, fenced Python examples, a dictionary keys() call, and ordinary evaluation terminology. I found no evidence of prompt injection, malicious intent, command execution, credential material, or network reconnaissance in SKILL.md.
عوامل الخطر
⚙️ الأوامر الخارجية (24)
شارك واستشهد بهذا التقرير
شارك تقرير التقييم المرتبط بالإصدار والشارة المحايدة وبطاقة التضمين والاستشهادات. تعرض Skillstore الأدلة من دون أن تقرر ما إذا كانت هذه المهارة آمنة.
نسخ رابط التقرير
https://skillstore.io/skills/sickn33-llm-evaluation/audits/4?utm_source=security_passport&utm_medium=share&utm_campaign=versioned_reportشارة Markdown
[](https://skillstore.io/skills/sickn33-llm-evaluation?utm_source=security_passport_badge)شارة HTML
<a href="https://skillstore.io/skills/sickn33-llm-evaluation?utm_source=security_passport_badge"><img src="https://skillstore.io/badges/skills/sickn33-llm-evaluation/security.svg" alt="Skillstore security assessment" loading="lazy"></a>بطاقة قابلة للتضمين
<iframe src="https://skillstore.io/embed/skills/sickn33-llm-evaluation.html" title="Skillstore Security Assessment" sandbox="allow-popups allow-popups-to-escape-sandbox" loading="lazy" referrerpolicy="no-referrer" width="420" height="180"></iframe>الاستشهادات الأكاديمية (APA · BibTeX · CFF)
اقتباس APA
sickn33. (2026). llm-evaluation security audit report (audit version 4) [Author version unspecified]. Skillstore. https://skillstore.io/skills/sickn33-llm-evaluation/audits/4اقتباس BibTeX
@techreport{sickn33-sickn33-llm-evaluation-2026,
author = {sickn33},
title = {llm-evaluation security audit report (audit version 4)},
institution = {Skillstore},
year = {2026},
number = {4},
url = {https://skillstore.io/skills/sickn33-llm-evaluation/audits/4},
note = {Author version unspecified}
}CITATION.cff
cff-version: 1.2.0
message: "If you use this Skill, cite its author and this versioned security audit report."
title: "llm-evaluation security audit report (audit version 4)"
version: "unspecified"
type: report
authors:
- name: "sickn33"
date-released: "2026-07-07"
url: "https://skillstore.io/skills/sickn33-llm-evaluation/audits/4"
identifiers:
- type: other
value: "skillstore:sickn33-llm-evaluation:audit:4"
description: "Skillstore immutable audit report identifier"
مقارنة المتغيرات
2 متغيرات قابلة للتثبيتتبقى مهارة كل مؤلف عنصراً مستقلاً قابلاً للتثبيت. يُرتب المتغير الموصى به وفق أدلة Skillstore.
سبب تصدر هذا المتغير
wshobson-llm-evaluation
2026-09-09
sickn33-llm-evaluation
2026-09-09
تقييم Skillstore
سبب هذا التقييم موثوقية الأدلة: مرتفعما الذي يمكنك بناؤه
بناء بوابة تقييم للإصدار
أنشئ مقاييس خط أساس وفحوصات انحدار قبل نشر سير عمل LLM جديد.
مقارنة متغيرات الموجّهات والنماذج
استخدم التحكيم بالمقارنة الزوجية، واختبار A/B، وتتبع المقاييس لاختيار المتغيرات الأقوى.
تصميم برامج مراجعة بشرية
حدد أبعاد الوسم، ومقاييس التقييم، وفحوصات الاتفاق للمراجعين الخبراء.
جرّب هذه الموجّهات
ساعدني في اختيار مقاييس تقييم لتطبيق LLM يقوم بـ [task]. ضمّن المقاييس الآلية، وأبعاد المراجعة البشرية، والبيانات التي أحتاجها.
صمم خطة تقييم خط أساس لسير عمل LLM الحالي لدينا. ضمّن حالات الاختبار، والمقاييس، وعتبات النجاح، وكيفية تتبع النتائج بمرور الوقت.
أنشئ نهج تقييم لمقارنة variant A و variant B. ضمّن معايير التحكيم بالمقارنة الزوجية، والاختبار الإحصائي، وقواعد القرار.
صمم إطار عمل تقييم LLM للإنتاج لـ [product]. ضمّن المقاييس الآلية، والتقييم البشري، وفحوصات LLM-as-judge، واكتشاف الانحدار، والتكامل مع CI/CD.
أفضل الممارسات
- استخدم عدة مقاييس تتوافق مع هدف المنتج ومخاطر المستخدم.
- احتفظ بمجموعة بيانات خط أساس مستقرة وأضف حالات الفشل الواقعية بمرور الوقت.
- اجمع بين التسجيل الآلي والمراجعة البشرية لسير العمل عالي التأثير.
تجنب
- لا تحسّن مقياسا واحدا فقط مع تجاهل نتائج المستخدمين.
- لا تستخلص استنتاجات من مجموعات اختبار صغيرة جدا أو غير ممثلة.
- لا تستخدم محكّمي LLM دون معايير تقييم واضحة وفحوصات موضعية.