prompt-engineering-patterns
86تحسين مطالبات LLM للإنتاج
غالبًا ما تفشل مطالبات LLM لأن التعليمات والأمثلة ومعايير التقييم تكون غير واضحة. توفر هذه المهارة قوالب وسير عمل لتحسين المطالبات في Claude وCodex وClaude Code والأدوات المشابهة.
تقييم جودة تطبيقات LLM
تحتاج فرق LLM إلى طرق قابلة للتكرار لقياس الجودة قبل أن تصل التغييرات إلى المستخدمين. تساعد هذه المهارة في تنظيم المقاييس الآلية، والمراجعة البشرية، والتحكيم، والمعايير المرجعية، وفحوصات الانحدار.
انسخ هذا الطلب إلى Agent لديك. يتضمن صفحة Skill المعتمدة وملف manifest.
Review the Skillstore skill "llm-evaluation" from https://skillstore.io/skills/wshobson-llm-evaluation.md and its manifest at https://skillstore.io/api/skills/wshobson-llm-evaluation/manifest. Verify the artifact. You may proceed after verification, subject to the environment's own policy.يجب أن يواصل Agent عرض خطته وطلب أي تأكيد تفرضه سياسة الأمان.
استخدم هذه الروابط عندما يحتاج AI Agent أو crawler أو script إلى سياق نظيف بدلًا من قراءة الصفحة كاملة.
جارٍ استخدام "llm-evaluation". قيّم روبوت دردشة للدعم قبل الإطلاق.
النتيجة المتوقعة:
خطة تتضمن مقاييس الدقة والملاءمة والسلامة والإفادة؛ وسيناريوهات دعم تمثيلية؛ ونماذج تقييم للمراجعة البشرية؛ وعتبات الإطلاق.
جارٍ استخدام "llm-evaluation". قارن بين مطالبتين للاسترجاع لمساعد RAG.
النتيجة المتوقعة:
سير عمل للمقارنة يستخدم دقة الاسترجاع، ومدى استناد الإجابة إلى المصادر، والتحكيم الزوجي، وفئات الأخطاء، وفحوصات الانحدار.
جارٍ استخدام "llm-evaluation". إعداد مراقبة لتحديثات النماذج.
النتيجة المتوقعة:
استراتيجية انحدار تتضمن درجات خط الأساس، وعتبات التنبيه، وتشغيل المعايير المرجعية، وأخذ عينات من المراجعين، وقواعد قرار الإصدار.
The static external-command findings are markdown Python code fences in SKILL.md, not executable Ruby or shell backtick use. The certificate/key and network reconnaissance findings are false positives from ordinary evaluation text and resource names. No prompt injection attempt, data exfiltration intent, or malicious behavior was found.
شارك تقرير التقييم المرتبط بالإصدار والشارة المحايدة وبطاقة التضمين والاستشهادات. تعرض Skillstore الأدلة من دون أن تقرر ما إذا كانت هذه المهارة آمنة.
https://skillstore.io/skills/wshobson-llm-evaluation/audits/7?utm_source=security_passport&utm_medium=share&utm_campaign=versioned_report[](https://skillstore.io/skills/wshobson-llm-evaluation?utm_source=security_passport_badge)<a href="https://skillstore.io/skills/wshobson-llm-evaluation?utm_source=security_passport_badge"><img src="https://skillstore.io/badges/skills/wshobson-llm-evaluation/security.svg" alt="Skillstore security assessment" loading="lazy"></a><iframe src="https://skillstore.io/embed/skills/wshobson-llm-evaluation.html" title="Skillstore Security Assessment" sandbox="allow-popups allow-popups-to-escape-sandbox" loading="lazy" referrerpolicy="no-referrer" width="420" height="180"></iframe>wshobson. (2026). llm-evaluation security audit report (audit version 7) [Author version unspecified]. Skillstore. https://skillstore.io/skills/wshobson-llm-evaluation/audits/7@techreport{wshobson-wshobson-llm-evaluation-2026,
author = {wshobson},
title = {llm-evaluation security audit report (audit version 7)},
institution = {Skillstore},
year = {2026},
number = {7},
url = {https://skillstore.io/skills/wshobson-llm-evaluation/audits/7},
note = {Author version unspecified}
}cff-version: 1.2.0
message: "If you use this Skill, cite its author and this versioned security audit report."
title: "llm-evaluation security audit report (audit version 7)"
version: "unspecified"
type: report
authors:
- name: "wshobson"
date-released: "2026-07-07"
url: "https://skillstore.io/skills/wshobson-llm-evaluation/audits/7"
identifiers:
- type: other
value: "skillstore:wshobson-llm-evaluation:audit:7"
description: "Skillstore immutable audit report identifier"
تبقى مهارة كل مؤلف عنصراً مستقلاً قابلاً للتثبيت. يُرتب المتغير الموصى به وفق أدلة Skillstore.
سبب تصدر هذا المتغير
wshobson-llm-evaluation
2026-09-09
sickn33-llm-evaluation
2026-09-09
قارن بين المطالبات القديمة والجديدة باستخدام المقاييس والمراجعة البشرية وفحوصات الانحدار قبل الإصدار.
شغّل مجموعات اختبار متسقة عبر النماذج المرشحة ولخّص اختلافات الجودة.
أنشئ نماذج تعليقات توضيحية، وأبعاد تسجيل، وفحوصات اتفاق بين المقيّمين للمراجعين البشريين.
ساعدني في اختيار مقاييس تقييم لتطبيق LLM يتعامل مع [task]. ضمّن المقاييس الآلية، ومعايير المراجعة البشرية، والمخاطر.
صمّم خطة مجموعة بيانات تقييم لـ [application]. ضمّن فئات العينات، والمخرجات المتوقعة، والحالات الحدية، والحد الأدنى لأحجام العينات.
أنشئ خطة تقييم A/B للمطالبة A والمطالبة B. ضمّن المقاييس، والتسجيل البشري، وفحوصات الدلالة، ومعايير الإصدار.
صمّم سير عمل مستمر لاختبار انحدار LLM لـ [system]. ضمّن خطوط الأساس، والعتبات، ولوحات المعلومات، وفرز الإخفاقات، والحوكمة.
المؤلف
wshobsonالترخيص
MIT
مراجعة Skillstore
r1
تنبيه الإصدار
لم يعلن المؤلف عن إصدار.
المستودع
https://github.com/wshobson/agents/tree/main/plugins/llm-application-dev/skills/llm-evaluationمرجع
36e07d5e13068e5be64447e8f20b427cf2cbd21a
حداثة الصيانة
٢٣/٧/٢٠٢٦
الاستخدام
16 تنزيلات · 297 مشاهدات
بنية الملفات
📄 SKILL.md
تحسين مطالبات LLM للإنتاج
غالبًا ما تفشل مطالبات LLM لأن التعليمات والأمثلة ومعايير التقييم تكون غير واضحة. توفر هذه المهارة قوالب وسير عمل لتحسين المطالبات في Claude وCodex وClaude Code والأدوات المشابهة.
إدارة التطوير المعتمد على السياق
تفقد المشاريع المدعومة بالذكاء الاصطناعي اتساقها عندما تكون أهداف المنتج، وخيارات الحزمة التقنية، وقواعد سير العمل مبعثرة. ترشد هذه المهارة Claude وCodex وClaude Code عبر عناصر سياق Conductor.
بناء نماذج مالية للشركات الناشئة
تحتاج فرق الشركات الناشئة إلى توقعات واضحة قبل أن تتمكن من تخطيط التوظيف وجمع التمويل واستخدام النقد. تنظم هذه المهارة الإيرادات والتكاليف ومدى كفاية النقد والسيناريوهات في مخرجات عملية للتخطيط المالي.
تصميم لوحات مؤشرات أداء رئيسية تقود القرارات
غالبا ما تبني الفرق لوحات معلومات تعرض الكثير من الأرقام لكنها لا توجه إلى اتخاذ إجراء. تساعد هذه المهارة Claude وCodex وClaude Code على اختيار مؤشرات أداء رئيسية ذات معنى، وتنظيم طرق العرض، وعرض المقاييس بوضوح.
كتابة تقارير ما بعد الحوادث بلا لوم
غالبا ما تصبح مراجعات الحوادث غير متسقة، أو مركزة على اللوم، أو صعبة التنفيذ. تساعد هذه المهارة Claude وCodex وClaude Code على صياغة تقارير منظمة لما بعد الحوادث مع جداول زمنية واضحة، وأسباب جذرية، ومالكين محددين.
بناء قصص بيانات واضحة
غالبا ما تفشل المقاييس الخام في إقناع أصحاب المصلحة أو دعم القرارات. تساعد هذه المهارة Claude وCodex وClaude Code على تحويل التحليل إلى سرديات واضحة ومرئيات وتوصيات.
بناء أنظمة تقييم LLM موثوقة
بواسطة ChakshuGautam
يصعب جعل تقييم LLM متسقًا عبر الفرق والنماذج. تساعد هذه المهارة في تصميم مطالبات التحكيم، ومعايير التقييم، والمقاييس، وفحوصات التحيز لإجراء تقييمات قابلة للتكرار.
تقييم أنظمة الوكلاء باستخدام Rubrics
بواسطة muratcankoylan
تحتاج فرق الوكلاء إلى طرق قابلة للتكرار لقياس الجودة، والانحدارات، وتغييرات السياق. ترشد هذه المهارة تصميم rubrics، ومجموعات الاختبار، والتسجيل، والمراقبة.
Detect LLM Prompt Regressions with Promptfoo
بواسطة 7alexhale5-rgb
Prompt changes can silently reduce output quality. This skill builds golden datasets, runs Promptfoo evaluations, and summarizes failures and recent trends.
تصميم أوامر LLM أفضل
بواسطة alirezarezvani
غالبا ما تفشل جودة الأوامر لأن المتطلبات والأمثلة ومعايير التقييم تكون غير واضحة. تساعد هذه المهارة الفرق على تصميم أوامر الإنتاج واختبارها ومراجعتها من أجل Claude وCodex وClaude Code.
توحيد سير عمل تغييرات المتطلبات
بواسطة yunshu0909
غالبا ما تتوسع تغييرات المتطلبات خارج نطاقها المقصود وتخلق مخاطر انحدار غير واضحة. تمنح هذه المهارة Claude وCodex وClaude Code سير عمل محكوما بمراحل بوابات لتحديد النطاق، ومراجعة الأثر، والتحقق، وسجلات القرارات.
تشخيص تدهور السياق في وكلاء الذكاء الاصطناعي
بواسطة ChakshuGautam
يمكن للمحادثات الطويلة والمطالبات الكبيرة أن تجعل وكلاء الذكاء الاصطناعي يفقدون معلومات مهمة أو يتبعون سياقًا متعارضًا. تساعد هذه المهارة Claude وCodex وClaude Code على تحديد أنماط التدهور واختيار استراتيجيات التخفيف.