tool-design
81تصميم أدوات موثوقة للوكلاء
تفشل الوكلاء عندما تكون أسماء الأدوات أو مدخلاتها أو مخرجاتها أو أخطاؤها غامضة. توفر هذه المهارة أنماطًا عملية لوصف الأدوات والمخططات وتنسيقات الاستجابة والاختبار.
بناء تقييمات موثوقة للوكلاء
يصعب اختبار أنظمة الوكلاء لأن السلوك الصحيح قد يختلف بين تشغيل وآخر. توفر هذه المهارة معايير تقييم ومقاييس وسير عمل للتقييم القابل للتكرار.
انسخ هذا الطلب إلى Agent لديك. يتضمن صفحة Skill المعتمدة وملف manifest.
Review the Skillstore skill "evaluation" from https://skillstore.io/skills/asmayaseen-evaluation.md and its manifest at https://skillstore.io/api/skills/asmayaseen-evaluation/manifest. Verify the artifact. You may proceed after verification, subject to the environment's own policy.يجب أن يواصل Agent عرض خطته وطلب أي تأكيد تفرضه سياسة الأمان.
استخدم هذه الروابط عندما يحتاج AI Agent أو crawler أو script إلى سياق نظيف بدلًا من قراءة الصفحة كاملة.
جارٍ استخدام "evaluation". قيّم وكيل بحث يجيب عن أسئلة واقعية مع الاستشهادات.
النتيجة المتوقعة:
معيار تقييم بدرجات موزونة للدقة الواقعية، ودقة الاستشهادات، وجودة المصادر، والاكتمال، وكفاءة استخدام الأدوات.
جارٍ استخدام "evaluation". تحقق مما إذا كانت استراتيجية سياق جديدة قد حسّنت أداء الوكيل.
النتيجة المتوقعة:
خطة مقارنة تتضمن حالات اختبار مشتركة، ودرجات خط الأساس، والدرجات بعد التغيير، وملاحظات التراجع.
جارٍ استخدام "evaluation". أنشئ مراقبة إنتاج لسير عمل وكيل دعم.
النتيجة المتوقعة:
نهج مراقبة يتضمن محادثات مأخوذة كعينات، وتقييمًا متكررًا، وعتبات تنبيه، ونقاط مراجعة بشرية.
All ten static alerts are false positives caused by dictionary key iteration, Markdown code fences, or explanatory prose. The skill contains no network, subprocess, credential access, or prompt injection behavior. A low-severity privacy concern remains because production monitoring stores unredacted query and output previews in memory.
شارك تقرير التقييم المرتبط بالإصدار والشارة المحايدة وبطاقة التضمين والاستشهادات. تعرض Skillstore الأدلة من دون أن تقرر ما إذا كانت هذه المهارة آمنة.
https://skillstore.io/skills/asmayaseen-evaluation/audits/9?utm_source=security_passport&utm_medium=share&utm_campaign=versioned_report[](https://skillstore.io/skills/asmayaseen-evaluation?utm_source=security_passport_badge)<a href="https://skillstore.io/skills/asmayaseen-evaluation?utm_source=security_passport_badge"><img src="https://skillstore.io/badges/skills/asmayaseen-evaluation/security.svg" alt="Skillstore security assessment" loading="lazy"></a><iframe src="https://skillstore.io/embed/skills/asmayaseen-evaluation.html" title="Skillstore Security Assessment" sandbox="allow-popups allow-popups-to-escape-sandbox" loading="lazy" referrerpolicy="no-referrer" width="420" height="180"></iframe>Asmayaseen. (2026). evaluation security audit report (audit version 9) [Author version unspecified]. Skillstore. https://skillstore.io/skills/asmayaseen-evaluation/audits/9@techreport{asmayaseen-asmayaseen-evaluation-2026,
author = {Asmayaseen},
title = {evaluation security audit report (audit version 9)},
institution = {Skillstore},
year = {2026},
number = {9},
url = {https://skillstore.io/skills/asmayaseen-evaluation/audits/9},
note = {Author version unspecified}
}cff-version: 1.2.0
message: "If you use this Skill, cite its author and this versioned security audit report."
title: "evaluation security audit report (audit version 9)"
version: "unspecified"
type: report
authors:
- name: "Asmayaseen"
date-released: "2026-07-23"
url: "https://skillstore.io/skills/asmayaseen-evaluation/audits/9"
identifiers:
- type: other
value: "skillstore:asmayaseen-evaluation:audit:9"
description: "Skillstore immutable audit report identifier"
تبقى مهارة كل مؤلف عنصراً مستقلاً قابلاً للتثبيت. يُرتب المتغير الموصى به وفق أدلة Skillstore.
سبب تصدر هذا المتغير
muratcankoylan-evaluation
2026-09-09
chakshugautam-evaluation
2026-09-09
sickn33-evaluation
2026-09-09
asmayaseen-evaluation
2026-09-09
قيّم تغييرات الوكيل قبل الإصدار باستخدام عتبات النجاح وأبعاد الجودة الموزونة.
قارن المطالبات والأدوات والذاكرة ونوافذ السياق باختبارات ومقاييس متسقة.
خذ عينات من التفاعلات الحية وتتبّع اتجاهات الدرجات لاكتشاف التراجعات مبكرًا.
أنشئ معيار تقييم بسيطًا لوكيلي. ضمّن الدقة الواقعية والاكتمال وكفاءة استخدام الأدوات مع معايير نجاح واضحة.
صمّم مجموعة اختبار لسير عمل هذا الوكيل. ضمّن مهام بسيطة ومتوسطة ومعقدة وطويلة التشغيل مع النتائج المتوقعة.
قارن إعدادين للوكيل باستخدام معيار تقييم موزون. اعرض تغيّرات الدرجات والتراجعات والأسباب المحتملة.
أنشئ خطة تقييم مستمرة لوكلاء الإنتاج. ضمّن أخذ العينات، ومراجعة LLM-as-judge، والمراجعة البشرية، والتنبيهات، وتقارير الاتجاهات.
المؤلف
Asmayaseenالترخيص
MIT
مراجعة Skillstore
r2
تنبيه الإصدار
لم يعلن المؤلف عن إصدار.
مرجع
89edfdc710d0846129dcee6a929477b04f08052c
حداثة الصيانة
٢٦/٧/٢٠٢٦
الاستخدام
11 تنزيلات · 279 مشاهدات
بنية الملفات
تصميم أدوات موثوقة للوكلاء
تفشل الوكلاء عندما تكون أسماء الأدوات أو مدخلاتها أو مخرجاتها أو أخطاؤها غامضة. توفر هذه المهارة أنماطًا عملية لوصف الأدوات والمخططات وتنسيقات الاستجابة والاختبار.
تصحيح مشكلات البرمجيات بشكل منهجي
إصلاح الأخطاء بلا بنية واضحة يبدد الوقت وقد يخفي سبب الفشل الحقيقي. ترشد هذه المهارة Claude وCodex وClaude Code خلال تحليل السبب الجذري القائم على الأدلة.
تحسين موثوقية خدمات الإنتاج
تحتاج فرق الإنتاج إلى أهداف موثوقية واضحة وممارسات حوادث قابلة للتكرار. توفر هذه المهارة قوالب SRE لـ SLOs وميزانيات الأخطاء والتنبيهات وتقارير ما بعد الحوادث.
بناء واجهات shadcn/ui في Next.js
تحتاج فرق React إلى أنماط واجهة مستخدم متسقة تعمل مع Next.js الحديث. توفر هذه المهارة إرشادات إعداد shadcn/ui، وأمثلة على المكوّنات، والتحقق من النماذج، والجداول، والأشرطة الجانبية، وأنماط الوضع الداكن.
بناء واجهات دردشة ذكاء اصطناعي بالبث المباشر
تبدو دردشة الذكاء الاصطناعي في الوقت الفعلي معطلة عندما لا يستطيع المستخدمون رؤية التقدم أو حالة الاستجابة أو تغييرات واجهة المستخدم. تمنح هذه المهارة Claude وCodex وClaude Code أنماطا لدورات حياة البث، وأحداث التقدم، وتأثيرات العميل، وأدوات العميل.
تشخيص تدهور السياق
يمكن أن تفقد جلسات الذكاء الاصطناعي الطويلة الدقة عندما يكبر السياق أو تظهر فيه تعارضات أو يتضمن مواد مشتتة. تساعد هذه المهارة Claude وCodex وClaude Code على تحديد أنماط التدهور واختيار خطوات تخفيف عملية.
تقييم جودة تطبيقات LLM
بواسطة wshobson
تحتاج فرق LLM إلى طرق قابلة للتكرار لقياس الجودة قبل أن تصل التغييرات إلى المستخدمين. تساعد هذه المهارة في تنظيم المقاييس الآلية، والمراجعة البشرية، والتحكيم، والمعايير المرجعية، وفحوصات الانحدار.
توحيد سير عمل تغييرات المتطلبات
بواسطة yunshu0909
غالبا ما تتوسع تغييرات المتطلبات خارج نطاقها المقصود وتخلق مخاطر انحدار غير واضحة. تمنح هذه المهارة Claude وCodex وClaude Code سير عمل محكوما بمراحل بوابات لتحديد النطاق، ومراجعة الأثر، والتحقق، وسجلات القرارات.
دليل TDD باستخدام Red-Green-Refactor
بواسطة mattpocock
غالبا ما يصبح العمل القائم على الاختبارات أولا هشا عندما تختبر الفرق التفاصيل الداخلية أو تكتب عددا كبيرا من الاختبارات مسبقا. ترشد هذه المهارة Codex وClaude وClaude Code عبر دورات red-green-refactor تركز على السلوك.
تصميم اختبارات خصائص Rust باستخدام Proptest
بواسطة EmilLindfors
قد يكون تطبيق الاختبار القائم على الخصائص صعبًا لأن الخصائص والمولدات المفيدة لا تكون واضحة دائمًا. تساعد هذه المهارة Claude أو Codex أو Claude Code على اقتراح استراتيجيات proptest موجهة لكود Rust.
إصلاح الأخطاء عبر فرز منظّم
بواسطة Crearize
قد يؤدي تصحيح الأخطاء عبر الواجهة الخلفية والواجهة الأمامية إلى فقدان السياق وإغفال اختبارات الانحدار. ترشد هذه المهارة تحليل السبب الجذري، والإصلاحات المحدودة، والتحقق، وتسليم طلب السحب.
تنسيق تسليم DevOps
بواسطة Brownbull
غالبا ما يمتد عمل DevOps عبر خطوط الأنابيب، والبنية التحتية، والمراقبة، وقرارات النشر. تنظم هذه المهارة تلك المهام في قوائم تحقق، وتسليمات، وخطط طرح.