
معايير جودة الاختبار
أربعة محاور رئيسة يفحصها النظام لضمان أن يكون اختبارك جاهزاً للاعتماد.
الصدق (Validity)
أن يقيس الاختبار فعلياً ما أُعد لقياسه. صدق المحتوى يُقاس بمطابقة الأسئلة لجدول المواصفات (Content Validity Index).
الثبات (Reliability)
استقرار الدرجات عبر الزمن أو الأسئلة. يُقدَّر بـ KR-20 (للأسئلة الثنائية) أو ألفا كرونباخ. المقبول ≥ 0.70، الجيد ≥ 0.80.
التوازن المعرفي
شمولية الأسئلة لجميع الوحدات وتوازنها بين مستويات تصنيف بلوم (Anderson-Krathwohl): تذكر، فهم، تطبيق، تحليل، تقويم، ابتكار.
جودة الصياغة
الالتزام بمعايير Haladyna & Rodriguez لكتابة الاختيار من متعدد: وضوح الجذر، تجانس البدائل، تجنّب النفي، منع القرائن.
مؤشرات التحليل الإحصائي بعد التطبيق
يحسبها النظام محلياً في متصفحك (بدون رفع بيانات) في أداة التحليل الإحصائي البعدي.
نسبة الإجابات الصحيحة. المدى المثالي للتمييز الأقصى: حول 0.50.
طريقة كِيلي: الفرق بين نسبة نجاح الفئة العليا والدنيا (27٪ من كل طرف).
ارتباط الإجابة الصحيحة بالدرجة الكلية. أدقّ من D ويُعتبر المعيار الحديث.
اتساق داخلي للاختبار. ≥0.80 جيد، ≥0.90 ممتاز (اختبارات مصيرية).
نطاق ثقة درجة الطالب. درجة الطالب الحقيقية = الظاهرة ± SEM بثقة 68٪.
كل بديل خاطئ يجب أن يختاره ≥5٪ من الطلاب، ومن الفئة الدنيا أكثر.
- الاختبار الحالي يعتمد نظرية القياس الكلاسيكية (CTT). لا يقدم تحليلاً وفق نظرية استجابة المفردة (IRT).
- فحص الأداء التفاضلي للمفردات (DIF) لكشف التحيّز الفئوي غير متاح حالياً — نتائج "التوازن" و"العدالة" تعتمد على المراجعة النوعية للأسئلة وليس على تحليل إحصائي للتحيّز.
- ثبات المصححين (Cohen's κ / ICC) للأسئلة المقالية متاح عبر أداة السلّم المتدرّج (Rubric) عند تعدد المصححين.