ربط الدرجات Score Linking ومعادلة الاختبارات Test Equating هما مجموعة من الإجراءات التي تجعل نتائج اختبارات أو صور مختلفة قابلة للمقارنة على مقياس مشترك بدرجات متفاوتة من القوة. المشكلة تظهر كلما تغيرت صورة الاختبار أو بنوده أو سنة التطبيق أو الأداة المرجعية، بينما نريد أن تبقى الدرجة المبلغة ذات معنى متسق. لا يكفي أن يكون اختباران مرتبطين بقوة حتى تصبح درجاتهما قابلة للاستبدال؛ فالمعادلة الصارمة تتطلب تشابهًا في البناء والمواصفات والموثوقية وشروط الاستخدام، وتصميم بيانات يسمح بفصل فرق صعوبة الصورة عن اختلاف مجموعات المتقدمين. هذا الدليل يوضح متى نتحدث عن equating ومتى نكتفي بـlinking أو concordance، وكيف تُختار تصاميم جمع البيانات والمرساة والطريقة الإحصائية، وكيف نفحص الخطأ وثبات التحويل والعدالة قبل استخدام جدول تحويل في قرار حقيقي.
لماذا نحتاج ربط الدرجات؟
برامج الاختبارات المستمرة لا تستطيع استخدام البنود نفسها إلى الأبد بسبب أمن الاختبار والتحديث والمناهج وتغير المحتوى. عندما تُنشأ صورة جديدة قد تكون أصعب أو أسهل قليلًا رغم مواصفات البناء المتشابهة. إذا استخدمنا الدرجة الخام كما هي، فقد يحصل شخصان ذوا مستوى متقارب على نتائج مختلفة فقط لأن أحدهما أخذ صورة أصعب. وظيفة equating هي تعديل مقياس الدرجات بحيث تصبح نتائج الصور البديلة المتكافئة قابلة للاستخدام كما لو كانت على مقياس واحد، ضمن حدود التصميم والدليل. أما linking فيستخدم بصورة أوسع عندما تكون الاختبارات أو المقاييس ليست بدائل متكافئة تمامًا ولكن توجد حاجة إلى وصف علاقة منهجية بين درجاتها.
هذا الفرق مهم في الاختبارات عالية المخاطر. جدول تحويل يعطي انطباعًا بالدقة، لكن كل نقطة فيه تقدير إحصائي يعتمد على عينة وتصميم وافتراضات. خطأ صغير في equating يمكن أن يتحول إلى خطأ جماعي لأنه يطبق على جميع من أخذوا الصورة. لذلك تعتبر ETS المعادلة والربط من الأنشطة المرتبطة مباشرة بالعدالة والصدق، وتطلب توثيق تصميم جمع البيانات والإجراءات والنتائج وأخطاء المعادلة عندما تكون الدرجات مقصودة للمقارنة.
الفرق بين Equating وLinking وConcordance
المعادلة Equating
المعادلة هي أقوى ادعاء. تستخدم عادة بين صور بديلة للاختبار نفسه عندما تقيس البناء نفسه وفق مواصفات متقاربة، وتكون الدرجات بعد التحويل مقصودة لأن تكون قابلة للاستبدال في الاستخدام. من الشروط المفاهيمية الشائعة أن تكون الصور متشابهة في المحتوى والخصائص الإحصائية وأن تكون علاقة التحويل مستقرة بصورة معقولة عبر مجموعات المتقدمين. إذا تغير البناء أو مستوى الصعوبة المقصود أو نطاق المحتوى جذريًا، فإن تسمية العلاقة equating قد تكون أقوى مما يسمح به الدليل.
الربط Linking
Linking مصطلح أوسع لوضع درجات من أدوات أو صور مختلفة في علاقة مشتركة. قد يكون الهدف محاذاة مقياسين أو وصف كيف تتوافق درجة على أداة مع نطاق على أداة أخرى، من دون الادعاء أن الدرجتين متبادلتان. الربط قد يستخدم أساليب خطية أو مئينية أو IRT أو نماذج أخرى، لكن قوة الاستنتاج تعتمد على مقدار تشابه الاختبارات وتصميم البيانات. عندما تكون الاختبارات مختلفة في البناء أو الغرض، يجب إبقاء لغة التقرير متواضعة: «مرتبط» أو «محاذى» لا «معادل».
Concordance وCrosswalk
تستخدم كلمات مثل concordance أو crosswalk لوصف جداول توافق بين مقاييس ليست صورًا متبادلة للاختبار نفسه. يمكن أن تكون مفيدة للبحث أو التواصل أو الانتقال بين أنظمة، لكنها لا تجعل الأداتين متكافئتين في المحتوى أو الخطأ أو المعنى. إذا كان أحد المقياسين أكثر حساسية في طرف من الأطراف أو يقيس بعدًا إضافيًا، فقد تعطي الدرجة المحولة مظهرًا زائفًا من التكافؤ. لذلك ينبغي إظهار عدم اليقين ونطاق الاستخدام بدل نشر جدول أرقام بلا سياق.
هل الاختباران قابلان للمعادلة أصلًا؟
قبل الحساب يجب فحص equatability. اسأل هل الصورتان مبنيتان على مواصفات المحتوى نفسها؟ هل طول الاختبار ونوع البنود والوقت وطرق التصحيح متقاربة؟ هل تقيسان البناء نفسه وبمدى صعوبة مناسب للسكان أنفسهم؟ هل توجد فروق مقصودة تجعل إحدى الصورتين أداة مختلفة وظيفيًا؟ المعايير المهنية تشدد على أن الصور التي ستعامل درجاتها كمتبادلة يجب أن تكون متشابهة في المحتوى والخصائص ذات الصلة. المعادلة لا تصلح اختبارين غير متكافئين مفاهيميًا؛ هي تعالج فروق الصعوبة العرضية ضمن برنامج متسق.
فحص population invariance مهم كذلك. إذا كانت دالة التحويل مختلفة جذريًا بين مجموعات فرعية ذات صلة، فهذا قد يشير إلى أن الاختبارين لا يعملان كصورتين متبادلتين بنفس الطريقة. اقترح Dorans وHolland مقاييس لفحص مدى تغير دوال الربط بين السكان. لا يعني أي اختلاف صغير أن المعادلة فاشلة، لكن الاعتماد القوي على المجموعة يضعف ادعاء أن التحويل خاص بالاختبارين لا بالعينة المستخدمة فقط.
تصاميم جمع البيانات للمعادلة
Single-Group Design
في تصميم المجموعة الواحدة يأخذ الأشخاص أنفسهم الصورتين. هذا يوفر اتصالًا مباشرًا قويًا لأن اختلاف القدرة بين مجموعتين لا يربك المقارنة، لكنه قد يكون مكلفًا ويعاني من آثار الترتيب والتعب والتعلم. يمكن استخدام counterbalancing بتغيير ترتيب الصور بين أجزاء من العينة لتقليل أثر الترتيب. كما يجب التفكير في الزمن بين التطبيقين وما إذا كان البناء قد يتغير.
Equivalent-Groups Design
في تصميم المجموعات المتكافئة تُعطى كل صورة لمجموعة مختلفة يفترض أنها متكافئة في القدرة المستهدفة، ويفضل أن يتحقق ذلك بالتوزيع العشوائي أو تصميم قوي مشابه. إذا كان التكافؤ حقيقيًا فإن الفرق في توزيعات الدرجات يمكن نسبه بدرجة أكبر إلى الصور. لكن إذا كانت المجموعات تختلف فعليًا، فإن طريقة المعادلة قد تمزج فرق المجموعة بفرق الصورة. لهذا يجب توثيق كيفية إنشاء المجموعات واختبار معقولية افتراض التكافؤ.
NEAT: مجموعات غير متكافئة مع اختبار مرساة
تصميم Non-Equivalent Groups with Anchor Test أو NEAT شائع عندما تؤخذ الصور في أوقات مختلفة أو بواسطة مجموعات مختلفة لا يمكن افتراض تكافئها. كل مجموعة تأخذ الصورة الخاصة بها، ويوجد اختبار أو مجموعة بنود مشتركة تعمل كمرساة لقياس فرق القدرة بين المجموعتين. جودة المرساة حاسمة: يجب أن تمثل البناء والمحتوى بصورة مناسبة وأن ترتبط بكل صورة، وألا تكون قصيرة أو منحازة إلى جزء محدود من المجال. تصميم NEAT قوي عمليًا لكنه يعتمد على افتراضات أكثر من random groups، ولذلك يحتاج تشخيصًا وتحليل حساسية.
اختيار بنود المرساة Anchor Items
المرساة ليست أي مجموعة بنود مشتركة. ينبغي أن تكون ممثلة للمحتوى والمهارات المهمة في الاختبار، ذات خصائص إحصائية مناسبة، ومن دون تغير معروف في الصياغة أو العرض أو السياسة بين التطبيقين. إذا كانت المرساة أسهل بكثير أو أصعب من الاختبار، أو تركز على بعد واحد، فقد لا تقيس فرق المجموعتين في المجال المطلوب. ويجب فحص differential item functioning أو تغير أداء البنود عبر الزمن؛ بند مرساة يتغير معناه لا يعود مرساة مستقرة.
هناك أيضًا فرق بين internal anchor، حيث البنود المشتركة تدخل في الدرجة التشغيلية، وexternal anchor، حيث تكون مجموعة مستقلة لا تدخل في الدرجة. كل اختيار له آثار على التحفيز والأمن والعلاقة الإحصائية. التوثيق يجب أن يشرح عدد البنود وتغطيتها وخصائصها وعلاقتها بكل صورة، لا الاكتفاء بعبارة «استخدمنا anchor».
المعادلة الخطية Linear Equating
المعادلة الخطية تضبط الموقع والتشتت، بحيث تتطابق عادة المتوسطات والانحرافات المعيارية بعد التحويل وفق تصميم محدد. هي أبسط من equipercentile وتكون معقولة عندما تختلف توزيعات الدرجات أساسًا في المستوى والمقياس وتتشابه أشكالها. ميزتها أنها أكثر استقرارًا في العينات المتوسطة وسهلة الفهم، لكن إذا كانت فروق الشكل كبيرة أو العلاقة غير خطية فقد لا تزيل جميع الاختلافات المهمة بين الصور.
لا ينبغي تطبيق تحويل المتوسط والانحراف المعياري على مجموعتين غير متكافئتين بلا تصميم يعالج فرق القدرة؛ وإلا قد نساوي الاختبار بالمجموعة بدل الصورة بالصورة. في NEAT توجد طرق خطية مثل Tucker وLevine تعتمد على المرساة وافتراضات مختلفة. اختيار الطريقة يجب أن يتبع التصميم والخصائص الفعلية لا اسمًا مألوفًا في البرنامج.
المعادلة المئينية Equipercentile
في equipercentile equating تُربط الدرجة على صورة بالدرجة التي تقع عند الرتبة المئينية نفسها تقريبًا على الصورة الأخرى ضمن السكان المستهدفين. هذا يسمح بعلاقة غير خطية ويمكن أن يعالج اختلافات في شكل التوزيع لا تلتقطها المعادلة الخطية. لكنه أكثر حساسية لتقلبات العينات، خصوصًا عند الأطراف حيث البيانات قليلة. لذلك تستخدم smoothing أو presmoothing/postsmoothing في تطبيقات كثيرة لتقليل عدم الاستقرار من دون إخفاء بنية حقيقية.
المعادلة المئينية لا تعني أن الرتبة المئينية نفسها هي الدرجة المبلغة، ولا تعني أن الأشخاص يحتفظون بالترتيب نفسه فرديًا. إنها بناء لدالة تحويل توزيعية. يجب فحص monotonicity ومعقولية التحويل، ومقارنة النتائج بالخطية أو طرق أخرى، وفهم أين تكون الفروق بين الطرق أكبر من خطأ المعادلة المتوقع.
معادلة IRT وربط المقاييس
في Item Response Theory يمكن معايرة بنود من صور مختلفة ووضع معلماتها على مقياس كامن مشترك باستخدام بنود أو أشخاص مشتركين وتصميم مناسب. بسبب عدم تعريف أصل ووحدة مقياس θ بصورة مطلقة، تحتاج المعلمات إلى تحويل linking constants عند المعايرة المنفصلة أو إلى معايرة مشتركة. بعد ذلك يمكن اشتقاق تحويلات للدرجات الخام أو المبلغة. هذه المرونة مفيدة في بنوك البنود والاختبارات التكيفية، لكنها لا تعفي من فحص dimensionality وlocal dependence وDIF وملاءمة النموذج والمرساة.
طرق مثل mean/mean وmean/sigma وHaebara وStocking–Lord تختلف في معيار محاذاة معلمات أو منحنيات الاختبار. لا توجد طريقة واحدة أفضل دائمًا. إذا كانت بنود المرساة قليلة أو يظهر فيها DIF، يمكن أن تتغير ثوابت الربط. التقرير الجيد يذكر نموذج IRT، طريقة التقدير، تصميم المرساة، طريقة linking، فحوص الملاءمة، وأثر حذف بنود مرساة غير مستقرة.
الفرق بين Scaling وEquating
Scaling هو اختيار أو بناء مقياس للدرجات، مثل تحويل raw score إلى مقياس 200–800 أو متوسط 50 وانحراف 10. يمكن عمل scaling من دون أن توجد صورة أخرى تحتاج معادلة. Equating يهدف إلى ضبط فروق الصور بحيث تبقى الدرجة المبلغة قابلة للمقارنة عبرها. قد يحدث الاثنان في البرنامج نفسه: نُعادل أولًا أو ضمن عملية المعايرة ثم نحول إلى reporting scale. الخلط بينهما يؤدي إلى ادعاء أن مجرد ضرب الدرجة وإضافة ثابت يجعل صورتين متكافئتين.
الفرق بين Norming وEquating
Norming يصف أداء عينة مرجعية ويحوّل الدرجة إلى موقع بالنسبة إلى مجموعة، مثل رتبة مئينية أو درجة معيارية. أما equating فيقارن صور اختبار ليجعل درجاتها قابلة للمقارنة. قد يتغير norm مع تغير السكان حتى لو بقيت الصورة نفسها، بينما يجب أن تستهدف المعادلة علاقة بين الصور لا اعتمادًا غير ضروري على مجموعة فرعية. لذلك يجب تحديث المعايير المرجعية عندما تصبح قديمة، لكن تحديث norms ليس بديلًا لمعادلة صورة اختبار جديدة.
خطأ المعادلة وعدم اليقين
دالة equating مقدرة من عينة، ولذلك لها Sampling Error of Equating. يمكن تقدير standard error of equating أو استخدام bootstrap وغيره حسب الطريقة والتصميم. المهم ألا يظهر جدول التحويل كأنه دقيق إلى ما لا نهاية. إذا كان الفرق بين طريقتين أو صورتين عند درجة معينة صغيرًا مقارنة بخطأ المعادلة، فإن تفسير الفرق يحتاج تحفظًا. الأطراف غالبًا أقل استقرارًا بسبب قلة الملاحظات، وقد تحتاج تجميعًا أو سياسات reporting تحد من الدقة الزائفة.
هناك أيضًا خطأ منهجي لا يظهر كاملًا في standard error، مثل مرساة غير ممثلة أو تغير البناء أو انتهاك تكافؤ المجموعات. لهذا تقييم equating لا يقتصر على رقم SE؛ يشمل مقارنة الطرق، تشخيص المرساة، population invariance، فحص بقايا التحويل، وإعادة التحقق عبر دورات اختبار متعددة.
فحص استقرار المعادلة عبر المجموعات
إذا كان التحويل سيطبق على مجموعات متنوعة، من المفيد فحص ما إذا كانت دالة الربط أو المعادلة مستقرة نسبيًا عبر مجموعات فرعية مهمة. اختلاف كبير قد يرتبط بفروق في التكوين أو DIF أو عدم تكافؤ الصور. لا ينبغي أن يتحول subgroup analysis إلى تعدين نتائج؛ يُفضل تحديد المجموعات المهمة مسبقًا، واستخدام مقاييس أثر لا قيم دلالة فقط، والنظر إلى ما إذا كان الاختلاف يغير الدرجات المبلغة أو القرارات عمليًا.
التغير عبر الزمن وScale Drift
في برامج طويلة العمر قد يحدث scale drift عندما تتراكم روابط متسلسلة عبر سنوات أو تتغير خصائص السكان والبنود. الحفاظ على المقياس يتطلب مراقبة المرساة والمواصفات والتغيرات في المحتوى وإجراءات المعايرة، وأحيانًا إعادة anchoring أو دراسات تحقق خارج السلسلة. ليس الهدف منع أي تغير في الدرجات؛ الهدف التأكد أن التغير المبلّغ يعكس تغير الأداء المقصود لا انجراف المقياس نفسه.
مثال عملي: صورتان لاختبار قبول
لنفترض أن صورة A طُبقت في الربيع وصورة B في الخريف، ولا يمكن افتراض أن مجموعتي المتقدمين متكافئتان. تحتوي الصورتان على 20 بند مرساة ضمن اختبار من 80 بندًا. قبل equating نفحص أن المرساة تغطي مجالات المحتوى بنسب مناسبة، وأن بنودها لم تتسرب أو تتغير، وأن علاقتها بالدرجة الكلية متقاربة، ثم نفحص DIF. بعد ذلك يمكن استخدام NEAT مع طريقة خطية أو equipercentile أو IRT مناسبة، مع مقارنة النتائج وفحص SE.
إذا ظهر أن مجموعة الخريف أقوى على المرساة، فلا يجوز تفسير متوسط B الأعلى كله على أنه صورة أسهل. تصميم NEAT يستخدم المرساة لتقدير فرق المجموعة قبل تعديل فرق الصورة. وإذا أعطت طرق متعددة تحويلات متقاربة في وسط المقياس لكنها مختلفة عند الطرف الأعلى، يجب فحص حجم البيانات والمرساة وعدم اليقين هناك، وربما تقييد تفسير الدرجات القصوى بدل اختيار الطريقة التي تعطي التحويل المرغوب.
متى لا ينبغي إجراء Equating؟
إذا تغير البناء أو المواصفات بحيث أصبحت الصورة الجديدة تقيس مهارات إضافية، أو تغير وقت الاختبار بصورة جوهرية، أو أصبحت طريقة الاستجابة مختلفة وتؤثر في العمليات المعرفية، فقد لا تكون المعادلة الصارمة مبررة. كذلك لا ينبغي equate اختبار قصير للفحص مع اختبار تشخيصي شامل لمجرد أن الدرجات مترابطة. يمكن أحيانًا بناء linking أو concordance لأغراض محدودة، مع توضيح أن الدرجات ليست متبادلة.
كما أن ضعف التصميم لا يُصلح بطريقة إحصائية معقدة. إذا لا توجد مجموعة مشتركة ولا مرساة مناسبة وكانت المجموعات غير متكافئة، فإن أي تحويل يعتمد على افتراضات قوية قد لا يدعم قرارات عالية المخاطر. دراسة ETS عام 2021 أوضحت أن عدم تكافؤ المجموعات وضعف الربط يمكن أن يخلق انحيازًا، وأن استخدام مرساة أو تعديلات للمجموعة قد يحسن الدقة في بعض الظروف؛ لكنها ليست رخصة لتعويض غياب التصميم الجيد.
المعادلة والعدالة
المعادلة جزء من عدالة برنامج الاختبار لأن الدرجة نفسها يجب ألا تتغير بسبب صورة أصعب فقط. لكن العدالة أوسع: يجب أن تكون الصور متكافئة في المحتوى وإتاحة الوصول، وأن تعمل بنود المرساة بصورة مناسبة عبر المجموعات، وأن لا يؤدي smoothing أو حذف بنود إلى إخفاء فرق منهجي. إذا استُخدم equating في قرار ترخيص أو قبول، يجب توثيق عملية المراجعة والموافقات والإصدارات وإمكان إعادة إنتاج التحويل.
كيف نبني دراسة Equating قوية؟
قبل التطبيق
حدد أولًا لماذا يجب أن تكون الدرجات متبادلة، وراجع مواصفات الصورتين وبناءهما وطولهما ووقت التطبيق. اختر تصميم البيانات قبل جمعها: same group أو equivalent groups أو NEAT. إذا استخدمت مرساة فصممها لتمثل المحتوى لا لتكون مجرد بنود متاحة. حدد مسبقًا طرق equating الأساسية والتحليلات الحساسة ومقاييس الخطأ وتشخيصات subgroup.
أثناء التحليل
افحص جودة البيانات والتوزيعات والمفقود والسرعة، ثم افحص المرساة وتكافؤ المجموعات. طبّق الطريقة الملائمة للتصميم، وقارن على الأقل طريقة بديلة معقولة عندما يكون القرار مهمًا. افحص monotonicity، الفروق بين التحويلات، standard error، population invariance، وأثر استبعاد بنود مرساة غير مستقرة. إذا كانت IRT جزءًا من العملية فافحص fit وDIF وثبات ثوابت linking.
عند الإبلاغ
وثّق الصور والمواصفات والعينات والتواريخ، تصميم جمع البيانات، المرساة، الطريقة الرياضية، smoothing، البرامج والإصدارات، نتائج التشخيص، standard errors، وأي قواعد للتقريب أو تحويل raw-to-scale. احتفظ بنسخة versioned من جدول التحويل وتاريخ تفعيله. لا تستبدل التقرير بجدول conversion فقط؛ القارئ يحتاج معرفة لماذا يمكنه الوثوق بأن 72 على صورة A لها معنى مماثل للدرجة المقابلة على B.
أخطاء شائعة
من الأخطاء استخدام correlation مرتفع كدليل على equating، الخلط بين scaling والمعادلة، استخدام مجموعتين مختلفتين وكأنهما متكافئتان، اختيار مرساة قصيرة غير ممثلة، وعدم فحص DIF أو تغير البنود. ومن الأخطاء أيضًا اختيار equipercentile لأنها تبدو أكثر تقدمًا رغم عينة صغيرة، أو استخدام IRT من دون فحص البعدية والملاءمة، أو نشر جدول تحويل من دون standard error أو توثيق الإصدار.
خطأ مؤسسي آخر هو chaining غير المراقب عبر سنوات: A رُبطت بـB، ثم B بـC، ثم C بـD، مع افتراض أن أي انحراف صغير لا يتراكم. يجب مراقبة scale drift وإجراء check forms أو روابط مستقلة عند الإمكان. كما ينبغي فصل القرارات السياسية عن التحويل الإحصائي؛ تغيير cut score بعد equating موضوع مختلف عن equating نفسها.
كيف يقيّم القارئ دراسة ربط أو معادلة؟
اسأل: هل الادعاء equating مبرر أم أن linking أدق؟ هل الاختبارات تقيس البناء نفسه ومواصفاتها متقاربة؟ ما تصميم البيانات؟ إذا كانت المجموعات غير متكافئة، ما المرساة وكيف ثبتت جودتها؟ ما الطريقة ولماذا اختيرت؟ هل توجد أخطاء معادلة وفحوص استقرار عبر المجموعات؟ هل كانت التحويلات مستقرة عبر طرق بديلة؟ وهل وثق البرنامج الإصدارات بحيث يمكن إعادة بناء الدرجة المبلغة؟ إذا غابت هذه المعلومات، لا ينبغي التعامل مع جدول التحويل كحقيقة ثابتة.
العلاقة مع IRT وCTT وStandard Setting
CTT تساعد على فهم خطأ الدرجة وثبات الصور، وIRT توفر نماذج على مستوى البند وربط المقاييس الكامنة، بينما equating هي مهمة مقارنة الصور والدرجات. Standard setting يأتي بعد ذلك عندما نختار نقطة أو نقاطًا على المقياس لتقسيم الأداء إلى مستويات. المعادلة تسأل «كيف نحافظ على معنى المقياس عبر الصور؟»، أما وضع المعايير فيسأل «أين ينبغي أن نضع حد القرار على هذا المقياس؟». خلط السؤالين قد يؤدي إلى تعديل التحويل لتحقيق معدل نجاح مرغوب، وهو عكس الاستقلال المنهجي المطلوب.
أسئلة شائعة
أسئلة شائعة
ما الفرق بين linking وequating؟
Equating ادعاء أقوى يهدف إلى جعل درجات صور بديلة متكافئة قابلة للاستبدال، بينما linking أوسع ويصف علاقة بين مقاييس قد لا تكون متبادلة بالكامل.
هل الارتباط العالي بين اختبارين يكفي لمعادلة درجاتهما؟
لا. الارتباط يقيس الترتيب المشترك ولا يثبت تطابق البناء أو المقياس أو صعوبة الصور أو قابلية الاستبدال.
ما هو تصميم NEAT؟
هو تصميم لمجموعات غير متكافئة تستخدم صورة مختلفة مع وجود اختبار أو بنود مرساة مشتركة تساعد على فصل فرق المجموعة عن فرق الصورة.
ما الفرق بين المعادلة الخطية والمئينية؟
الخطية تضبط أساسًا المتوسط والتشتت بعلاقة خطية، بينما equipercentile تسمح بعلاقة غير خطية تربط درجات ذات مواقع مئينية متقاربة في التوزيع.
هل IRT تلغي الحاجة إلى تصميم معادلة جيد؟
لا. IRT توفر أدوات قوية للمعايرة والربط، لكنها تحتاج اتصالًا بين الصور وافتراضات ملائمة ومرساة مستقرة وفحص البعدية وDIF.
ما هو Standard Error of Equating؟
هو مقياس لعدم اليقين الناتج عن تقدير دالة المعادلة من عينة، ويبين أن تحويل الدرجات نفسه له خطأ معاينة وليس جدولًا خاليًا من عدم اليقين.
هل يمكن معادلة اختبارين يقيسان أشياء مختلفة؟
ليس بمعنى equating الصارم. قد يكون linking أو concordance ممكنًا لغرض محدود، لكن يجب عدم تقديم الدرجات كبدائل متكافئة.
ما الفرق بين equating وstandard setting؟
Equating يحافظ على قابلية مقارنة المقياس عبر صور الاختبار، بينما standard setting يحدد نقاط القطع أو مستويات الأداء على المقياس وفق حجة قرار مستقلة.
الخلاصة
ربط الدرجات ومعادلة الاختبارات ليستا عملية تحويل أرقام فقط. البداية هي تحديد قوة الادعاء: equating عندما تكون الصور بدائل متكافئة ومقصودًا استخدام درجاتها بالتبادل، وlinking أو concordance عندما تكون العلاقة أضعف. بعد ذلك يأتي تصميم البيانات—مجموعة واحدة، مجموعات متكافئة، أو NEAT—وجودة المرساة، ثم اختيار الطريقة الخطية أو المئينية أو IRT وفحص خطأ المعادلة واستقرارها عبر المجموعات والزمن. أعلى جودة تتحقق عندما تكون العملية قابلة للتتبع والإعادة، مرتبطة بمواصفات الاختبار والصدق والعدالة، ومنفصلة بوضوح عن قرار وضع cut scores. بهذه الشروط يصبح المقياس المشترك بنية قياس يمكن الدفاع عنها، لا جدول تحويل يبدو دقيقًا أكثر مما تسمح به البيانات.