تحليل البنود Item Analysis هو فحص أداء كل بند بعد التجريب أو التشغيل بهدف معرفة كيف ساهم في القياس، لا مجرد ترتيب البنود إلى «جيدة» و«سيئة». في الاختبارات الثنائية ننظر عادة إلى نسبة الإجابة الصحيحة، الارتباط بدرجة معيار مناسبة، سلوك المشتتات، وأنماط الأداء حسب مستوى القدرة والمجموعات. وفي البنود متعددة الفئات نحتاج توزيع الفئات وعتباتها وارتباطها بالبناء. المؤشرات تعتمد على العينة والبناء وشكل الاختبار؛ لذلك لا يجوز تطبيق حدود رقمية آلية وحذف كل بند يخالفها. الصفحة تشرح صعوبة البند والتمييز والـpoint-biserial والمشتتات والسرعة والبنود متعددة الفئات والاستقرار وDIF، وتضع سير عمل يربط الإحصاء بالـblueprint والمراجعة النوعية وأمن البنك.

ما الذي يجيب عنه Item Analysis؟

التحليل يحاول الإجابة عن أسئلة متعددة: هل البند سهل أو صعب بالنسبة إلى هذه العينة؟ هل الذين يحصلون على أداء أعلى في البناء يميلون إلى النجاح في البند أكثر؟ هل المشتتات تجذب من لديهم معرفة أقل بالطريقة المتوقعة؟ هل فئة استجابة معينة لا تستخدم؟ هل يوجد أثر سرعة أو موضع؟ هل يعمل البند بطريقة مختلفة في مجموعات متقاربة في القدرة؟ وهل تتكرر النتائج في عينة أو صورة أخرى؟ هذه الأسئلة لا تختزل في معامل واحد. بند قد يكون شديد السهولة لكنه ضروري لتغطية محتوى أساسي، أو تمييزه منخفضًا لأنه عند أقصى المقياس، أو المشتتات ضعيفة لأن المهمة تستهدف mastery. القرار يحتاج الغرض والـblueprint والسكان.

التحليل وصفي ونموذجي في آن واحد

بعض المؤشرات بسيطة مثل proportion correct وتوزيع الخيارات، وبعضها يعتمد على معيار أو نموذج مثل point-biserial أو منحنيات الاستجابة أو IRT. المؤشر الوصفي يصف ما حدث في عينة محددة، بينما النموذج يحاول تلخيص علاقة يمكن تعميمها تحت افتراضات. يجب أن يحتفظ التقرير بهذه الحدود؛ لا نسمي p-value «الصعوبة الحقيقية للبند» ولا معامل تمييز واحدًا خاصية ثابتة في كل السكان. اختلاف العينة والمنهج واللغة والتوقيت قد يغير الإحصاءات حتى لو بقي نص البند نفسه.

صعوبة البند في الاختبار الثنائي

في Classical Test Theory تعبر p-value للبند عادة عن نسبة المفحوصين الذين أجابوا إجابة صحيحة. قيمة مرتفعة تعني أن البند كان أسهل في تلك العينة، وهي عكس اتجاه معلمة الصعوبة الشائع في IRT حيث القيمة الأعلى قد تشير إلى حاجة إلى قدرة أكبر. هذا الاختلاف الاصطلاحي يجب أن يذكر لتجنب قراءة خاطئة. لا توجد p مثالية لجميع الاختبارات؛ الاختبار الذي يريد دقة حول cut score قد يحتاج توزيعًا من البنود موجهًا إلى المنطقة، والاختبار التشخيصي التعليمي قد يحتاج بنودًا سهلة تكشف المهارات الأولية. الـblueprint والغرض يحددان الهدف.

الصعوبة خاصية عينة في CTT

إذا تغيرت قدرة العينة، يتغير proportion correct. بند يحله 90% من مجموعة متقدمة قد يحله 50% من مجموعة أخرى. لذلك عند مقارنة الإحصاءات عبر إدارات يجب فحص هل السكان متشابهون أو استخدام نماذج أو ربط يسمح بفصل تغير العينة عن البند. هذه الحساسية لا تجعل CTT عديم الفائدة؛ هي جزء من معنى المؤشر. التقرير الجيد يسجل العينة وحجمها وإدارة الاختبار ولا ينقل قيمة p من دليل قديم إلى سياق جديد كأنها ثابتة.

تمييز البند: ما الذي نريد تمييزه؟

Item discrimination يقيس مدى اختلاف أداء البند باختلاف مستوى معيار ذي صلة، غالبًا الدرجة الكلية أو درجة المجال. بند إيجابي التمييز يميل من لديهم أداء أعلى إلى النجاح فيه أكثر من ذوي الأداء الأقل. لكن يجب أن يكون معيار المقارنة نفسه صالحًا: إذا كان الاختبار متعدد الأبعاد وقد ربطنا البند بدرجة كلية غير مناسبة فقد يظهر تمييز منخفض رغم أن البند جيد لمجاله. كما يمكن أن يؤدي إدراج البند نفسه داخل الدرجة الكلية إلى تضخيم بسيط للارتباط، لذلك يستخدم corrected item-total correlation في بعض السياقات.

Point-biserial والارتباط المصحح

الـpoint-biserial هو ارتباط بين بند ثنائي ودرجة مستمرة، ويستخدم كثيرًا لتقييم تمييز البنود. يتأثر بانتشار صعوبة البند وبجودة الدرجة المرجعية. قيمة سالبة تستدعي مراجعة عاجلة لأنها قد تشير إلى مفتاح خاطئ أو صياغة مضللة أو بعد مختلف أو مشكلة بيانات، لكنها لا تثبت سببًا بعينه. قيمة منخفضة ليست دائمًا سبب حذف؛ بند شديد السهولة أو الصعوبة قد يملك نطاقًا محدودًا للارتباط. يجب فحص الرسم، المجموعات، المحتوى، والمفتاح قبل القرار.

Upper–Lower Index وحدوده

طريقة أخرى تقارن نسبة النجاح في مجموعة عالية الأداء بمجموعة منخفضة الأداء. هي سهلة الشرح لكنها تهدر معلومات عند تجاهل الأفراد في الوسط، وتتأثر باختيار نسبة المجموعتين. يمكن استخدامها كفحص أولي أو تعليمي، بينما في البرامج الكبيرة يفضل الاستفادة من كامل التوزيع عبر الارتباط أو منحنيات الاستجابة والنماذج. إذا استخدمت، يجب توثيق تعريف upper/lower groups وعدم مقارنة قيم جاءت من قواعد تقسيم مختلفة.

المشتتات ليست ديكورًا

في أسئلة الاختيار المتعدد، distractor الجيد يمثل استجابة معقولة لمن لم يتقن المعرفة أو العملية المستهدفة من دون أن يكون غامضًا أو خادعًا. تحليل المشتتات ينظر إلى نسبة اختيار كل بديل وعلاقته بمستوى الأداء. مشتت لا يختاره أحد قد يكون غير وظيفي، ومشتت يختاره أصحاب الدرجات الأعلى أكثر من المفتاح قد يكشف مشكلة مفتاح أو غموضًا أو معرفة غير متوقعة. لكن لا توجد نسبة سحرية تجعل المشتت صالحًا؛ بعض الموضوعات تملك بدائل طبيعية قوية وبعضها لا. المراجعة النوعية ضرورية بعد الإشارة الإحصائية.

منحنيات استجابة الخيارات

Livingston وDorans عرضا نهجًا رسوميًا يقدر منحنى اختيار كل option عبر معيار مثل الدرجة الكلية. هذه الرسوم تكشف أين يصبح المفتاح أكثر شيوعًا وكيف تتغير جاذبية المشتتات مع القدرة، وقد تكون أكثر غنى من متوسط واحد. يمكن إنتاج رسوم مشابهة بطرق smoothing حديثة، مع فواصل عدم يقين عندما تسمح العينة. الهدف ليس تجميل التقرير، بل رؤية أنماط مثل مشتت يجذب ذوي القدرة المتوسطة فقط أو مفتاح لا يصبح مهيمنًا عند المستويات العليا.

البنود متعددة الفئات

في Likert أو partial-credit item لا يكفي proportion correct. نفحص استخدام كل فئة، المتوسط والتباين، item-total relation، واتساق ترتيب الفئات مع البناء. فئة نادرًا ما تستخدم قد تكون غير مميزة أو تحتاج عينة أكبر، وعتبات غير مرتبة في IRT قد تشير إلى أن الفئات لا تعمل كما توقع المصمم، لكن قرار دمجها يحتاج تفسيرًا للمحتوى. في مقاييس الاتجاه أو الصحة النفسية لا ينبغي تعديل فئات استجابة أداة محمية من دون صلاحية وحقوق وإعادة تحقق، لأن تغيير الخيارات يخلق نسخة جديدة عمليًا.

Item-total correlation لا يثبت أحادية البعد

ارتباطات البنود بالدرجة الكلية قد تبدو جيدة في مقياس متعدد الأبعاد، كما يمكن أن تكون بعض البنود ذات ارتباط متوسط لكنها تمثل محتوى ضروريًا. إثبات البنية يحتاج factor analysis أو IRT أو نماذج أخرى بحسب البيانات. لذلك لا نستخدم item-total correlation بوصفه اختبارًا مختصرًا للصدق البنائي. دوره تحديد بنود تحتاج مراجعة ضمن نموذج أوسع؛ وهو أقرب إلى فحص اتساق داخلي وعلاقة بالدرجة المستخدمة لا إلى حجة validity كاملة.

أثر حذف البند في الثبات

تقدم بعض البرامج «alpha if item deleted»، وقد يغري الفريق بحذف أي بند يرفع alpha. هذا يمكن أن يضيق البناء ويزيد تجانسًا شكليًا على حساب المحتوى. معامل alpha يتأثر بطول الاختبار وتشابه البنود ولا يحدد وحده قيمة البند. قبل الحذف يجب النظر إلى blueprint والصدق والمجال والصعوبة ووقت التطبيق وتأثير القرار. أحيانًا يكون بند متنوع المحتوى مهمًا رغم أنه يخفض alpha قليلًا؛ الهدف ليس تعظيم معامل واحد بل بناء قياس يدعم التفسير المقصود.

المفتاح الخاطئ والبيانات الشاذة

من أكثر أسباب التمييز السلبي قابلية للإصلاح خطأ key أو coding. لذلك يبدأ التحقيق بفحص مفتاح الإجابة، اتجاه الترميز في البنود العكسية، التحويلات، missing values، ونسخة النموذج. يجب التأكد أن response option IDs لم تتغير في الواجهة وأن scoring service يستخدم نفس version. في البنود المفتوحة نفحص rubric وتوزيع المصححين. قبل تفسير أي نمط نفسي أو تعليمي، نستبعد الخلل التقني؛ خطأ تسجيل واحد قد يجعل بندًا سليمًا يبدو معيبًا.

السرعة وموضع البند

إذا كان اختبار غير مقصود لقياس السرعة، البنود المتأخرة قد تحصل على نسبة omits أعلى وتمييز مختلف بسبب نفاد الوقت. لذلك يجب تحليل nonresponse ووقت الاستجابة حسب position، وربما مقارنة forms ذات ترتيب مختلف. Rapid guessing في الاختبارات الرقمية يمكن أن يخفض العلاقات ويشوه p-values. لا ينبغي حذف جميع الاستجابات السريعة بعتبة موحدة من دون دراسة؛ زمن الاستجابة يختلف حسب البند والقدرة والجهاز. الأفضل وجود قواعد جودة مدروسة وتحليل حساسية.

Omitted وNot Reached ليسا الشيء نفسه

Omitted item قد يعني أن المفحوص وصل إلى السؤال ولم يستجب، بينما Not Reached يشير إلى أن الاختبار انتهى قبل الوصول. دمجهما في فئة missing واحدة يخفي speededness. يجب أن يحفظ النظام أحداث التصفح إذا كان ذلك متاحًا وملتزمًا بالخصوصية، أو يستخدم تعريفًا تشغيليًا من ترتيب الاستجابات. قواعد التسجيل—هل يحسب كلاهما صفرًا؟—يجب أن تتبع مواصفات الاختبار، بينما التحليل التشخيصي للجودة يمكن أن يحتفظ بالتمييز حتى لو كان scoring واحدًا.

البنود المرتبطة محليًا وTestlets

عندما تشترك عدة بنود في نص أو سيناريو أو رسم، قد تكون الاستجابات مترابطة فوق ما يفسره البناء. هذا local dependence يمكن أن يؤثر في item-total والـreliability وIRT information. لا يعني أن testlets خطأ؛ هي أحيانًا ضرورية لقياس قراءة أو مهام أصيلة. لكن التحليل يجب أن يحترم الوحدة المشتركة ويستخدم نموذجًا أو تصميمًا مناسبًا، وألا يفسر كل بند كدليل مستقل تمامًا. كما يجب فحص ما إذا كان stimulus مشترك يخلق عائق لغة أو ثقافة يرفع DIF لعدة بنود معًا.

الإنصاف وDIF بعد Item Analysis

فرق p-value بين مجموعتين لا يساوي DIF لأن المجموعتين قد تختلفان في القدرة الكلية. تحليل الإنصاف يحتاج مقارنة مشروطة بعد المطابقة أو نماذج متعددة المجموعات. لذلك يمكن أن يبدأ item analysis بجداول subgroup لاكتشاف مناطق تحتاج فحصًا، لكن الحكم ينتقل إلى DIF وmeasurement invariance والمراجعة النوعية. صفحة DIF في روافد تشرح MH والانحدار وIRT. هذه الحدود تمنع تسمية أي gap في بند «تحيزًا» من دون ضبط مستوى البناء.

افحص المجموعات الصغيرة دون مبالغة

مؤشرات البنود في subgroup صغير قد تكون شديدة التقلب. يجب عرض n وفواصل عدم يقين أو حجب المؤشرات إذا كانت غير مستقرة، بدل نشر ترتيب بنود يضع وصمًا على مجموعة من بضعة أفراد. يمكن تجميع إدارات متكافئة وفق خطة إذا كان ذلك مبررًا، لكن لا ندمج سنوات تغير فيها المنهج أو النموذج بلا فحص. الإنصاف يتطلب معلومات كافية ويشمل الاعتراف بعدم كفاية البيانات.

Pretest مقابل Operational Items

البنود التجريبية تسمح بفحص الإحصاءات قبل احتسابها في الدرجة، بينما البنود التشغيلية تحتاج مراقبة مستمرة لأنها قد تنجرف بمرور الزمن أو تتعرض أو يتغير المنهج. قواعد قبول pretest يجب أن تُحدد قبل النظر إلى النتائج قدر الإمكان وتشمل محتوى وسيكومتريا وDIF وأمنًا، لا حدودًا إحصائية فقط. إذا عُدّل نص بند بعد التجريب، لا ينبغي الاحتفاظ بإحصاءاته كأنها تخص النسخة الجديدة من دون مبرر؛ يجب حفظ item version وربما إعادة التجريب.

العينة وحجمها في تحليل البنود

لا يوجد حجم واحد يكفي لكل item statistic. proportion correct قد يثبت نسبيًا أسرع من تقدير منحنى متعدد المعلمات أو subgroup DIF. يجب النظر إلى عدد الاستجابات الصالحة لكل بند، توزيع القدرة، عدد الخيارات، واستخدام النتيجة. مع adaptive testing قد لا يرى كل شخص كل بند، فتختلف n والتعرض وتحتاج طرق IRT أو sampling-aware. يجب أن يظهر التقرير عدد الحالات وفاصل عدم اليقين للمؤشرات الحساسة، وألا يتساوى وزن بند مجرب على 80 شخصًا مع بند رآه 8000.

لا تستخدم Cutoffs جامدة بلا سياق

تنتشر قواعد مثل «p بين 0.3 و0.8» أو «point-biserial أكبر من 0.2». يمكن أن تكون heuristics أولية في سياقات معينة، لكنها ليست معايير مهنية عالمية. بند mastery قد يكون أسهل عمدًا، وبند عند extreme قد يملك تمييزًا محدودًا، واختبار high-stakes قد يحتاج متطلبات مختلفة. الأفضل تحديد flags لا automatic fails، ثم جمع الأدلة. إذا استخدم البرنامج حدودًا تشغيلية فيجب أن يبررها بدراسات خاصة به ويراجع آثارها على المحتوى والإنصاف.

قرار البند: احتفظ، راقب، عدل، أعد التجريب، اسحب

المخرجات الأفضل ليست حذف/إبقاء فقط. يمكن تصنيف القرار إلى retain، monitor، revise-and-pretest، retire، أو investigate. كل قرار يحمل سببًا: مفتاح، distractor، content gap، low discrimination، DIF، speededness، exposure، أو redundancy. إذا عُدل البند، ينشأ version جديد مع سجل الفرق. وإذا سحب، يبقى التاريخ التقني محفوظًا داخليًا لعدم إعادة المشكلة. هذه الحوكمة تجعل item analysis جزءًا من دورة حياة البنك لا ملف CSV يختفي بعد الاجتماع.

اجتماع المراجعة متعدد التخصصات

القرار يحتاج psychometrician وخبير محتوى وممثل accessibility/لغة عند الحاجة ومالك الاختبار. الإحصائي يشرح النمط وعدم اليقين، خبير المحتوى يحدد أهمية البند والسبب المحتمل، ومراجع الإنصاف يفحص الحواجز. يجب ألا يرى الفريق المؤشر منفصلًا عن نص البند في البيئة الآمنة، ولا ينشر النص في التقرير العام. يمكن توثيق rationale بدون نسخ المادة: «مشتت غير وظيفي»، «مفتاح راجعته اللجنة»، «DIF يتطلب إعادة تكييف».

مثال اصطناعي لبند ثنائي

لنفترض بندًا أصليًا في اختبار رياضيات تجريبي: proportion correct 0.62 وcorrected point-biserial 0.31. المفتاح يزداد اختياره مع الدرجة، ومشتتان ينخفضان، بينما مشتت رابع لا يختاره تقريبًا أحد. لا نقول إن البند «ممتاز» من رقمين فقط. نراجع أهمية المحتوى واللغة ثم نقرر ربما تحسين المشتت غير الوظيفي قبل التجريب التالي. إذا أدى التعديل إلى تغيير بنية الخيارات، نعتبره إصدارًا جديدًا ونقارن الأداء بدل ضم البيانات القديمة تلقائيًا.

مثال اصطناعي على تمييز سلبي

في بند افتراضي يظهر point-biserial −0.12. أول فحص يكشف أن scoring key في قاعدة البيانات يشير إلى الخيار C بينما وثيقة الخبراء تعتمد B. بعد تصحيح النظام وإعادة الحساب يصبح الارتباط موجبًا. هذا المثال يوضح لماذا لا نبدأ بتفسير نفسي أو حذف البند. لو كان المفتاح صحيحًا، ننتقل إلى غموض الصياغة، multiple correct interpretations، multidimensionality، exposure، أو اختلاف subgroup. سلسلة التحقيق مرتبة تمنع قرارات متسرعة.

حقوق وأمن البنك

يمكن نشر منهجية تحليل البنود وأمثلة اصطناعية، لكن item-level reports التشغيلية قد تكشف صعوبة بنود أو مفاتيح أو distractor behavior ويسهل إساءة استخدامها لتخمين بنك الاختبار. لذلك يجب تحديد من يصل إلى dashboard التفصيلي، وعدم وضع item text أو key في ملفات عامة. إذا كانت الأداة مملوكة لناشر، لا يعاد نشر بنودها من أجل شرح الإحصاءات. روافد تشرح الأسلوب ولا تقدم جداول أداء لبنود محمية.

قائمة فحص دفاعية

قبل اعتماد تحليل البنود تحقق من: نسخة النموذج والمفتاح والترميز؛ n لكل بند؛ proportion أو توزيع الفئات؛ corrected relation مع معيار مناسب؛ distractors؛ missing/not reached؛ position/time؛ local dependence؛ subgroup flags ثم DIF عند الحاجة؛ أثر البند في blueprint؛ reliability دون عبادة alpha؛ الاستقرار عبر عينة أو إدارة؛ item version؛ قرار موثق ومراجع. أضف فواصل عدم يقين للمؤشرات الحساسة واحتفظ بأسباب الاستبعاد. هذه القائمة تجعل التحليل قابلًا لإعادة الإنتاج والمراجعة.

العلاقة مع CTT وIRT والـBlueprint

CTT يفسر p-values والارتباطات بوصفها معتمدة على العينة، IRT يقدم معلمات ومنحنيات مشروطة بنموذج وقدرة على المقارنة بعد calibration، والـblueprint يحدد ما يحتاجه الاختبار من محتوى وصعوبة ودقة. Item analysis هو نقطة الالتقاء العملية: نستخدم المؤشرات المناسبة ثم نرجع إلى غرض البند. لا ينبغي أن يستبدل أحد الأطر الآخرين كليًا؛ تحليل CTT سريع ومفيد، وIRT أعمق عندما تتوفر البيانات والنموذج، والمحتوى يظل شرطًا لصلاحية الاختبار.

الخلاصة

تحليل البنود الجيد لا يطارد رقمًا مثاليًا، بل يجمع صعوبة وتمييزًا ومشتتات وفئات ووقتًا ومفقودات واستقرارًا وإنصافًا مع تعريف البناء. الإحصاء يرفع الإشارة، والمراجعة تفسرها، والـblueprint يحدد إن كان البند ضروريًا، والنسخ والتجريب يختبران الإصلاح. بهذا تتحول item analysis من جدول فرز إلى نظام جودة يدعم validity وreliability والف fairness وأمن بنك البنود.

أسئلة شائعة

أسئلة شائعة

ما معنى صعوبة البند في CTT؟

غالبًا هي نسبة من أجابوا إجابة صحيحة؛ لذلك القيمة الأعلى تعني بندًا أسهل في العينة. وهي ليست معلمة ثابتة عبر كل السكان.

ما هو معامل تمييز البند؟

هو مؤشر لعلاقة أداء البند بمستوى معيار ذي صلة مثل الدرجة الكلية أو درجة المجال، ويشير إلى مدى اختلاف النجاح بين مستويات الأداء.

ما هو point-biserial؟

ارتباط بين استجابة بند ثنائي ودرجة مستمرة، ويستخدم لفحص التمييز. تفسيره يتأثر بصعوبة البند وجودة الدرجة المرجعية.

هل يجب حذف البند إذا كان تمييزه منخفضًا؟

لا تلقائيًا. نراجع المحتوى والصعوبة والعينة والمفتاح والبنية والإنصاف؛ قد يكون البند ضروريًا أو عند طرف المقياس أو يحتاج تعديلًا لا حذفًا.

ما هو المشتت غير الوظيفي؟

بديل لا يجذب المفحوصين أو لا يعمل كما صُمم. لكنه لا يُحكم عليه بنسبة واحدة؛ نراجع نمط اختياره والمحتوى والغرض.

هل alpha if item deleted يكفي لاتخاذ قرار؟

لا. رفع alpha قد يأتي على حساب تمثيل البناء. يجب الجمع بين الثبات والمحتوى والصعوبة والتمييز والـblueprint.

ما الفرق بين فرق صعوبة المجموعات وDIF؟

فرق p بين مجموعتين قد يعكس اختلافًا عامًا في القدرة. DIF يقارن أداء البند بعد المطابقة على مستوى البناء، لذلك هو فحص مختلف.

هل يجوز نشر إحصاءات بنود اختبار محمي؟

يعتمد على الرخصة والأمن. الإحصاءات التفصيلية قد تكشف البنك أو المفتاح، لذلك تحفظ غالبًا داخل بيئة آمنة، ويمكن شرح المنهج بأمثلة اصطناعية.

استقرار المؤشرات عبر العينات

إحصاء البند المفيد يجب أن يكون قابلًا للتكرار بما يكفي للغرض. يمكن تقسيم عينة كبيرة إلى development وvalidation أو استخدام bootstrap لرؤية تشتت p-value والتمييز، ثم مقارنة المؤشرات عبر إدارات زمنية متقاربة. إذا تغير ترتيب البنود جذريًا من عينة إلى أخرى، نبحث عن تغير السكان أو المنهج أو exposure أو مشكلة في نموذج الاختبار. لا نحتاج أن تتطابق القيم حرفيًا؛ المطلوب فهم مقدار التقلب المتوقع. يمكن وضع control charts للمؤشرات التشغيلية مع حدود تستند إلى تاريخ البند بدل حدود عامة. الاستقرار مهم خصوصًا قبل استخدام بند كـanchor في equating، لأن البند غير المستقر قد ينقل المشكلة إلى المقياس كله.

تحليل البنود في الاختبارات التكيفية

في CAT أو adaptive testing لا يرى كل مفحوص كل بند، لذلك تصبح مؤشرات CTT البسيطة مشروطة بسياسة الاختيار والتعرض. البنود السهلة قد تُعرض أكثر لمن هم في مستويات منخفضة، والبنود الصعبة لفئات أخرى، فتكون p-values غير قابلة للمقارنة كما في نموذج خطي واحد. هنا يعتمد البرنامج أكثر على IRT calibration وitem information وexposure statistics وfit، مع مراقبة drift وDIF. يمكن الاحتفاظ بمؤشرات وصفية لكن يجب تفسيرها ضمن conditional administration. كما يجب مراقبة content balancing حتى لا يحقق الخوارزم information مرتفعة على حساب تمثيل blueprint.

من التحليل إلى سجل قرار قابل للتدقيق

لكل بند سجل قرار مختصر يمكن أن يتضمن item ID غير قابل للكشف خارجيًا، الإصدار، عدد الاستجابات، p أو توزيع الفئات، corrected relation، حالة distractors، flags للوقت أو DIF، موقعه في blueprint، نتيجة مراجعة المحتوى، والقرار مع مبرر وتاريخ ومراجع. لا يضم السجل العام نص السؤال أو المفتاح، بينما البيئة الداخلية المصرح بها تربطه بالمادة. بهذه البنية يمكن الرجوع بعد سنوات لمعرفة لماذا عُدل بند أو سُحب، وتجنب إعادة إدخال نسخة قديمة من البنك. وهي أيضًا تمنع اختيار المؤشرات بعد الحدث لتبرير قرار اتخذ مسبقًا.