سجل الأدوات المؤسسي يربط كل أداة بالبناء والسكان واللغة والإصدار وأدلة الصلاحية والثبات والاستخدام المسموح، بدل الاكتفاء بقائمة أسماء.

بطاقة الأداة

  • الاسم والإصدار والناشر
  • البناء والفئة العمرية
  • اللغة وطريقة التكييف
  • المؤهل ووقت التطبيق
  • التصحيح ونوع الدرجة
  • الترخيص وتاريخ المراجعة

تصنيف الاستخدام

  1. بحث واستكشاف
  2. فحص أولي
  3. متابعة تغير
  4. قرار فردي عالي الأثر

متى نوقف الأداة؟

  • إصدار أو معايير قديمة
  • غياب دليل للسكان أو اللغة
  • استخدام لغرض غير مدروس
  • تدريب غير كافٍ
  • خوارزمية رقمية غير موثقة

تمت المراجعة من قبل فريق روافد.

العدالة والإصدارات وحوكمة البيانات

سجّل أدلة العدالة ورقم الإصدار الرقمي وسياسة تخزين البيانات والاستخدامات المسموحة وغير المسموحة، واجعل قرار الشراء تابعًا لسؤال القياس لا العكس.

تدريب مستخدمي الأداة

سجّل متطلبات التدريب والإشراف ونطاق الممارسة، ولا تجعل وجود الأداة في السجل ترخيصًا تلقائيًا لأي مستخدم لتطبيقها أو تفسيرها.

الأداة تبقى خاضعة للمراجعة عند تغير الدليل أو السكان أو الغرض، ولا يمنحها الاعتياد المؤسسي صلاحية دائمة.

طبقة القرار السيكومتري: ما الذي يجب أن يسبق الاعتماد المؤسسي؟

ترتيب خصائص القياس مهم. تبدأ المراجعة بسؤال صدق المحتوى: هل البنود أو المهام ذات صلة بالبناء، وهل تغطي جوانبه المهمة، وهل يفهمها السكان المستهدفون كما قُصدت؟ إذا فشل هذا الأساس، فإن ارتفاع الثبات أو وجود معامل إحصائي جيد لا يصلح مشكلة أن الأداة تقيس شيئًا ناقصًا أو مختلفًا. بعد ذلك تُراجع البنية الداخلية عند ملاءمتها، ثم الثبات وخطأ القياس وصدق البناء والتكافؤ بين المجموعات والاستجابة للتغير بحسب الغرض.

خطأ القياس والاستجابة للتغير

الأداة المستخدمة للمتابعة تحتاج إلى دليل يختلف عن أداة تستخدم للوصف مرة واحدة. سجّل خطأ القياس ومقدار التغير الذي يمكن تمييزه عن الضوضاء القياسية عندما تتوافر هذه البيانات، وافحص responsiveness: هل تستطيع الأداة التقاط تغير في البناء عندما يحدث؟ لا تُفسر فروق صغيرة بين زيارتين كتحسن علاجي من دون فهم الخطأ والسياق. وإذا لم توجد بيانات استجابة للتغير في السكان أو النسخة اللغوية المستخدمة، يجب أن يظهر ذلك في سجل القرار.

التكافؤ اللغوي والثقافي ليس ترجمة

عند استخدام نسخة عربية، سجّل كيف اختُبرت الصياغة مع المتحدثين بالعربية، وهل توجد أدلة على صدق المحتوى في السياق المستهدف، وهل دُرست cross-cultural validity أو measurement invariance عندما تكون المقارنة بين اللغات أو المجموعات جزءًا من القرار. اختلاف معنى بند واحد أو متطلب القراءة أو الأمثلة الثقافية قد يغير الدرجة من دون تغير في البناء نفسه.

حدود التكييف والوصول

التسهيلات مثل AAC أو قارئ الشاشة أو وقت إضافي أو استجابة غير لفظية تُسجل كجزء من التطبيق. ثم يُسأل: هل أزالت التهيئة حاجزًا غير مقصود، أم غيرت المهمة التي يُفترض أن تقيس البناء؟ لا توجد إجابة واحدة لكل أداة؛ يجب أن يحدد الدليل والدليل الفني للنسخة ما إذا كان تفسير الدرجة يبقى صالحًا بعد التعديل.

بطاقة دليل مختصرة لكل أداة

إلى جانب الاسم والترخيص، أضف أربع خانات قابلة للتدقيق: أقوى دليل يدعم الاستخدام المقصود، أهم فجوة أو عدم يقين، قرار الاستخدام الحالي، وما الذي سيجعل القرار يتغير. بهذه الطريقة يصبح السجل نظام قرار حيًا لا مخزنًا ثابتًا لأسماء المقاييس.

ابدأ بالبناء المراد قياسه والقرار الذي سيترتب عليه

السجل المؤسسي لا يبدأ باسم الأداة بل بسؤالين: ما الـconstruct المقصود تحديدًا؟ وما القرار الذي ستؤثر فيه الدرجة؟ أداة ممتازة لفرز خطر أولي قد تكون غير صالحة لقياس التغير بعد تدخل، وأداة outcome جيدة قد لا تصلح للتشخيص. نسجل لكل أداة الغرض المسموح، والغرض غير المسموح، والقرار الذي يتطلب مصدرًا أو مراجعة أعلى قبل استخدام الدرجة.

هوية الأداة: الإصدار واللغة والحقوق جزء من الصلاحية

اسم الاختبار وحده غير كافٍ. يجب حفظ الإصدار، سنة الإصدار، اللغة، الناشر أو صاحب الحقوق، نظام التصحيح، المرجع السكاني، وما إذا كانت النسخة ورقية أو رقمية. تغيير إصدار أو ترجمة أو خوارزمية scoring قد يجعل معايير الصلاحية القديمة غير قابلة للنقل مباشرة. لا تُخزن نسخة محمية أو تُعاد طباعتها في المنصة إلا بترخيص مناسب.

العينة المرجعية: من قورنت به الدرجة؟

قبل تفسير standard score نسجل عمر العينة المرجعية ولغتها وموقعها والسياق الصحي أو التعليمي وخصائصها الأساسية. إذا كان الفرد خارج النطاق الذي دُرست فيه الأداة، لا تختفي المشكلة لأن البرنامج أنتج رقمًا. نسمي النتيجة exploratory أو descriptive عند الحاجة ونمنع تحويلها إلى قرار معياري قطعي.

لا توجد صلاحية واحدة اسمها validity

نراجع content validity: هل البنود ذات صلة وشاملة ومفهومة؟ ثم structural validity أو بنية الدرجات عند الحاجة، construct validity والعلاقات المتوقعة مع مقاييس أخرى، وcriterion validity فقط عندما يوجد معيار مرجعي مناسب. وجود معامل ارتباط واحد لا يثبت أن الأداة صالحة لكل قرار. معيار COSMIN يعامل content validity نقطة محورية لأن أداة لا تمثل البناء جيدًا لا ينقذها ثبات مرتفع.

الثبات ليس دقة ولا صلاحية

نفرق بين internal consistency وبين test-retest وinter-rater أو intra-rater reliability. ألفا مرتفعة لا تعني أن الأداة تقيس ما نريد، وICC جيد لا يعني أن فرق نقطتين يمثل تغيرًا حقيقيًا. يسجل السجل نوع الثبات والسياق والفاصل الزمني، ولا يسمح بعبارة عامة مثل "الأداة موثوقة" دون تحديد.

خطأ القياس: هل التغير أكبر من الضوضاء؟

عند استخدام الأداة للمتابعة نبحث عن Standard Error of Measurement أو Smallest Detectable Change/Difference عندما تكون متاحة ومناسبة. إذا تغيرت الدرجة أقل من خطأ القياس المتوقع، لا نعلن تحسنًا أو تراجعًا مؤكدًا. وإذا لم توفر الأدلة هذه القيم، يسجل ذلك كفجوة ويضاف قياس وظيفي متكرر بدل اختراع حد رقمي.

Responsiveness وMIC: التغير الإحصائي ليس دائمًا تغيرًا مهمًا

القدرة على كشف التغير تختلف عن معرفة ما إذا كان التغير مهمًا للشخص. Minimal Important Change أو Difference، عندما توجد بطريقة مناسبة، تساعد على تفسير المعنى السريري أو الوظيفي. لكنها ليست رقمًا عالميًا ينقل بين الأعمار والحالات والسياقات بلا تحقق. نحفظ مصدر MIC وطريقة اشتقاقه ونفصلها عن SDC/SEM.

Floor وceiling effects قد يخفيان التقدم أو التراجع

إذا تجمع عدد كبير من الأشخاص عند أدنى أو أعلى الدرجة، تصبح الأداة ضعيفة التمييز في تلك المنطقة. في الإعاقات الشديدة قد يبقى standard score ثابتًا عند floor بينما تظهر مهارات خام جديدة. وفي الأفراد ذوي الأداء العالي قد يمنع ceiling رؤية مكاسب إضافية. لذلك يسجل السجل حدود النطاق ويقترح raw scores أو growth values أو مقاييس تكميلية عندما يكون ذلك مشروعًا.

التكييف العربي: الترجمة لا تثبت التكافؤ

النسخة العربية تحتاج توثيق طريقة الترجمة والمراجعة الثقافية واختبار الفهم، ثم أدلة على measurement invariance أو differential item functioning عندما يكون ذلك مناسبًا. البند قد يكون صحيحًا لغويًا لكنه يختلف ثقافيًا في الصعوبة أو المعنى. نميز بين ترجمة عملية للاستخدام الوصفي وبين نسخة عربية مقننة أو validated؛ المصطلحان ليسا مترادفين.

التسهيلات: access accommodation أم تغيير للبناء؟

تكبير الخط أو دعم السمع أو وقت إضافي قد يزيل حاجزًا لا علاقة له بالبناء، لكنه قد يغير صلاحية score إذا خالف شروط الأداة المعيارية. نسجل كل accommodation، ولماذا استُخدم، وهل ما زالت الدرجة قابلة للمقارنة بالمعيار. أحيانًا تكون النتيجة الوظيفية المعدلة أكثر عدلًا لكنها لا تُسمى standard score معياريًا.

البيانات المفقودة وقواعد التصحيح لا تُترك للتقدير بعد الاختبار

يسجل السجل عدد البنود المفقودة المسموح، قواعد prorating، متى يبطل المقياس، وكيف يعالج التطبيق عدم الاستجابة. لا نقرر بعد رؤية النتيجة حذف بند مزعج أو تعويضه بطريقة تحسن score. كل تعديل عن الدليل الرسمي يوثق ويغير مستوى الثقة في النتيجة.

دورة حياة الأداة داخل المؤسسة

كل أداة تحمل حالة: مرشحة للبحث، تحت التقييم، Pilot محدود، معتمدة داخليًا لغرض محدد، موقوفة مؤقتًا، أو متقاعدة. الانتقال بين الحالات يعتمد على اكتمال الحقوق، التدريب، الصلاحية، ملاءمة السكان، ومراقبة الأخطاء. إذا صدر إصدار جديد لا نحذف القديم؛ نحفظ تاريخ الانتقال حتى تبقى القرارات السابقة قابلة للتدقيق.

بطاقة قرار نهائية لكل أداة

تُنهي بطاقة الأداة بخمس جمل إلزامية: ما الذي تقيسه؟ لمن تصلح؟ لأي قرار تصلح؟ ما أهم حدودها؟ وما الذي يجب أن يكمّلها؟ هذه البطاقة تمنع أن يتحول السجل إلى مكتبة أسماء. الهدف المؤسسي ليس جمع أكبر عدد من الاختبارات، بل منع استخدام أداة جيدة في السؤال الخطأ.

كفاءة المستخدم شرط في صلاحية التطبيق

حتى الأداة الجيدة قد تنتج بيانات رديئة إذا استُخدمت خارج كفاءة المستخدم. يسجل السجل الحد الأدنى للتدريب، وما إذا كان التطبيق يتطلب اختصاصًا مرخصًا أو certification أو تدريب ناشر، وما المهارات التي يجب إثباتها قبل الاستخدام المستقل. لا يكفي حضور دورة؛ يمكن استخدام supervised cases أو scoring checks أو inter-rater agreement للتأكد من الكفاءة عند الأدوات التي تسمح بذلك.

مصفوفة أثر القرار تحدد مستوى الاعتماد المطلوب

نربط كل استخدام بدرجة أثر: وصفي منخفض الأثر، متابعة فردية، قرار تعليمي/خدمي متوسط، أو قرار سريري/قانوني عالي الأثر. كلما ارتفع الأثر ارتفعت متطلبات النسخة الصحيحة، التدريب، تعدد المصادر، وضوح الحدود وإعادة التقييم. أداة مناسبة للمتابعة الذاتية لا تتحول تلقائيًا إلى أداة أهلية أو تشخيص بمجرد وجود cut-off.

التدقيق الدوري للأداة لا يتوقف بعد اعتمادها

بعد الاستخدام المؤسسي نراقب معدلات missing data، الشكاوى، floor/ceiling، أخطاء التصحيح، اختلاف المفسرين، وتوزع النتائج عبر اللغة والعمر. إذا ظهرت أنماط غير متوقعة نعيد فتح تقييم الأداة. الاعتماد الداخلي حالة قابلة للمراجعة، وليس ختمًا دائمًا يتجاوز تغير السكان أو الإصدار أو الدليل.

سجل الأداة ليس قائمة أسماء: هو ملف قرار قابل للتدقيق

كل أداة في السجل المؤسسي يجب أن تحمل حدًا أدنى من الحقول: construct المحدد، الغرض المسموح، الفئة والعمر، النسخة واللغة، طريقة التطبيق والاستجابة، متطلبات الحركة والسمع والبصر والكلام، طريقة التسجيل والتفسير، التدريب والترخيص، العينة المعيارية إن وجدت، الخصائص السيكومترية المباشرة، حدود الاستخدام، تاريخ آخر تحقق، ورابط المصدر الذي يثبت كل معلومة. الاسم التجاري وحده ليس معرفة مؤسسية.

صنّف الغرض قبل اختيار الاسم

نسأل أولًا هل نحتاج screening، تشخيصًا ضمن تقييم أوسع، توصيف شدة، outcome measurement، progress monitoring، اختيار AAC أو AT، أم بحثًا. الأداة الممتازة للفرز قد لا تكون حساسة للتغير، وأداة outcome لا تثبت التشخيص، واختبار معياري لا يصف دائمًا أفضل طريقة أداء. السجل يضع use-case المصرح به بجانب كل أداة ويمنع إعادة تدوير درجة واحدة لكل القرارات.

حزمة COSMIN الدنيا لكل مقياس نتيجة

عندما تكون الأداة outcome measure نبحث، حسب طبيعتها، عن content validity أولًا، ثم structural validity وinternal consistency إن كان ذلك مناسبًا، reliability، measurement error، construct أو criterion validity، responsiveness، وcross-cultural validity أو measurement invariance. لا يوجد checkbox يسمى «validated». نسجل لكل خاصية ما إذا كان الدليل كافيًا أو غير كافٍ أو غير متاح، ولأي population وlanguage/version.

الـsubscale يحتاج دليلًا خاصًا إذا كان القرار مبنيًا عليه

قد تكون الدرجة الكلية مقبولة بينما subscale صغير غير مستقر أو لا يملك بنية أحادية واضحة. COSMIN 2.0 يؤكد تقييم خصائص المقاييس الفرعية بصورة منفصلة عندما تُستخدم منفردة. لذلك إذا كانت خطة المدرسة ستُبنى على «ذاكرة العمل» أو «التواصل» داخل مقياس متعدد المجالات، لا نفترض أن صلاحية total score تنتقل تلقائيًا إلى ذلك الجزء.

النسخة والحقوق جزء من الدقة العلمية

يُسجل رقم الإصدار، سنة النشر، صاحب الحقوق، من يحق له التطبيق، وهل يسمح بالنشر أو الطباعة أو الترجمة. لا ننسخ بنود اختبار محمي داخل الموقع لمجرد أنها معروفة أكاديميًا. ويمكننا شرح construct وطريقة اختيار الأداة وخصائصها دون إعادة إنتاج material محمي. النسخة القديمة ليست بديلًا مجانيًا عن النسخة الحالية إذا تغيرت المعايير أو scoring.

العينة المعيارية يجب أن تشبه السؤال الذي نطرحه

قبل تفسير standard score نسجل البلد واللغة والعمر والسياق السريري والتعليم والخصائص المهمة للعينة المعيارية. وجود norms إنجليزية لا يجعل الدرجة norm-referenced للعربية. كما أن أداة طورت لأطفال verbal ambulatory قد تملك floor شديدًا في شخص non-speaking مع motor impairment. عندما لا تطابق العينة، نخفض قوة الاستنتاج ونستخدم within-person growth وfunctional measures.

التكييف العربي: أربع بوابات لا بوابة ترجمة

البوابات هي: حقوق الترجمة، equivalence لغوي وثقافي، فهم البنود وطريقة الاستجابة، ثم دليل القياس في النسخة العربية بما في ذلك invariance أو DIF أو norms عندما يكون ذلك مطلوبًا للقرار. back-translation وحدها لا تكفي. إذا كانت النسخة غير مقننة نقول ذلك على البطاقة بوضوح ونمنع النظام من عرض percentile عربي مزيف.

Accommodation قد يحسن الصلاحية أو قد يغير construct

تكبير الخط أو تحسين السمع قد يزيل حاجزًا غير مقصود، بينما قراءة بند يفترض decoding قد تغير ما يقيسه الاختبار. لذلك كل accommodation يسجل: ما الحاجز الذي أزاله؟ هل تسمح تعليمات الأداة به؟ هل تبقى الدرجة معيارية؟ إذا لم نعرف، نحفظ النتيجة وصفيًا مع الوسيلة المستخدمة بدل تقديم precision غير حقيقي.

Floor وceiling إنذار لرداءة الحساسية لا لغياب القدرة

عندما تتجمع الدرجات عند الحد الأدنى لا نكتب «لا تقدم». نبحث عن raw scores أو growth scale values إذا كانت موثقة للأداة، وعن inchstones ومهارات فعلية واستقلال وتعميم. وبالمثل ceiling قد يخفي نموًا متقدمًا. بطاقة الأداة تسجل floor وceiling evidence وحدود interpretation في الفئة التي نستعملها معها.

الاستجابة للتغير تتطلب أكثر من test–retest reliability

أداة ثابتة عبر يومين قد تكون غير حساسة لتغير مهم بعد أشهر. responsiveness خاصية مستقلة. عند monitor intervention نحتاج أيضًا measurement error ومدة retest وتأثير التعلم. إذا كان الفرق أصغر من الخطأ المتوقع، لا نضخم الإشارة. وإذا لم توجد MIC أو SDC مناسبة للفئة، نستعمل قاعدة قرار متعددة المؤشرات بدل اختراع عتبة.

بطاقة النتيجة التي تظهر للقارئ

لا تعرض الصفحة رقمًا مجردًا. تُظهر construct، النسخة واللغة، تاريخ التطبيق، طريقة الوصول والتسهيلات، score ونوعه، نطاق uncertainty إن كان متاحًا، المرجع التفسيري، وأهم limitation. ثم تربط الدرجة بملاحظة وظيفية حقيقية. التقرير الجيد يقول ماذا تدعم النتيجة وماذا لا تسمح لنا باستنتاجه.

متى نوقف أو نستبدل الأداة؟

نوقف الاعتماد على الأداة عندما لا يفهم الشخص format، أو تمنع الحركة أو الحواس الاستجابة المطلوبة، أو يظهر floor أو ceiling يجعل القرار بلا معنى، أو تكون النسخة غير مصرح بها، أو يتغير construct الذي نحتاجه. الاستبدال ليس فشلًا. الخطأ الحقيقي هو الاستمرار في جمع أرقام غير صالحة لأن النظام اعتادها.

تدقيق السجل نفسه

كل بطاقة تحتاج owner وتاريخ تحقق ومؤشر freshness. عند إصدار نسخة جديدة، سحب manual، تغير license، نشر validation عربية أو ظهور تحذير measurement-property، تُفتح البطاقة للمراجعة. لا يُحذف الإصدار السابق من التاريخ؛ يُوسم retired أو superseded حتى نعرف بأي نسخة جُمعت البيانات القديمة.

قاعدة الحسم عند الشك في الأداة

إذا بقي شك جوهري في النسخة أو الحقوق أو صلاحية السكان أو معنى الدرجة، لا نستخدم الأداة لاتخاذ قرار عالي الأثر. نخفض الاستخدام إلى وصفي أو Pilot، ونضيف مصدرًا آخر للمعلومة حتى يكتمل التحقق. تأجيل القرار أقوى علميًا من رقم دقيق ظاهريًا مبني على أداة غير صالحة للسؤال.