دراسة بحثية

وكيل محادثة للصحة النفسية: ماذا قالت التجربة؟

تحليل نقدي لتجربة عشوائية قارنت وكيل محادثة بالذكاء الاصطناعي بالعلاج الجماعي وقائمة الانتظار، مع تفكيك التحالف الرقمي وتضارب المصالح.

طريقة القراءة: افصل بين نتيجة الدراسة ودلالتها العملية، واقرأ حدود الدليل قبل تعميم النتيجة. هذه الصفحة تحليل تثقيفي وليست توصية علاجية فردية.

## 1. لماذا هذه التجربة أهم من خبر «روبوت يتفوق على العلاج»؟ الدراسة المنشورة في JAMA Network Open عام 2026 ليست اختبارًا عامًا لفكرة «الذكاء الاصطناعي يعالج الأمراض النفسية»، بل تجربة عشوائية محددة على 995 طالبًا جامعيًا في إسرائيل لديهم ضائقة نفسية، قارنت منصة محادثة اسمها Kai بعلاج جماعي وجاهي وقائمة انتظار على مدى 12 أسبوعًا، ثم تابعت المشاركين ثلاثة أشهر. هذا التفصيل يغير معنى النتيجة بالكامل. كان متوسط العمر 23.1 سنة وكانت الأعراض الأساسية في المتوسط ضمن المجال الخفيف إلى المتوسط، لذلك لا

## 2. من شارك وكيف جرى التوزيع؟ فُحص 1050 شخصًا وأُدرج 995 في التحليل: 336 في مجموعة الذكاء الاصطناعي، 331 في العلاج الجماعي الوجاهي، و328 في الانتظار. كان متوسط العمر 23.1 سنة والانحراف المعياري 2.4، وبلغت نسبة الإناث 50.7%. التوزيع تم 1:1:1 بكتل متغيرة مولدة حاسوبيًا مع طبقية بحسب الجنس وإخفاء للتخصيص عبر نظام آلي. لم يكن تعمية المشاركين أو المعالجين ممكنًا بسبب طبيعة التدخلات، وهذه نقطة متوقعة لكنها تترك مجالًا لتأثير التوقعات. كانت العينة جامعية ومعظمها من خلفية دينية واجتماعية محددة، ما يقل

### 2.1 ماذا قدمت منصة Kai فعليًا؟ المنصة لم تكن نموذجًا لغويًا مفتوحًا بلا إطار؛ كانت نظام دعم نفسي يستخدم محادثات نصية ويجمع عناصر من العلاج المعرفي السلوكي، القبول والالتزام، العلاج السلوكي الجدلي، اليقظة وعلم النفس الإيجابي. شمل التفاعل مطالبات للتأمل وتمارين تنظيم الضغط والانفعال والتنفس ورسائل تحفيزية، مع ذاكرة تكيفية وملف للمستخدم. شُجع المشاركون على التفاعل ثلاث مرات أسبوعيًا على الأقل مع إتاحة غير محدودة. وذكرت الدراسة إطار سلامة متعدد الطبقات لرصد لغة الخطر الحاد وإظهار موارد الأزمات و

## 3. ما المقارنة مع العلاج الجماعي؟ العلاج الوجاهي لم يكن رعاية اعتيادية مبهمة؛ كان 12 جلسة أسبوعية مدة كل منها 90 دقيقة بقيادة أخصائيين نفسيين مرخصين، في مجموعات تقارب 20 مشاركًا. شمل التثقيف النفسي وإعادة البناء المعرفي والتنشيط السلوكي واستراتيجيات القبول واليقظة والاسترخاء والكتابة التأملية. حاول الباحثون جعل الأساس النظري قريبًا من المنصة، لكن شكل العلاج مختلف جذريًا: جلسة جماعية مجدولة مقابل دعم فردي متاح عند الطلب. لذلك إذا ظهر فرق، لا نعرف هل يعود إلى «الذكاء الاصطناعي» ذاته أو إلى سهول

### 3.1 لماذا لا تكفي عبارة «تفوق على العلاج»؟ المخرج قد يختلف حسب الاضطراب. في القلق ظهر فرق لصالح المنصة، بينما في الاكتئاب كان الفرق أمام العلاج الجماعي أصغر، وفي PTSD لم تظهر فروق. لذلك عنوان شامل عن التفوق يخفي نمطًا متباينًا. كما أن المقارنة لم تكن عدم دونية مصممة لإثبات أن AI بديل للمعالج لكل غرض. إذا كان الهدف قرار خدمة، يجب فحص كل مخرج، شدة الأساس، الاستمرار، والسلامة، ثم السؤال إن كانت المنصة إضافة أو بوابة أولية أو بديلًا جزئيًا في حالات محددة.

## 4. القلق: أوضح نتيجة في التجربة عند نهاية 12 أسبوعًا كان الفرق المعدل في GAD-7 بين مجموعة AI والعلاج الجماعي -2.17 نقطة، بفاصل ثقة 95% من -2.67 إلى -1.67. ومقابل الانتظار كان -2.15 نقطة، بفاصل من -2.65 إلى -1.65. استمر الفرق في المتابعة: -1.65 مقابل العلاج الجماعي و-2.08 مقابل الانتظار، مع فواصل ثقة تستبعد الصفر. هذه نتيجة متماسكة إحصائيًا، لكنها تحتاج قراءة سريرية. خط الأساس كان قريبًا من 7 نقاط، أي ضائقة قلق خفيفة إلى متوسطة في المتوسط، والفرق بنحو نقطتين قد يكون مهمًا لبعض المشاركين لكنه ل

## 5. الاكتئاب والرفاه: فوائد لكنها ليست متطابقة بالنسبة للاكتئاب، كان الفرق بين AI والانتظار -1.99 نقطة على PHQ-9 بفاصل ثقة -2.63 إلى -1.35. مقابل العلاج الجماعي كان الفرق -0.68 بفاصل -1.32 إلى -0.04، أي أصغر بكثير. في الرفاه WHO-5 ظهر فرق لصالح AI بلغ 5.72 نقطة مقابل العلاج الجماعي و9.16 مقابل الانتظار. كما تحسنت الرضا عن الحياة. هذه النتائج تقول إن النظام كان مرتبطًا بتحسن عبر عدة مخرجات، لكنها لا تجعل كل الأبعاد متساوية. والفرق في مقياس أعراض لا يعني بالضرورة تعافيًا وظيفيًا أو انخفاضًا في ا

### 5.1 لماذا نحتاج فواصل الثقة لا قيم p فقط؟ الفاصل يبين نطاقًا معقولًا لحجم الفرق، ويساعد على تمييز نتيجة دقيقة نسبيًا من نتيجة هشة. مثلًا فرق القلق مقابل العلاج الجماعي بين -2.67 و-1.67 يعطينا فكرة عن أفضل وأسوأ تقدير متوافق مع البيانات، بينما عبارة «دال» تخفي الحجم. في المقابل، إذا كان الحد قريبًا من الصفر كما في بعض نتائج الاكتئاب مقارنة بالعلاج الجماعي، تصبح الثقة في تفوق ذي معنى أقل. يجب كذلك مقارنة حجم الفرق بالحد الأدنى المهم سريريًا للمقياس، لا بالدلالة وحدها.

## 6. PTSD: النتيجة السلبية التي تمنع التعميم لم تختلف أعراض اضطراب ما بعد الصدمة بين المجموعات بصورة واضحة. في نهاية التدخل كان الفرق بين AI والعلاج الجماعي -0.29 بفاصل -0.85 إلى 0.27، ومقابل الانتظار -0.49 بفاصل -1.05 إلى 0.07؛ كلا الفاصلين يعبران الصفر. في المتابعة بقيت الفروق غير واضحة. هذه نتيجة مركزية لأنها تقول إن نجاح منصة في القلق والاكتئاب لا يضمن أثرًا على الصدمة. PTSD قد يحتاج تقييمًا متخصصًا ومعالجة ذاكرة الصدمة وتقنيات ذات بنية مختلفة، كما أن مستوى أعراض PTSD في هذه العينة ليس بالض

## 7. «التحالف العلاجي» مع آلة: ماذا وجد التحليل؟ استخدم الباحثون نموذج معادلات هيكلية لبحث العلاقة بين التحالف العلاجي المدرك، التفاعل مع المنصة، وتحسن الأعراض. ارتبط التحالف بالتفاعل بمعامل معياري β=0.31 وفاصل 0.16 إلى 0.43، وارتبط بتحسن الأعراض β=-0.58 وفاصل -0.69 إلى -0.46. هذه ارتباطات داخل مستخدمي المنصة، وليست تجربة عشوائية للتحالف نفسه. قد يشعر المستخدم بتحالف أقوى لأنه يتحسن، أو يتفاعل أكثر فيشعر بالدفء، أو توجد سمة ثالثة مثل الدافعية تفسر الاثنين. لذلك لا نقول إن «الشعور بأن AI معالج ج

### 7.1 هل استخدام كلمة «تحالف علاجي» يعني أن النظام معالج؟ لا. التحالف هنا بناء نفسي مقاس بإدراك المستخدم للدفء والكفاءة، ويمكن للإنسان أن ينسب صفات اجتماعية إلى أنظمة آلية. القياس لا يمنح النظام مسؤولية مهنية أو حكمًا سريريًا. هذه النقطة مهمة للحوكمة: حتى إذا شعر المستخدم بعلاقة قوية، يجب أن يعرف أنه يتعامل مع نظام، وأن حدود النظام والتصعيد البشري واضحة، وألا تُستخدم اللغة العاطفية لإيهامه بعلاقة بشرية لا توجد.

## 8. السلامة والتصعيد البشري ذكرت الدراسة طبقات لمراقبة اللغة المرتبطة بالخطر الحاد وإظهار موارد الأزمات وإتاحة تدخل مرخصين. هذه نقطة قوة مقارنة بنظام عام، لكنها لا تكفي لإثبات السلامة في الحالات عالية الخطورة. نحتاج عدد إشارات الخطر، الحساسية والنوعية، الأخطاء، زمن استجابة البشر، وما حدث بعد الإحالة. كما أن الدراسة على طلاب ضائقتهم خفيفة إلى متوسطة ليست اختبارًا كافيًا للسلوك الانتحاري أو الهوس أو الذهان. خدمة حقيقية تحتاج قواعد واضحة تمنع أن يصبح AI نقطة الرعاية الوحيدة عند ارتفاع الخطر. الخص

## 9. الانسحاب والاستخدام: أثر قد يغير التفسير أفادت تقارير الدراسة بأن 61% تقريبًا ظلوا متفاعلين عند 12 أسبوعًا، وأن نحو ثلث المشاركين لم يصلوا إلى بعض المتابعات. استخدم التحليل مبدأ نية العلاج ومعالجة للبيانات المفقودة، وهذا أفضل من تحليل المكملين فقط، لكن الافتراضات حول البيانات المفقودة تظل مهمة. من يتوقف عن استخدام تطبيق قد يكون تحسن أو مل أو لم يستفد أو واجه مشكلة تقنية. إذا اختلف سبب الانسحاب بين المجموعات، يمكن أن يتغير تقدير الفعالية. لذلك يجب على خدمات الصحة الرقمية أن تعامل الاحتفاظ ب

### 9.1 لماذا سهولة الوصول قد تكون جزءًا من التأثير؟ المنصة كانت متاحة عند الطلب بينما العلاج الجماعي له موعد أسبوعي. هذا الاختلاف قد يكون ميزة حقيقية للخدمة حتى لو لم يكن «تأثيرًا علاجيًا للذكاء الاصطناعي» بالمعنى الضيق. إذا ساعد الوصول في لحظة الحاجة على استخدام مهارة تنظيمية بسرعة، فهو جزء من القيمة العملية. لكن عند البحث في الآلية يجب فصله عن جودة النص نفسه. يمكن لتجربة مستقبلية مقارنة AI بدعم رقمي غير توليدي بنفس التوافر، أو مقارنة درجات مختلفة من الدعم البشري، لتحديد المكون الفعال.

## 10. تضارب المصالح: معلومة جوهرية وليست اتهامًا أفصح المقال أن الباحثة Anat Shoshani تلقت رسومًا شخصية وتملك خيارات أسهم في KAI.AI Ltd خارج العمل المقدم، وأن Bar Gurfinkel تلقى رسومًا شخصية وكان موظفًا في الشركة. لم يعلن الآخرون إفصاحات. وجود هذه الروابط لا يبطل التجربة تلقائيًا، لكنه يرفع قيمة التحقق المستقل، والتسجيل المسبق، والشفافية في البيانات والتحليل. المنصة المختبرة منتج محدد، لذلك الاستقلالية مهمة قبل قرارات شراء أو تبني واسع. لم نجد سطر Funding/Support منفصلًا في صفحة المقال التي راج

## 11. ما الذي لا تثبته الدراسة؟ لا تثبت أن جميع روبوتات المحادثة فعالة، ولا أن نماذج اللغة العامة آمنة للرعاية النفسية، ولا أن AI يحل محل المعالج، ولا أن النتيجة تنطبق على الاضطرابات الشديدة. لا تثبت أيضًا أن التحالف المدرك سبب التحسن، أو أن أثر 12 أسبوعًا يستمر سنوات. وتحديدًا، لم يظهر تفوق في PTSD. كما أن العلاج الجماعي كان شكلًا واحدًا من العلاج البشري؛ لا يمكن تعميم المقارنة على علاج فردي متخصص. هذا التحديد يمنع تحويل دراسة منتج محدد وسكان محددين إلى شعار عن مستقبل الطب النفسي.

## 12. كيف نبني تجربة عربية أعلى قيمة؟ نحتاج تجربة متعددة المواقع بالعربية تقارن منصة محادثة ذات بروتوكول واضح برعاية رقمية نشطة وبخيار بشري، مع تمثيل أعمار ومستويات شدة مختلفة. يجب تسجيل اللغة واللهجات، جودة فهم العربية، أخطاء المحتوى، الإحالات الطارئة، والانسحاب. ينبغي فصل المخرجات حسب التشخيص وشدة البداية، وقياس الوظيفة واستخدام الخدمات، لا الأعراض فقط. كما يجب إجراء تدقيق أمني مستقل ومحاكاة سيناريوهات الانتحار والهوس والذهان والعنف قبل الاستخدام العام. على مستوى الخصوصية، يجب أن تكون سياسة ا

## 13. الخلاصة النقدية أظهرت تجربة 995 طالبًا أن منصة Kai حققت انخفاضًا أكبر في القلق من العلاج الجماعي والانتظار، وانخفاضًا أكبر في الاكتئاب من الانتظار، وتحسنًا في الرفاه والرضا عن الحياة، بينما لم تظهر فائدة واضحة في PTSD. التحالف المدرك ارتبط بالاستخدام والتحسن لكنه لا يثبت السببية. الروابط التجارية المعلنة مع KAI.AI تجعل التكرار المستقل مهمًا. أفضل تفسير هو أن نظامًا حواريًا مصممًا بعناية مع طبقات سلامة قد يكون موردًا مساعدًا قابلًا للتوسع لدى فئة منخفضة إلى متوسطة الشدة، وليس بديلًا عامًا

أسئلة شائعة

كم كان حجم تجربة وكيل المحادثة؟

شملت 995 طالبًا: 336 للمنصة و331 للعلاج الجماعي و328 للانتظار.

هل تفوق AI في القلق؟

نعم في هذه العينة؛ الفرق مقابل العلاج الجماعي -2.17 نقطة GAD-7 ومقابل الانتظار -2.15 عند نهاية 12 أسبوعًا.

هل تحسن PTSD؟

لا تظهر البيانات فرقًا واضحًا بين المجموعات في أعراض PTSD.

هل التحالف الرقمي سبب التحسن؟

لا يمكن الجزم؛ التحالف المدرك ارتبط بالتفاعل والتحسن داخل نموذج بنيوي، لكنه لم يُعشّ عشوائيًا.

هل توجد مصالح تجارية معلنة؟

نعم، أفصح مؤلفان عن رسوم أو عمل أو خيارات أسهم مرتبطة بشركة KAI.AI.

هل يصلح أي chatbot للعلاج النفسي؟

لا. النتيجة تخص منصة محددة بآليات حماية ومحتوى منظم وسكان محددين.

## 14. ماذا تعني المتابعة بعد ثلاثة أشهر؟ استمرار بعض الفروق بعد ثلاثة أشهر يعطي إشارة أن النتيجة لم تختف فور انتهاء فترة 12 أسبوعًا، لكنه لا يساوي إثبات أثر طويل الأمد. في القلق بقي الفرق بين AI والعلاج الجماعي -1.65 نقطة بفاصل -2.42 إلى -0.87، ومقابل الانتظار -2.08 بفاصل -2.85 إلى -1.30. في الاكتئاب بقي فرق مقابل العلاج الجماعي -0.85 بفاصل -1.69 إلى -0.01 ومقابل الانتظار -1.79 بفاصل -2.82 إلى -0.76. هذه الأرقام مهمة، لكن المتابعة نفسها تتأثر بالانسحاب وبما إذا كان المشاركون استخدموا خدمات أخرى

## 15. أين تقع الخصوصية والموافقة في تقييم الفعالية؟ التجربة السريرية تقيس أعراضًا، لكن الخدمة الحقيقية تتعامل مع نصوص تكشف أفكارًا حميمة وعلاقات وأدوية وربما أفكارًا انتحارية. أي تقييم للقيمة يجب أن يضم مخاطرة البيانات. ينبغي أن يعرف المستخدم ما الذي يُخزن، وأين، ولأي مدة، ومن يمكنه قراءته، وهل تُستخدم المحادثة لتحسين نموذج، وما حقه في الحذف أو تصحيح بياناته. إذا كان النظام يرسل إشارات خطر إلى فريق بشري، يجب شرح حدود السرية ومسار التصعيد. هذه ليست قضايا قانونية جانبية؛ قد تؤثر في السلوك نفسه. م

## 16. ما المقاييس التي ينبغي أن تضيفها الدراسة التالية؟ إلى جانب GAD-7 وPHQ-9، نحتاج مقاييس للوظيفة الدراسية والاجتماعية، جودة النوم، الغياب، استخدام الأدوية والخدمات، والأحداث غير المرغوبة. ينبغي أن تُسجل «الأخطاء العلاجية» للنظام: اقتراح غير مناسب، تجاهل إشارة خطر، هلوسة معلومات، أو نصيحة تعارض خطة الطبيب. يمكن إنشاء لجنة مستقلة تعميها عن هوية المنتج لتصنيف عينة من المحادثات حسب السلامة والالتزام بالبروتوكول. كما يجب قياس الفروق بين من يستخدم المنصة بكثافة ومن يستخدمها قليلًا، مع الانتباه إلى

ما الذي تثبته التجربة عن هذا المنتج، وما الذي لا تثبته عن الذكاء الاصطناعي؟

ضمت التجربة 995 شابًا بمتوسط عمر يقارب 23 سنة، ووزعت المشاركين إلى وكيل محادثة بالذكاء الاصطناعي أو علاج جماعي وجاهي أو قائمة انتظار. ظهرت فروق لصالح ذراع الذكاء الاصطناعي في القلق وبعض مخرجات الاكتئاب والرفاه، بينما لم تظهر فروق ذات دلالة في أعراض اضطراب ما بعد الصدمة. هذه النتيجة تخص منصة وتدخلًا وعينة ومدة متابعة محددة؛ لا تثبت أن كل روبوت محادثة علاجي فعال، ولا أن المنتج يعادل علاجًا فرديًا متخصصًا، ولا أنها تنطبق على الأطفال أو الأزمات أو الاضطرابات الشديدة. كما أن ارتباط التحالف العلاجي المدرك بالمشاركة والتحسن لا يثبت أن التحالف هو سبب التحسن؛ قد تكون المشاركة أو التوقعات أو خصائص المستخدم جزءًا من المسار. عند تقييم منتج مشابه، ينبغي طلب بيانات مستقلة عن السلامة، الانسحاب، الإحالة عند الخطر، الخصوصية، حفظ المحادثات، تغير النموذج بمرور الوقت، والفروق بين النسخة التي دُرست والنسخة المتاحة للمستخدم. ويجب فصل «الدعم الانفعالي الرقمي» عن التشخيص ووصف الدواء وإدارة الطوارئ. أقوى استنتاج حاليًا هو أن منتجًا محددًا أظهر فائدة في بعض المخرجات ضمن RCT كبير نسبيًا، مع نتائج غير متجانسة عبر المجالات، وهذا يبرر مزيدًا من التقييم المنضبط لا التعميم على فئة التقنية كلها.

في الخدمات الفعلية، يجب أيضًا مراقبة الانجراف بين النسخة المدروسة والنسخة المنشورة. تحديث نموذج اللغة أو قواعد السلامة أو واجهة المحادثة قد يغيّر التدخل نفسه حتى لو بقي الاسم التجاري واحدًا. لذلك يحتاج أي اعتماد مؤسسي إلى رقم إصدار، وتاريخ تغيير، واختبار دوري للمخرجات الحساسة، وخطة واضحة لإيقاف ميزة أو التراجع عنها إذا ظهرت مشكلة. هذا مهم خصوصًا في الصحة النفسية لأن تجربة 2026 قيّمت نظامًا محددًا ضمن بروتوكول محدد، لا فئة تقنية ثابتة لا تتغير.

المصدر والمراجع

  1. Efficacy of a Conversational AI Agent for Psychiatric Symptoms and Digital Therapeutic Alliance
  2. PubMed PMID 41979879
  3. JAMA Network Open full article and supplements
  4. WHO Ethics and governance of artificial intelligence for health
  5. WHO Mental health and substance use