الذكاء الاصطناعي في التعليم

إنشاء الاختبارات بالذكاء الاصطناعي 2026: الأسئلة، التقييم والـRubrics

أصبح إنشاء الاختبارات بالذكاء الاصطناعي من أكثر الاستخدامات العملية للـAI بالنسبة إلى المعلمين والأساتذة؛ إذ يمكن لأدوات مثل ChatGPT وGemini والحلول التعليمية المخصصة اقتراح أسئلة، وبناء اختبارات قصيرة، وإنشاء Rubrics، وصياغة تغذية راجعة خلال وقت أقل بكثير من العمل اليدوي التقليدي.

لكن السرعة ليست المشكلة الأساسية في التقييم.

السؤال الحقيقي هو:

هل الاختبار الذي أنشأه الذكاء الاصطناعي يقيس فعلًا ما نريد أن يتعلمه الطالب؟

يمكن لأداة AI أن تنتج عشرة أسئلة تبدو ممتازة لغويًا خلال ثوانٍ، بينما يحتوي بعضها على:

  • أكثر من إجابة محتملة.
  • مستوى صعوبة غير مناسب.
  • Distractors ضعيفة.
  • معلومة غير دقيقة.
  • سؤال لا يقيس هدف التعلم أصلًا.
  • تصنيف معرفي غير صحيح.
  • صياغة تعطي تلميحًا للإجابة.
  • مفتاح إجابة يحتاج إلى مراجعة.

لهذا السبب لا ينبغي التعامل مع الذكاء الاصطناعي باعتباره مصححًا أو ممتحنًا مستقلًا، بل كمساعد يساعد المعلم على بناء المسودة الأولى ثم مراجعتها وتحسينها.

وتوضح OpenAI في إرشاداتها المحدثة حول استخدام ChatGPT في التقييم والملاحظات أن النماذج قد تكون مفيدة إلى جانب المعلم، لكنها لا توصي بتفويض قرارات التقييم إليها دون إشراف بشري، نظرًا لاحتمال الخطأ والتحيز وعدم قدرة النموذج على الإحاطة بكامل سياق الطالب.

كما يؤكد OECD في Digital Education Outlook 2026 أن الأداء الجيد في مهمة بمساعدة GenAI لا يعني بالضرورة حدوث تعلم حقيقي، وهو ما يجعل تصميم التقييم أكثر أهمية في عصر الذكاء الاصطناعي.

إذا كنت تريد فهم هذا الموضوع ضمن الصورة الأكبر لاستخدام التقنيات الذكية داخل المدارس والجامعات، فابدأ من دليل EL AMIRI AI حول الذكاء الاصطناعي في التعليم.

ما المقصود بإنشاء الاختبارات بالذكاء الاصطناعي؟

إنشاء الاختبار بالذكاء الاصطناعي لا يعني فقط كتابة:

أنشئ لي 20 سؤال اختيار من متعدد.

الاستخدام الأكثر احترافية يبدأ من ثلاثة عناصر:

Learning Objective → Assessment Evidence → Question

أي:

  1. ما الذي نريد من الطالب أن يتعلمه؟
  2. ما الدليل الذي سيقنعنا بأنه أتقن هذا التعلم؟
  3. ما السؤال أو المهمة التي يمكن أن تنتج هذا الدليل؟

ثم يأتي الذكاء الاصطناعي ليساعد في:

  • اقتراح الأسئلة.
  • إنشاء بدائل متعددة للسؤال.
  • صياغة Distractors.
  • تغيير مستوى الصعوبة.
  • توليد أسئلة مفتوحة.
  • اقتراح أسئلة للتقييم التكويني.
  • إنشاء Exit Tickets.
  • بناء Rubrics.
  • تقديم مسودة Feedback.
  • إنشاء نسخ متوازية للاختبار.
  • تحليل مجموعة من الإجابات بحثًا عن أنماط متكررة.

لكن جودة جميع هذه المهام تعتمد على جودة تصميم التقييم قبل استخدام AI.

لماذا لا ينبغي أن تبدأ بطلب “أنشئ اختبارًا”؟

لنأخذ مثالًا بسيطًا.

إذا كتبت:

أنشئ اختبارًا عن الطاقة.

فما الذي تعرفه الأداة؟

تقريبًا لا شيء.

لا تعرف:

  • عمر الطلاب.
  • المستوى الدراسي.
  • المادة الدقيقة.
  • ما الذي دُرس.
  • أهداف الحصة.
  • نوع التقويم.
  • الوقت.
  • مستوى الصعوبة.
  • المعرفة السابقة.
  • ما إذا كنت تريد قياس الحفظ أم التطبيق أم التحليل.

وقد تنتج اختبارًا يبدو منظمًا لكنه لا يتوافق مع تعلم طلابك.

الأفضل هو إنشاء Assessment Brief أولًا.

الخطوة الأولى: حدد هدف التعلم قبل إنشاء الأسئلة

هذه أهم قاعدة في المقال كله.

لا تبدأ بالسؤال.

ابدأ بالهدف.

لنفترض أن هدف الدرس هو:

أن يستطيع الطالب حساب النسبة المئوية من كمية وتطبيقها على مشكلة مرتبطة بالتخفيضات.

اختبار يحتوي فقط على السؤال:

عرّف النسبة المئوية.

قد يكون سؤالًا صحيحًا، لكنه لا يقيس الهدف الأساسي.

أما سؤال مثل:

ثمن حذاء 320 درهمًا، وأعلن المتجر عن تخفيض بنسبة 25%. احسب مقدار التخفيض ثم السعر النهائي.

فهو أقرب إلى ما نريد قياسه.

إذن:

Correct Question ≠ Relevant Assessment Question

قد يكون السؤال صحيحًا علميًا لكنه غير مناسب لهدف التعلم.

الخطوة الثانية: حدد نوع التقييم

قبل تشغيل AI، حدد وظيفة الاختبار.

تقييم تشخيصي Diagnostic Assessment

يستخدم قبل بدء التعلم لمعرفة ما يعرفه الطلاب مسبقًا.

مثل:

  • 3 أسئلة قصيرة قبل الوحدة.
  • مشكلة بسيطة تكشف المفاهيم الخاطئة.
  • سؤال مفتوح عن المعرفة السابقة.

تقييم تكويني Formative Assessment

يحدث أثناء عملية التعلم.

هدفه ليس إعطاء علامة فقط، بل مساعدة المعلم والطالب على معرفة:

ماذا تم فهمه؟ وما الذي يحتاج إلى مراجعة؟

يمكن أن يكون:

  • سؤالًا واحدًا.
  • Mini Quiz.
  • Exit Ticket.
  • تصحيح خطأ.
  • شرح طريقة الحل.

تقييم ختامي Summative Assessment

يستخدم بعد نهاية وحدة أو موضوع لقياس مستوى الإنجاز.

وهنا ترتفع أهمية:

  • التغطية المتوازنة للأهداف.
  • العدالة.
  • الثبات.
  • وضوح التعليمات.
  • دقة مفتاح التصحيح.

تقييم ذاتي Self-Assessment

يمكن استخدام AI أيضًا لمساعدة الطالب على مراجعة فهمه من خلال:

  • Quiz.
  • Flashcards.
  • أسئلة متدرجة.
  • Feedback.
  • إعادة المحاولة.

Google، على سبيل المثال، يتيح حاليًا في Gemini إنشاء Quizzes وPractice Tests وFlashcards وStudy Guides، ويمكن إضافة ملفات كمادة مرجعية قبل إنشاء الأسئلة.

الخطوة الثالثة: أنشئ جدول مواصفات بسيطًا للاختبار

أحد أكبر الأخطاء عند استخدام AI هو السماح له بتحديد توزيع الأسئلة عشوائيًا.

بدل ذلك، أنشئ Assessment Blueprint.

لنفترض أن لدينا اختبارًا من 10 أسئلة.

الهدفالوزنعدد الأسئلةالمستوى
فهم مفهوم النسبة المئوية20%2فهم
حساب نسبة من كمية30%3تطبيق
حل مشكلة حياتية30%3تطبيق/تحليل
اكتشاف خطأ في حل20%2تحليل

ثم أعط هذا الجدول إلى AI.

بهذا تنتقل من:

أنشئ 10 أسئلة.

إلى:

أنشئ اختبارًا وفق Blueprint محدد مسبقًا.

والفرق كبير جدًا.

استخدام تصنيف Bloom مع الذكاء الاصطناعي

يمكن الاستفادة من Bloom’s Taxonomy كإطار يساعد في تنويع الأسئلة.

المستويات الشائعة هي:

المستوىماذا يفعل الطالب؟مثال
التذكريسترجع معلومةما تعريف النسبة المئوية؟
الفهميشرح أو يفسرلماذا تعادل 50% نصف الكمية؟
التطبيقيستخدم المعرفةاحسب 20% من 350
التحليليفحص العلاقات أو الأخطاءأين الخطأ في هذا الحل؟
التقويميحكم ويبررأي طريقتين أفضل؟ ولماذا؟
الإبداعينتج حلًا أو نموذجًا جديدًاصمم مشكلة واقعية تتطلب استخدام النسب

لكن يجب الانتباه إلى نقطة مهمة:

لا تفترض أن AI سيصنف مستوى السؤال وفق Bloom بصورة صحيحة دائمًا.

السؤال قد يستخدم فعلًا مثل “حلل” بينما لا يتطلب فعليًا أكثر من التذكر.

لذلك يجب النظر إلى العملية العقلية المطلوبة من الطالب وليس إلى الفعل الموجود في بداية السؤال فقط.

Prompt احترافي لإنشاء اختبار بالذكاء الاصطناعي

بدل:

أنشئ اختبارًا عن النسب المئوية.

استخدم شيئًا مثل:

أنت مساعد في تصميم التقييم التعليمي.

أريد إنشاء مسودة اختبار للطلاب وفق المعلومات التالية:

المادة: الرياضيات
المستوى: الصف الثامن
الموضوع: النسب المئوية
زمن الاختبار: 20 دقيقة

أهداف التعلم:

  1. حساب نسبة مئوية من كمية.
  2. تطبيق النسبة المئوية في مشكلة واقعية.
  3. تفسير طريقة الحل.
  4. اكتشاف خطأ بسيط في حل متعلق بالنسبة المئوية.

أنشئ 10 أسئلة موزعة كالتالي:

  • سؤالان للفهم.
  • 4 أسئلة للتطبيق.
  • سؤالان للتحليل.
  • سؤالان قصيران يتطلبان تفسير التفكير.

الشروط:

  • لا تستخدم معلومات لم يتعلمها الطالب.
  • اجعل كل سؤال يقيس هدفًا واحدًا واضحًا.
  • تجنب الغموض.
  • في أسئلة الاختيار من متعدد، اجعل Distractors معقولة وليست مضحكة أو واضحة.
  • لا تستخدم “كل ما سبق” و“لا شيء مما سبق”.
  • اذكر الهدف الذي يقيسه كل سؤال.

بعد الاختبار، أنشئ مفتاح إجابة منفصلًا.

ثم أضف قسمًا بعنوان “مراجعة ضرورية من المعلم” وحدد الأسئلة التي تعتقد أنها تحتاج إلى مراجعة إضافية.

هذا Prompt لا يضمن اختبارًا مثاليًا.

لكنه يعطي AI قيودًا تربوية واضحة.

لماذا تعد Distractors مهمة في أسئلة الاختيار من متعدد؟

لنأخذ سؤالًا ضعيفًا:

ما ناتج 25% من 200؟

A. 50
B. 2000
C. موزة
D. 90000

حتى الطالب الذي لا يعرف النسبة المئوية يمكنه غالبًا تخمين A.

المشكلة ليست في السؤال نفسه فقط.

المشكلة في جودة البدائل.

Distractors الجيدة يجب أن تمثل أخطاء محتملة ومعقولة.

مثلًا:

ما ناتج 25% من 200؟

A. 25
B. 50
C. 75
D. 175

هنا يمكن للبدائل أن تكشف أنواعًا مختلفة من سوء الفهم.

يمكن أن نطلب من AI:

بالنسبة لكل Distractor، اشرح الخطأ المفاهيمي أو الحسابي الذي قد يجعل الطالب يختاره.

إذا عجزت الأداة عن تفسير سبب وجود البديل، فقد لا يكون Distractor جيدًا أصلًا.

لا تطلب الأسئلة فقط: اطلب تحليل كل سؤال

بعد توليد الاختبار، نفذ مرحلة ثانية.

استخدم:

راجع الأسئلة السابقة واحدًا واحدًا.

لكل سؤال، أنشئ جدولًا يحتوي على:

  • الهدف الذي يقيسه.
  • الإجابة الصحيحة.
  • مستوى Bloom المتوقع.
  • سبب اعتبار Distractors معقولة.
  • وجود أي غموض محتمل.
  • إمكانية وجود أكثر من إجابة صحيحة.
  • تقدير مبدئي للصعوبة.
  • التعديل المقترح إن وجد.

لا تفترض أن السؤال جيد لمجرد أنك أنت الذي أنشأته.

هذه الجملة الأخيرة مهمة جدًا.

نريد أن يتحول AI من:

Generator

إلى:

Reviewer

لكن هذا لا يلغي مراجعة المعلم.

نموذج Audit للأسئلة المولدة بالذكاء الاصطناعي

أنصح باستخدام قائمة مراجعة ثابتة لكل سؤال مهم.

المعيارنعم/لاماذا نراجع؟
مرتبط بهدف التعلمهل يقيس ما دُرس؟
صحيح علميًاهل توجد معلومة أو نتيجة خاطئة؟
له إجابة واضحةهل توجد إجابة واحدة صحيحة إذا كان MCQ؟
التعليمات واضحةهل يمكن تفسير السؤال بطريقتين؟
مناسب للمستوىهل اللغة أو المفهوم متقدم جدًا؟
مستوى التفكير مناسبهل يقيس التذكر أم التطبيق أم التحليل فعلًا؟
Distractors جيدةهل تمثل أخطاء معقولة؟
لا يكشف الإجابةهل توجد إشارة لغوية غير مقصودة؟
خالٍ من المعلومات غير الضروريةهل التعقيد لغوي أم معرفي؟
متوافق مع الزمنهل يمكن إكماله في الوقت المحدد؟

إذا كنت تنشئ اختبارًا مهمًا، مرر كل سؤال عبر هذا الجدول.

مثال توضيحي: سؤال يبدو جيدًا لكنه معيب

لنفترض أن AI أنشأ:

اشترى أحمد حقيبة ثمنها 400 درهم، وحصل على تخفيض قدره 20%. ما السعر النهائي؟

A. 80
B. 300
C. 320
D. 380

الإجابة الصحيحة هي 320.

السؤال جيد في ظاهره.

لكن إذا كان هدفنا:

تفسير طريقة حساب النسبة.

فهو لا يختبر التفسير.

يمكن للطالب اختيار C بالتخمين أو الحساب دون إظهار تفكيره.

يمكن تحسينه بإضافة:

اشرح في سطر واحد كيف حسبت مقدار التخفيض.

أو:

يعرض طالبان طريقتين مختلفتين للحساب. حدد الطريقة الصحيحة واشرح السبب.

هكذا ننتقل من مجرد الإجابة إلى Evidence of Thinking.

كيف تنشئ أسئلة تقيس الفهم بدل الحفظ؟

أحد أهم التحديات في عصر AI هو أن الأسئلة التي تعتمد فقط على إعادة إنتاج المعلومات أصبحت أسهل في الإنجاز باستخدام أدوات التوليد.

UNESCO ناقشت هذا التحول في تقييم التعليم في عصر الذكاء الاصطناعي، وأشارت إلى الحاجة إلى إعطاء مساحة أكبر للتفكير الأعلى، والإبداع، والتفسير، وتتبع عملية التعلم بدل الاعتماد فقط على المنتج النهائي.

بدل:

ما تعريف الاحتباس الحراري؟

يمكن أن تستخدم:

إليك تفسيرًا مولدًا بالذكاء الاصطناعي للاحتباس الحراري. حدد معلومتين صحيحتين ومعلومة تحتاج إلى تصحيح، واشرح السبب باستخدام ما تعلمته.

بدل:

اذكر أسباب الثورة الصناعية.

يمكن أن تستخدم:

اختر العامل الذي تعتقد أنه كان الأكثر تأثيرًا في الثورة الصناعية، ثم دافع عن اختيارك بدليلين.

وبدل:

اكتب موضوعًا عن مشكلة التلوث.

يمكن أن تستخدم:

حلل مشكلة بيئية محلية لاحظتها، اقترح حلين، ثم قارن بين مزايا وقيود كل حل.

هذا لا يجعل التقييم “مضادًا للذكاء الاصطناعي” بصورة كاملة.

لكنه يجعل المهمة أكثر ارتباطًا بـ:

  • التفكير.
  • التبرير.
  • السياق.
  • اتخاذ القرار.
  • العملية التعليمية.

كيف تستخدم AI لإنشاء أسئلة من درس أو PDF؟

الطريقة الأكثر دقة عادة ليست أن تطلب من النموذج الاعتماد على معرفته العامة.

الأفضل إعطاؤه المصدر الذي درّسته فعلًا.

يمكن أن يكون:

  • فصلًا من كتاب.
  • PDF.
  • ملخص الحصة.
  • عرضًا تقديميًا.
  • Unit Plan.
  • Curriculum document.
  • ملاحظات المعلم.

ثم استخدم:

اعتمد فقط على المادة التي سأوفرها.

أنشئ 12 سؤالًا تقيس الأهداف التالية:

[الأهداف]

لا تستخدم معلومة لا تظهر في المصدر.

بجانب كل سؤال، اذكر الفقرة أو الجزء من المادة الذي اعتمدت عليه.

إذا لم تجد معلومات كافية لإنشاء سؤال حول هدف معين، أخبرني بدل اختراع السؤال.

هذا يقلل احتمالية أن تدخل معلومات لم يدرسها الطلاب.

وعند التعامل مع ملفات طويلة، يمكن الاستفادة من الأدوات المخصصة لتحليل المستندات إلى جانب Workflow التقييم بدل الاعتماد على نسخ أجزاء متفرقة من الملف.

إنشاء اختبارات باستخدام Gemini

بحلول 2026 أصبح Gemini قادرًا على إنشاء:

  • Quizzes.
  • Practice Tests.
  • Flashcards.
  • Study Guides.

ويمكن للمستخدم أيضًا رفع مواد دراسية لاستخدامها كسياق أثناء إنشاء الاختبار.

لكن وجود زر Create Quiz لا يحل مشكلة جودة التقييم.

ما زلت تحتاج إلى تحديد:

  • المادة المرجعية.
  • الهدف.
  • عدد الأسئلة.
  • نوع الأسئلة.
  • المستوى.
  • ما الذي تقيسه الأسئلة.

ثم مراجعة المخرجات.

إنشاء الاختبارات والـRubrics في Microsoft Teach

يوفر Teach في Microsoft 365 Copilot مجموعة من الأدوات التعليمية المخصصة للمعلمين، تشمل إنشاء:

  • Lesson Plans.
  • Quizzes.
  • Rubrics.
  • مواد تعليمية أخرى.

كما يمكن إنشاء Quiz مستند إلى المحتوى التعليمي أو المناهج والمعايير، ثم مراجعته وتعديل الأسئلة والإجابات والنقاط قبل مشاركته مع الطلاب.

هذه نقطة مهمة:

حتى عندما تكون الأداة مصممة خصيصًا للتعليم، يظل Workflow يتضمن:

Generate → Review → Edit → Preview → Share

وليس:

Generate → Share

هل نستخدم ChatGPT أم Gemini أم أداة اختبارات متخصصة؟

هذا ليس سؤال المقال الأساسي.

فإذا كان هدفك اختيار الأدوات، فالأفضل الرجوع إلى أدلة EL AMIRI AI الخاصة بأدوات الذكاء الاصطناعي، بدل تحويل كل مقال تربوي إلى مقارنة منتجات.

بصورة عملية:

ChatGPT مفيد للحوار حول تصميم الأسئلة، وإنشاء نسخ متعددة، وانتقاد الاختبار، وصياغة Rubrics وFeedback.

Gemini يوفر وظائف مباشرة لإنشاء Quizzes وPractice Tests ومواد للمراجعة، ويمكن ربط العمل بالملفات التي يوفرها المستخدم.

Microsoft Teach يقدم Workflow أكثر توجيهًا للمعلم يتضمن Quiz وRubric والارتباط بالمحتوى والمعايير.

أما الأدوات المخصصة للاختبارات فقد تكون أفضل عندما تحتاج إلى:

  • استضافة الاختبار.
  • جمع الإجابات.
  • التفاعل المباشر.
  • التقارير.
  • LMS Integration.

لكن مهما تغيرت الأداة، تبقى جودة التقييم مرتبطة بالتصميم التربوي.

ولمعرفة الخيارات العامة المتاحة، يمكن الرجوع أيضًا إلى دليل EL AMIRI AI حول أدوات الذكاء الاصطناعي بدل تكرار قائمة الأدوات داخل هذا المقال.

كيفية إنشاء Rubric بالذكاء الاصطناعي

الـRubric مفيد عندما لا تكون الإجابة مجرد:

صحيح / خطأ.

مثل:

  • مقال.
  • عرض شفهي.
  • مشروع.
  • تقرير.
  • تحليل.
  • تجربة.
  • مهمة حل مشكلة.

لنفترض أن الطلاب مطالبون بتقديم عرض حول تغير المناخ.

بدل:

أنشئ Rubric للعرض.

استخدم:

أنشئ مسودة Analytical Rubric للمهمة التالية:

[وصف المهمة]

أهداف التعلم:

[الأهداف]

استخدم أربعة معايير فقط.

اجعل كل معيار مرتبطًا مباشرة بهدف تعلم.

استخدم أربعة مستويات أداء:

  • متقدم.
  • متقن.
  • في طور الإتقان.
  • يحتاج دعمًا.

اكتب وصفًا قابلًا للملاحظة لكل مستوى.

تجنب كلمات عامة مثل “ممتاز” أو “جيد جدًا” دون توضيح ما الذي يجعل الأداء ممتازًا.

بعد إنشاء الـRubric، تحقق من أن الفرق بين المستويات واضح وغير متداخل.

قد تحصل على:

المعيارمتقدممتقنفي طور الإتقانيحتاج دعمًا
دقة المعلوماتجميع المعلومات دقيقة ومدعومةمعظم المعلومات دقيقةتوجد أخطاء تؤثر جزئيًاأخطاء أساسية
استخدام الأدلةيستخدم أدلة متنوعة ويربطها بالحجةيستخدم أدلة مناسبةيستخدم دليلًا محدودًايذكر ادعاءات دون دليل
التحليليفسر العلاقات ويقارن وجهات النظريقدم تحليلًا واضحًايغلب الوصف على التحليليعيد المعلومات دون تحليل
التواصلمنظم وواضح ومتماسكواضح إجمالًاتوجد مشكلات تنظيميصعب متابعة الفكرة

ثم يأتي دور المعلم في مراجعة:

  • الأوزان.
  • لغة الـDescriptors.
  • التداخل بين المستويات.
  • مدى توافق Rubric مع المهمة.

Prompt لمراجعة Rubric مولد بالذكاء الاصطناعي

استخدم:

راجع الـRubric السابق نقديًا.

تحقق من:

  1. ارتباط كل معيار بهدف تعلم.
  2. إمكانية ملاحظة وقياس كل Descriptor.
  3. وضوح الفرق بين مستويات الأداء.
  4. وجود أي معيار يقيّم شيئًا لم تطلبه المهمة.
  5. تداخل المعايير.
  6. وجود كلمات ذاتية مثل “رائع” أو “ممتاز” دون دليل محدد.

لا تعيد كتابة الـRubric بالكامل.

أعطني المشكلات أولًا، ثم اقترح تعديلات محددة.

استخدام الذكاء الاصطناعي في تصحيح أعمال الطلاب

هنا يجب أن نفرق بين ثلاثة أشياء.

1. الحصول على رأي ثانٍ

يمكن إعطاء AI إجابة افتراضية أو مجهولة الهوية وطلب:

طبق الـRubric على هذه الإجابة واشرح الأدلة التي اعتمدت عليها.

ثم يقارن المعلم التحليل بتقييمه.

هذا استخدام معقول كمساعدة.

2. صياغة Feedback أولي

يمكن استخدام AI لتحويل ملاحظات المعلم إلى Feedback واضح.

مثلًا:

الطالب يملك الفكرة الأساسية لكنه لم يقدم دليلًا، والمقدمة طويلة والاستنتاج لا يعود إلى السؤال.

حوّل هذه الملاحظات إلى Feedback من ثلاثة أجزاء:

  • نقطة قوة.
  • أهم نقطة تحتاج إلى تحسين.
  • خطوة عملية واحدة للمسودة القادمة.

لا تعطِ درجة.

هنا المعلم يوفر الحكم، وAI يساعد في الصياغة.

3. ترك AI يقرر العلامة وحده

هذا أكثر إشكالية، خصوصًا في التقييمات المهمة.

OpenAI توضح أن نماذجها لا ينبغي أن تتخذ قرارات التقييم دون وجود إنسان يتولى الحكم النهائي، بسبب احتمال التحيز والخطأ وعدم معرفة النموذج بكل سياق الطالب.

إذن:

AI can assist grading.

لكن:

AI should not own the grade.

كيف تستخدم AI لتقديم Feedback أفضل؟

المشكلة في كثير من Feedback التقليدي أنه يكون:

جيد جدًا.

أو:

تحتاج إلى بذل مجهود أكبر.

لكن الطالب لا يعرف ماذا يفعل بعد ذلك.

يمكن إعطاء AI تعليمات أكثر فائدة:

استخدم الـRubric المرفق والإجابة التالية.

لا تعطِ العلامة النهائية.

حدد:

  1. أقوى عنصر في الإجابة مع دليل من النص.
  2. أهم فجوة مقارنة بالـRubric.
  3. سؤالًا واحدًا يجعل الطالب يفكر في كيفية تحسين إجابته.
  4. خطوة واحدة قابلة للتنفيذ في المسودة التالية.

لا تعيد كتابة الإجابة للطالب.

الجملة الأخيرة مهمة.

نريد Feedback يدفع الطالب للعمل، لا Feedback يقوم بالعمل بدلًا منه.

إنشاء ثلاث مستويات من Feedback

يمكن أيضًا طلب:

Feed Up

أين نريد أن نصل؟

Feedback

أين الطالب الآن؟

Feed Forward

ماذا يجب أن يفعل بعد ذلك؟

مثلًا:

الهدف: بناء حجة مدعومة بالأدلة.

الإجابة الحالية: تحتوي على رأي واضح لكن دون أدلة.

Feed Up: المطلوب ربط كل ادعاء بدليل مناسب.

Feedback: الرأي موجود، لكن الفقرة لا تقدم دليلًا يبرره.

Feed Forward: أضف دليلًا واحدًا من المصدر ثم اشرح كيف يدعم استنتاجك.

هذه صيغة أكثر فائدة من مجرد إنتاج فقرة طويلة من الملاحظات.

هل يمكن استخدام AI لتحليل نتائج الفصل؟

نعم، لكن بحذر شديد فيما يتعلق بالخصوصية.

بدل إدخال أسماء الطلاب، يمكن استخدام:

  • Student A.
  • Student B.
  • Student C.

أو بيانات مجهولة الهوية.

ثم تطلب:

إليك نتائج اختبار من 10 أسئلة.

لكل طالب سأقدم فقط رمزًا مجهولًا وإجاباته.

حدد:

  • السؤال الذي تسبب في أكبر نسبة أخطاء.
  • المفهوم الذي يبدو أن الصف لم يتقنه.
  • Distractor الذي اختاره عدد كبير من الطلاب.
  • مجموعة الطلاب الذين قد يحتاجون إعادة تدريس المفهوم.

لا تستنتج صفات شخصية أو قدرات ثابتة عن الطلاب.

هذا يحول AI إلى مساعد في Assessment Analysis.

وقد يكون أهم من استخدامه لإنشاء الاختبار نفسه.

ما الذي يمكن أن يخبرنا به Distractor Analysis؟

لنفترض أن سؤالًا يحتوي على:

A = الإجابة الصحيحة
B = خطأ ناتج عن نسيان القسمة على 100
C = خطأ ناتج عن حساب قيمة التخفيض بدل السعر النهائي
D = خطأ حسابي عشوائي

إذا اختار 40% من الطلاب C، فهذا لا يخبرنا فقط بأنهم أخطأوا.

إنه يخبرنا:

ربما يفهمون كيفية حساب النسبة، لكنهم لم يميزوا بين مقدار التخفيض والسعر النهائي.

وهذا Feedback للمعلم نفسه.

التقييم الجيد لا يخبرنا فقط:

من نجح؟

بل:

ماذا نتعلم نحن عن طريقة تفكير الطلاب؟

إنشاء نسخ متعددة من الاختبار باستخدام AI

يمكن للذكاء الاصطناعي إنشاء:

  • Version A.
  • Version B.
  • Practice version.
  • Retake version.

لكن لا تطلب:

غير الأرقام فقط.

لأن النسختين قد لا تظلان متكافئتين في الصعوبة.

استخدم:

أنشئ نسخة B مكافئة لهذا الاختبار.

حافظ على:

  • أهداف التعلم نفسها.
  • عدد الأسئلة نفسه.
  • نوع التفكير المطلوب في كل سؤال.
  • مستوى الصعوبة التقريبي.
  • توزيع الدرجات.

غيّر السياق والأرقام والأمثلة.

ثم أنشئ جدولًا يقارن كل سؤال في Version A بالسؤال الموازي له في Version B واشرح سبب اعتبارهما متكافئين.

ثم راجع المقارنة يدويًا.

كيف تنشئ اختبارًا متدرج الصعوبة؟

بدل 15 سؤالًا عشوائيًا:

أنشئ 12 سؤالًا موزعة إلى:

4 أسئلة أساسية تتحقق من المتطلبات الضرورية.

5 أسئلة تطبيق.

3 أسئلة تتطلب تحليلًا أو تفسيرًا.

لا تجعل زيادة الصعوبة ناتجة فقط عن استخدام أرقام أكبر أو جمل أطول.

وضح لماذا يعتبر كل سؤال أصعب معرفيًا من المستوى السابق.

هذه العبارة الأخيرة مهمة.

Longer ≠ Harder

و:

Bigger numbers ≠ Higher-order thinking

أخطاء شائعة في الاختبارات التي يولدها AI

1. سؤال صحيح لكنه خارج المنهج

الأداة قد تعرف موضوعًا أكثر مما درّسته أنت.

الحل:

استخدم مصدرًا أو أهدافًا محددة.

2. Distractors غير منطقية

تجعل السؤال سهلًا جدًا.

الحل:

اطلب أن يمثل كل Distractor misconception محتملًا.

3. وجود أكثر من إجابة صحيحة

خصوصًا في الأسئلة المفاهيمية.

الحل:

اطلب مراجعة مستقلة للسؤال ثم راجعه بنفسك.

4. تصنيف Bloom غير دقيق

كتابة “حلل” لا تجعل السؤال تحليليًا تلقائيًا.

5. زيادة صعوبة اللغة بدل المفهوم

قد يصبح السؤال اختبار قراءة أكثر منه اختبار المادة.

6. اختبار الحفظ أكثر من الفهم

لأن أسئلة التذكر أسهل في الإنشاء الآلي.

7. إعطاء Feedback عام

مثل:

إجابتك جيدة ولكن تحتاج إلى المزيد من التفاصيل.

الحل:

اطلب Evidence + Gap + Next Step.

8. اعتماد العلامة التي يقترحها AI

خصوصًا في المقالات والمشروعات المعقدة.

الحل:

المعلم يتخذ قرار التقييم النهائي.

الذكاء الاصطناعي يغير أيضًا طريقة تصميم التقييم

أصبح التحدي اليوم أوسع من:

كيف أمنع الطالب من استخدام ChatGPT؟

قد يكون السؤال الأفضل:

ما نوع التقييم الذي يجعل الطالب مضطرًا إلى إظهار التفكير والتعلم؟

UNESCO طرحت هذا النقاش بصورة واضحة، مشيرة إلى أن تطور AI يدفع نحو إعطاء أهمية أكبر لـ:

  • التفكير الأعلى.
  • الإبداع.
  • التبرير.
  • مراجعة مخرجات AI.
  • توثيق عملية العمل.
  • الحوار والدفاع عن الأفكار.
  • المشكلات المرتبطة بسياق الطالب.

يمكن مثلًا تحويل المهمة من:

اكتب مقالًا عن الطاقة المتجددة.

إلى:

اكتب مسودة أولى.

استخدم AI لتقديم اعتراضين على حجتك.

تحقق من اعتراضاته من المصادر.

عدّل حجتك.

ثم أرفق فقرة توضح ما الذي غيرته ولماذا.

هنا يصبح استخدام AI جزءًا من عملية التعلم نفسها.

ماذا عن أدوات كشف النصوص المولدة بالذكاء الاصطناعي؟

من الخطأ بناء استراتيجية التقييم بالكامل على:

سأعرف هل استخدم الطالب AI أم لا.

أدوات الكشف ليست أساسًا كافيًا لاتخاذ أحكام عالية المخاطر، وUNESCO أشارت أيضًا إلى مشكلات الاعتماد على AI detection وإلى أن تطور التوليد يجعل التركيز على إعادة تصميم التقييم أكثر فائدة من سباق الكشف وحده.

الأفضل أن تجمع بين:

  • تعليمات واضحة حول استخدام AI.
  • مراحل متعددة للتسليم.
  • مسودات.
  • Reflection.
  • مناقشة شفوية عند الحاجة.
  • أسئلة مرتبطة بسياق حقيقي.
  • مطالبة الطالب بتفسير قراراته.

Prompt شامل لإنشاء اختبار ومراجعته

يمكن الاحتفاظ بالقالب التالي لاستخدامه مع أي مادة:

أريد إنشاء مسودة تقييم تعليمي.

السياق:

المادة: [المادة]

الصف/المستوى: [المستوى]

الموضوع: [الموضوع]

أهداف التعلم: [الأهداف]

المادة المرجعية: [ألصقها أو أرفقها]

نوع التقييم: [تشخيصي/تكويني/ختامي]

الزمن: [المدة]

عدد الأسئلة: [العدد]

أنشئ Blueprint أولًا يوضح:

  • الهدف.
  • عدد الأسئلة.
  • نوع السؤال.
  • مستوى التفكير المطلوب.

لا تنشئ الأسئلة حتى تعرض الـBlueprint.

بعد ذلك أنشئ الأسئلة وفق الـBlueprint.

لكل سؤال أضف:

  • الهدف الذي يقيسه.
  • الإجابة الصحيحة أو نموذج الإجابة.
  • مستوى التفكير.
  • سبب اختيار Distractors إذا كان السؤال متعدد الخيارات.

ثم نفذ Audit مستقلًا للأسئلة واكتشف:

  • أي سؤال غامض.
  • أي سؤال يمكن أن يملك أكثر من إجابة.
  • أي معلومة تحتاج إلى تحقق.
  • أي سؤال لا يقيس الهدف.
  • أي سؤال مستواه أعلى أو أقل مما طلبته.

لا تعتبر الاختبار نهائيًا. تعامل معه كمسودة تحتاج مراجعة المعلم.

Workflow الذي نوصي به في EL AMIRI AI

الطريقة الأفضل ليست:

AI → 20 Questions → Publish

بل:

Learning Objectives
↓
Assessment Blueprint
↓
AI Draft
↓
Question Audit
↓
Teacher Review
↓
Pilot / Formative Use
↓
Student Responses
↓
Analysis
↓
Instructional Decision

التقييم الحقيقي لا ينتهي عندما يجيب الطالب.

بل عندما يستخدم المعلم نتائج الإجابات لاتخاذ قرار حول الخطوة التالية في التعلم.

هل يمكن إنشاء الاختبارات مجانًا بالذكاء الاصطناعي؟

نعم، توفر عدة أدوات ذكاء اصطناعي إمكانية إنشاء أسئلة واختبارات ضمن مستويات مجانية أو حسابات تعليمية، لكن الميزات والحدود تتغير باستمرار.

لذلك لا تجعل اختيار الأداة محور Workflow.

ابدأ من:

  1. أهداف التعلم.
  2. المادة المرجعية.
  3. نوع التقويم.
  4. شكل الأسئلة.
  5. طريقة المراجعة.

ثم اختر الأداة المناسبة.

إذا كان هدفك الأساسي هو مقارنة الأدوات وليس منهجية التقييم، فراجع قسم أدوات الذكاء الاصطناعي في EL AMIRI AI، الذي يغطي الأدوات حسب الاستخدامات المختلفة.

قائمة تحقق قبل إعطاء الاختبار للطلاب

قبل نشر أي اختبار تم إنشاؤه بمساعدة AI، اسأل:

المحتوى

  • هل كل معلومة صحيحة؟
  • هل تعتمد الأسئلة على ما تم تدريسه؟

الأهداف

  • هل لكل سؤال غرض واضح؟
  • هل توزيع الأسئلة يعكس أهمية الأهداف؟

اللغة

  • هل التعليمات واضحة؟
  • هل اللغة مناسبة لعمر الطلاب؟

الإجابات

  • هل مفتاح الإجابة صحيح؟
  • هل يوجد سؤال بأكثر من إجابة محتملة؟

Distractors

  • هل البدائل معقولة؟
  • هل تكشف مفاهيم خاطئة فعلية؟

الصعوبة

  • هل يوجد توازن؟
  • هل التعقيد معرفي أم مجرد تعقيد لغوي؟

الوقت

  • هل يمكن للطالب المتوسط إكمال الاختبار؟

العدالة

  • هل توجد معلومات ثقافية أو سياقية غير ضرورية قد تؤثر في الإجابة؟

التقييم

  • هل الـRubric واضح؟
  • هل المعايير مرتبطة فعلًا بالأهداف؟

الإنسان

  • هل قام معلم بمراجعة النسخة النهائية؟

إذا كانت الإجابة الأخيرة لا، فالاختبار ليس جاهزًا بعد.

الأسئلة الشائعة حول إنشاء الاختبارات بالذكاء الاصطناعي

كيف أنشئ اختبارًا بالذكاء الاصطناعي؟

ابدأ بتحديد أهداف التعلم ونوع التقييم والمستوى والزمن، ثم أنشئ Blueprint يحدد توزيع الأسئلة قبل مطالبة AI بتوليدها. بعد ذلك راجع كل سؤال من حيث الدقة والوضوح والارتباط بالهدف ومستوى الصعوبة.

هل يمكن لـChatGPT إنشاء أسئلة اختيار من متعدد؟

نعم، ويمكنه إنشاء MCQ وأسئلة مفتوحة وExit Tickets وRubrics، لكن يجب مراجعة الإجابات والبدائل ومستوى الصعوبة قبل استخدامها مع الطلاب.

هل Gemini يستطيع إنشاء اختبارات؟

نعم. تدعم Gemini Apps إنشاء Quizzes وPractice Tests وFlashcards وStudy Guides، ويمكن أيضًا استخدام ملفات كمصادر للسياق.

هل يمكن للذكاء الاصطناعي إنشاء أسئلة حسب Bloom؟

يمكنه اقتراح أسئلة وفق مستويات Bloom، لكن يجب على المعلم التحقق من المستوى المعرفي الحقيقي للسؤال وعدم الاعتماد على التصنيف الذي يقدمه النموذج تلقائيًا.

كيف أتأكد من جودة سؤال مولد بالذكاء الاصطناعي؟

تحقق من ارتباطه بهدف التعلم، ودقة المحتوى، ووضوح الصياغة، وصحة مفتاح الإجابة، وجودة Distractors، ومستوى التفكير، ومدى ملاءمته للطلاب والزمن المتاح.

هل يمكن استخدام AI لإنشاء Rubric؟

نعم، ويمكن أن يوفر مسودة جيدة بسرعة إذا أعطيته وصف المهمة وأهداف التعلم والمعايير المطلوبة. لكن يجب مراجعة الفروق بين مستويات الأداء والتأكد من أن المعايير قابلة للملاحظة ولا تتداخل.

هل يمكن استخدام الذكاء الاصطناعي لتصحيح الاختبارات؟

يمكن استخدامه كمساعد لتحليل الإجابات أو صياغة Feedback أو تطبيق Rubric بصورة أولية، لكن لا ينبغي الاعتماد عليه وحده لاتخاذ قرارات تقييم مهمة أو تحديد العلامات النهائية دون مراجعة بشرية.

هل يمكن إنشاء اختبار من ملف PDF؟

نعم، تسمح عدة أدوات بإضافة ملفات كمصدر ثم إنشاء أسئلة انطلاقًا منها. ويُفضل توجيه الأداة لاستخدام الملف فقط وعدم إضافة معلومات من خارج المادة عندما يكون الهدف اختبار محتوى محدد.

هل يمكن للذكاء الاصطناعي إنشاء نسخ مختلفة من الاختبار؟

نعم، لكن يجب التأكد من تكافؤ النسخ في الأهداف ونوع التفكير ومستوى الصعوبة، لا الاكتفاء بتغيير الأرقام أو ترتيب الخيارات.

ما أفضل طريقة لاستخدام AI في التقييم؟

أفضل استخدام هو جعله مساعدًا عبر مراحل: تصميم الـBlueprint، توليد المسودة، مراجعة الأسئلة، إنشاء Rubric، تحليل الأنماط وصياغة Feedback، مع بقاء القرار التربوي النهائي بيد المعلم.

الخلاصة

يستطيع الذكاء الاصطناعي إنشاء الاختبارات بسرعة مذهلة، لكن إنشاء أسئلة كثيرة ليس هو الهدف.

الهدف هو الحصول على Evidence موثوق حول تعلم الطالب.

لذلك يجب أن تبدأ العملية من أهداف التعلم، ثم تحديد ما الذي تريد قياسه، ثم بناء Blueprint، وبعد ذلك فقط تستخدم AI لإنشاء مسودة الأسئلة.

بعد التوليد:

راجع الدقة.

راجع الإجابات.

راجع Distractors.

تحقق من مستوى التفكير.

اختبر ارتباط كل سؤال بالهدف.

راجع الـRubric.

ولا تترك قرار التقييم النهائي للنموذج.

في عصر تستطيع فيه أدوات الذكاء الاصطناعي الإجابة عن عدد متزايد من المهام التعليمية، تصبح جودة التقييم أكثر أهمية لا أقل.

فالسؤال الذي يجب أن يطرحه المعلم لم يعد:

هل يستطيع AI إنشاء هذا الاختبار؟

بل:

هل هذا الاختبار سيكشف لي فعلًا ماذا تعلم الطالب، وكيف يفكر، وما الذي يحتاجه بعد ذلك؟

وهنا تكمن القيمة الحقيقية لاستخدام الذكاء الاصطناعي في التقييم.

EL AMIRI

عن EL AMIRI العامري باحث ومدون وصانع محتوى رقمي، يمتلك أكثر من خمس سنوات من الخبرة في مجال التدوين، إنشاء المواقع الإلكترونية وإدارة المحتوى الرقمي، مع تجربة في تطوير مواقع ومحتويات تغطي مجالات التعليم ومجالات معرفية متعددة. اهتمامه بالذكاء الاصطناعي نابع من التعلم المستمر والتجربة العملية للأدوات والتقنيات الحديثة، وليس من تخصص أكاديمي أو شهادة رسمية في المجال. لذلك يركز في عمله على فهم الأدوات من خلال الاستخدام والتجربة ومتابعة المصادر الرسمية والتحديثات الجديدة، ثم تبسيطها باللغة العربية بطريقة تساعد المستخدم على تطبيقها عمليًا. من خلال موقع EL AMIRI AI، يعمل على تقديم شروحات وأدلة وموارد حول أدوات الذكاء الاصطناعي واستخداماتها، مع اهتمام خاص بالتطبيقات المرتبطة بالتعليم والبحث والتعلم والإنتاجية. يستهدف المحتوى بشكل أساسي: المعلمين الراغبين في توظيف أدوات الذكاء الاصطناعي في التدريس وإعداد المحتوى التعليمي. الطلاب الراغبين في استخدام هذه الأدوات بطريقة تساعدهم على التعلم والبحث وتنظيم الدراسة. الباحثين المهتمين بالاستفادة من الذكاء الاصطناعي في البحث العلمي وتحليل المعلومات. صناع المحتوى والمهنيين الباحثين عن أدوات تساعدهم على تحسين الإنتاجية وجودة العمل. تعتمد فلسفة المحتوى في EL AMIRI AI على التعلم المستمر، والتجربة العملية، والرجوع إلى المصادر الرسمية كلما كان ذلك ممكنًا، مع تحديث المقالات عند تغير خصائص الأدوات أو الخدمات أو الموارد التي يتم تناولها.

اترك تعليقاً

لن يتم نشر عنوان بريدك الإلكتروني. الحقول الإلزامية مشار إليها بـ *

زر الذهاب إلى الأعلى