تبدأ مقارنة النماذج بمهمة محددة: ما الذي طلبناه، وهل استوفى الناتج المتطلبات؟ نقوم باختبار نماذج الذكاء الاصطناعي على منصة GlobalGPT باستخدام واجهة سطر الأوامر (CLI) الخاصة بـ GlobalGPT. وترد الاستثناءات في المقالة ذات الصلة.
يقوم الذكاء الاصطناعي بفحص المخرجات للتأكد من خلوها من الأخطاء ومن التزامها بالمطالبات. وعندما تجتاز المخرجات هذه الفحوصات، نقوم بمقارنة السرعة والسعر واستخدام الرموز الرقمية، حيثما ينطبق ذلك. كما يقوم المؤلفون بتقييم الجوانب الذاتية، مثل أسلوب الكتابة والجاذبية البصرية. ويتم إجراء تقييم الصوت بالكامل بواسطة الذكاء الاصطناعي باستخدام Gemini 3.6 Flash.
نحن فريق المراجعة GlobalGPT, ، وهي جزء من منهجية GlobalGPT. تغطي هذه المنهجية الاختبارات التي ننشرها في المدونة عند طرح طرازات جديدة، إلى جانب مقارنات بين الطرازات. وتشرح التقارير البحثية المستندة إلى بيانات مستخدمي GlobalGPT مجموعات البيانات الخاصة بها وأساليب التحليل التي تتبعها.
بيئة الاختبار لدينا: GlobalGPT CLI
تعد واجهة CLI GlobalGPT بيئتنا الافتراضية للاختبار. ويجب قراءة أي اختبار يستخدم واجهة مختلفة أو مسار API أو أداة برمجة أصلية في هذا السياق. فقد تختلف أسماء النماذج والإعدادات المتاحة والأدوات وحقوق الوصول باختلاف البيئات.
يختلف دور النموذج الذي يُنتج مخرجات عن دور الذكاء الاصطناعي الذي يقيّمها. فحكم المُقيّم يمثل دليلاً على المخرجات التي تم إرجاعها؛ ولا يحدد كيفية عمل النموذج الخاضع للاختبار داخليًّا.
تصميم المهام: التوجيهات والمدخلات والمتطلبات
نُكلف النماذج بمهام محددة ذات متطلبات واضحة. فقد تتطلب مهمة كتابية إعداد ملخص يستند فقط إلى الملاحظات المقدمة. وقد تتطلب مهمة برمجة دالة للتعامل مع مدخلات فارغة. وقد تتطلب مهمة تتعلق بالصور صياغة نصية محددة على ملصق.
لأغراض المقارنة، تحدد التعليمات والمواد المدخلة المهمة المطلوب من كل نموذج القيام بها. وتُعد الاختلافات في التنسيقات المدعومة أو الإعدادات أو الأدوات المتاحة أمورًا مهمة عند تفسير النتائج. فالمقارنة بين تعليمات ثابتة والبرنامج التعليمي الذي يعمل على تحسين التعليمات عبر عدة محاولات تجيبان على أسئلة مختلفة.
تقييم المخرجات: الأخطاء، والتعليمات، والكفاءة
الأخطاء والالتزام الفوري
يقوم الذكاء الاصطناعي بتقييم ما إذا كان الناتج يتوافق مع المهمة ويحتوي على أخطاء يمكن تحديدها. وقد تشمل عمليات الفحص ذات الصلة الحسابات الخاطئة، أو الادعاءات غير المدعومة، أو الحقول الناقصة، أو عدم الالتزام بالتنسيق المطلوب.
يعني «ناجح» أنه لم يتم رصد أي خطأ من خلال عمليات الفحص التي تم إجراؤها. وهذا لا يضمن خلو النتيجة من أي خطأ محتمل. فقد يتجاهل مُقيِّمو الذكاء الاصطناعي بعض الأخطاء أو يصدرون أحكامًا خاطئة.
تُعد أدلة التنفيذ جزءًا منفصلاً من التقييم. في تقريرنا اختبار خطة البرمجة الخاصة بـ كيمي, ، وأعقب الكود الذي تم إنشاؤه خمس عمليات تدقيق محلية. فقراءة الكود، وطلب فحص النموذج لإجابته بنفسه، وإجراء الاختبارات، كلها توفر أدلة مختلفة.
السرعة والسعر واستخدام الرموز الرقمية
بمجرد أن يستوفي الناتج متطلبات المهمة، تساعد الكفاءة في التمييز بين الخيارات المفيدة. فالإجابة السريعة التي تغفل حسابًا مطلوبًا لم تنجز المهمة نفسها التي أنجزتها الإجابة الصحيحة.
| القياس | كيفية قراءته |
|---|---|
| الوقت | تحقق من نافذة القياس. يشمل الوقت من الطلب حتى الإكمال المسار والمعالجة ذات الصلة؛ وهو لا يمثل بالضرورة زمن انتقال النموذج من جانب المزود. |
| استخدام الرموز الرقمية | استخدم الفئات التي تعرضها الخدمة. ولا يعني فقدان بيانات المدخلات أو المخرجات أو البيانات المخزنة مؤقتًا أو رموز الاستدلال أن الاستخدام يساوي صفرًا. |
| التكلفة | التمييز بين المبالغ المدفوعة أو المردودة المسجلة وفقًا لنظام GlobalGPT والتقديرات المستندة إلى أسعار واجهة برمجة التطبيقات (API) الخاصة بالمزود. وتُعد رسوم الاشتراك مقياسًا آخر. |
| جيل وسائل الإعلام | ضع في اعتبارك إعدادات المخرجات والائتمانات المطبقة أو الرسوم المفروضة على كل مخرج. قد لا تكون أعداد الرموز متاحة أو ذات مغزى. |
يجب أن يتضمن تقدير السعر أساسًا حسابيًا محددًا. ولا يمكن تحويل «الائتمانات» إلى دولارات دون وجود قاعدة تحويل مؤكدة، كما أن وجود حقل إجابة بقيمة صفرية وحده لا يثبت أن الطلب كان مجانيًّا.
تقييم المؤلف للمهام الذاتية
كما يقارن المؤلفون النتائج عندما تؤثر التفضيلات على الفائدة. ففيما يتعلق بالكتابة أو الصور، قد يعني ذلك توضيح أي النتيجة تتميز بلغة أوضح، أو تخطيطًا أسهل في القراءة، أو تركيبة تتناسب بشكل أفضل مع متطلبات المهمة.
لدينا مقارنة بين Seedream 5.0 Pro و GPT Image 2 يعرض صورًا مقترنة في إطار مهام محددة. تتيح الصياغة والتصميم المرئيان للقراء فرصة للتدقيق في الأمر جنبًا إلى جنب مع تفضيلات المؤلف. ويظل التفضيل الجمالي متميزًا عن المتطلبات التي يتم التحقق منها بشكل موضوعي.
تقييم الصوت باستخدام الذكاء الاصطناعي مع ذاكرة فلاش Gemini سعة 3.6
يتم إجراء تقييمات الاستماع الصوتية لدينا بالكامل بواسطة الذكاء الاصطناعي. نستخدم برنامج Gemini 3.6 Flash لتحليل الصوت الفعلي. وهذه تقييمات تعتمد على الذكاء الاصطناعي، وليست نتائج لجان استماع بشرية.
يعتمد التقييم على المهمة: سواء كانت تتعلق بالكلام المطلوب، أو اللغة، أو الأحداث الصوتية، أو التوقيت، أو البنية الموسيقية. إننا مراجعة برنامج Seed Audio 1.0 يتضمن مقاطع صوتية مُولَّدة وتحليلاً باستخدام الذكاء الاصطناعي للمحتوى والأحداث والتوقيت والآثار.
تُعتبر خصائص الملف، مثل التنسيق والمدة، أمورًا منفصلة عن التقييمات المتعلقة بالمحتوى. ولا يُثبت وجود مسار صوتي صحة الكلمات أو الأصوات المطلوبة. ويجب قراءة أي نوتة موسيقية منشورة بالاقتران مع معايير التقييم والتسجيل الصوتي الذي تصفه.
كيفية قراءة تواريخ الاختبارات والإعدادات والأدلة الناتجة
المقال الفردي هو المكان الذي يجب أن تُدرج فيه أدلة الاختبار التفصيلية. ومن السياقات المفيدة ما يلي:
- تاريخ الاختبار، ومعرّف الطراز، والبيئة.
- المهمة، والموضوع المطروح، والمواد المدخلة، والنتيجة المطلوبة.
- الإعدادات المتاحة، وعدد المحاولات، والتغييرات ذات الصلة.
- المُقيِّم، والعمليات التي تم إجراؤها للتحقق، والأسباب وراء أي تفضيل للمؤلف.
- المخرجات الفعلية أو المقتطفات، ولقطات الشاشة أو الوسائط، والسجلات المتاحة المتعلقة بالتوقيت والاستخدام والتكلفة.
تختلف السجلات باختلاف المقالات والاختبارات القديمة. ولا يمكن إعادة بناء القياسات المفقودة باعتبارها حقائق ملاحظة. ويحتوي قسم «المدونة والأدلة الإرشادية» في صفحة مجموعة النماذج على روابط للمراجعات ذات الصلة ولهذه المنهجية؛ بينما تظل المطالبات الكاملة والأدلة الناتجة متوفرة في مقالات المدونة.
تفسير محاولات الإعادة، والطلبات الفاشلة، والمراجعات
فالنتيجة الأولى، والنتيجة المختارة، والمحاولة المنقحة تنقل كل منها معلومات مختلفة للقراء. ويُعد سجل محاولات المقالة أمرًا مهمًا، بما في ذلك الأعطال الفنية، والردود الفارغة، والإجابات المبتورة، والتغييرات التي طرأت على المطالبات أو الإعدادات.
قد يُسفر الطلب الذي تم إكماله عن إجابة غير صالحة للاستخدام. وقد يكشف الطلب الفاشل عن وجود مشكلة في المسار الذي تم اختباره دون أن يُثبت وجود نقطة ضعف عامة في النموذج. تستخدم مقالاتنا نطاقات اختبار مختلفة؛ ولا يوجد عدد موحد من عمليات التشغيل أو إجراء اختبار أعمى وراء كل نتيجة.
ما الذي يمكن أن تخبرك به نتائج المهام وما الذي لا يمكنها إخبارك به
تدعم النتيجة استنتاجًا بشأن المهمة التي خضعت للاختبار، والنموذج، والتاريخ، والبيئة. ولا يمكن لمجموعات المهام الصغيرة وقياسات التوقيت الفردية أن تحدد ترتيبًا عامًّا للأداء. وإذا تم اختبار جانب واحد فقط من المقارنة، فإن هذا الدليل لا يمكن أن يدعم تحديد فائز بين النموذجين.
تُعد المواصفات الرسمية، واختبارات الأداء الخارجية، والاختبارات السابقة، والنتائج التي توصلت إليها المقالة نفسها، أنواعًا مختلفة من الأدلة. وتعتمد أي نتيجة على المقياس المحدد لها، ونظام الترجيح، والاستثناءات. وينبغي أن يتمكن القراء من ربط الاستنتاج بالأدلة، بما في ذلك النتائج الجزئية أو غير الناجحة.
كيف تختلف تحديثات المقالات عن إعادة اختبار النماذج
نقوم عادةً بمراجعة المقالات كل أسبوعين إلى أربعة أسابيع، كما هو موضح في معايير التحرير. لا يعني فحص المحتوى أنه تم إعادة تشغيل كل اختبار نموذجي.
يُعد تحديث السعر، وتصحيح تقييم أحد النتائج الحالية، وإنشاء نتيجة جديدة إجراءات منفصلة. تظل النتائج التاريخية مرتبطة بسياق الاختبار الأصلي؛ ولا يكفي مجرد تحديث تاريخ المقالة لجعلها نتائج اختبار جديدة.



