Gemini 3.6 فلاش يساوي ل الترميز المحدود، والتحليل متعدد الوسائط، وسير عمل الوكلاء الخاضعين للإشراف. توصلت مراجعة إصدار Gemini 3.6 Flash إلى أنه يمثل ترقية موثوقة مقارنةً بإصدار 3.5 Flash: فقد أشارت Google إلى انخفاض أسعار المخرجات وتحقيق نتائج أقوى في العديد من اختبارات الأداء الخاصة بالوكلاء، في حين أظهرت اختباراتنا الداخلية دقة في الاستخراج المنظم وقراءة المخططات وإصلاح الكود بشكل محدد بعد وضع حدود معقولة للمخرجات. إلا أنه ليس الحل الأمثل في جميع الحالات. فشلت مهمة الاسترجاع الاصطناعية التي تبلغ حجمها 128 كيلوبايت مرتين، كما ابتكرت خطة المتصفح المحلي للنموذج معرّف عنصر مخفي على الرغم من أنها حددت الهدف المرئي بشكل صحيح.
التوصية العملية هي إجراء تجربة تجريبية لنظام Gemini 3.6 Flash في إطار اختبارات القبول الخاصة بأحمال العمل، وقياس التكلفة الإجمالية لكل مهمة ناجحة، والحفاظ على التأكيد البشري عند تنفيذ الإجراءات التي لا رجعة فيها. تم تصنيف الأرقام الرسمية، وقياساتنا الشاملة للبوابات، ومعايير الأداء الخارجية، والتقارير الأولية على مواقع التواصل الاجتماعي الواردة أدناه بشكل منفصل، حتى لا يتم دمج الأدلة المتباينة في نتيجة واحدة.

مراجعة سريعة لجهاز Gemini 3.6 Flash: الإيجابيات والسلبيات
| الإيجابيات | السلبيات |
|---|---|
| معرّف نموذج ثابت للاستخدام في بيئة الإنتاج | لا يوجد دعم لواجهة برمجة التطبيقات المباشرة (Live API) |
| سعر بيع قياسي أقل من 3.5 فلاش | إخراج نصي فقط؛ لا يتم إنشاء صور أو ملفات صوتية أصلية |
| تحقيق مكاسب قوية في الاختبارات الرسمية DeepSWE وMLE-Bench وOSWorld، بالإضافة إلى تحسن الأداء في السياقات الطويلة | لا تضمن سعة 1 مليون توكن إمكانية استرجاع موثوقة |
| دعم واسع النطاق لوسائل النقل المتعددة والأدوات | لا يزال استخدام الكمبيوتر إحدى ميزات الإصدار التجريبي |
| لقد نجحت اختباراتنا المتعلقة بالاستخراج المحدود، والرسوم البيانية، والترميز، والإجراءات المحلية | فشل اختبارنا الخاص بالشاشة الاصطناعية ذات 128 ألف نقطة وثماني إبر مرتين |
| تتيح خدمات «Batch/Flex» ومستوى «Flash-Lite» الأقل تكلفة تنفيذ استراتيجيات التوجيه | يمكن أن تستهلك رموز الاستدلال حدودًا قصوى للإخراج ضيقة بشكل مدهش |
جدول المحتويات
ما هو Gemini 3.6 Flash؟
يُعد Gemini 3.6 Flash نموذجًا مستقرًا من Google مخصصًا لأحمال العمل الإنتاجية التي تتطلب قدرًا أكبر من الاستدلال واستخدام الأدوات مقارنةً بطبقة الاستدلال الخفيفة، دون الحاجة إلى الانتقال إلى فئة الأسعار الخاصة بالنماذج الرائدة. تصف Google هذا النموذج بأنه «الحصان العامل» في مجالات البرمجة، والأعمال المعرفية، والفهم متعدد الوسائط، والتنفيذ التفاعلي. معرّف النموذج الإنتاجي هو gemini-3.6-flash. الصفحة الرسمية للطراز على موقع جوجل يُدرجها على أنها متاحة للجميع.
يقبل النموذج مدخلات النصوص والصور والمقاطع الصوتية ومقاطع الفيديو وملفات PDF. ويُرجع النصوص وبيانات JSON المنظمة واستدعاءات الدوال أو الأدوات، لكنه لا يُنتج الصور أو المقاطع الصوتية بشكل أصلي. ويُعد هذا التمييز مهمًا عند مقارنة الادعاءات العامة المتعلقة بـ“الوسائط المتعددة”: ففهم تنسيقات المدخلات المتعددة يختلف عن إنتاج وسائط إخراج متعددة.
جوجل بطاقة طراز Gemini 3.6 فلاش يحدد تاريخ مارس 2026 كموعد نهائي لتحديث المعرفة، ويشير إلى أن النموذج يعتمد على Gemini 3.5 Flash. وتُستمد تفاصيل البنية والتدريب في الغالب من مصادر مرجعية بدلاً من الكشف عنها لأول مرة، لذا يمكن للمشترين تقييم السلوك الموثق والتقييمات المنشورة، لكن لا يمكنهم إعادة بناء صيغة التدريب.
تعد مجموعة الأدوات الواسعة عنصراً أساسياً في تحديد الموقع. تسرد الصفحة الرسمية للنموذج استدعاء الوظائف، والمخرجات المنظمة، وتنفيذ التعليمات البرمجية، والبحث عن الملفات، وسياق عناوين URL، وتخزين السياق مؤقتًا، والارتكاز على بحث Google، والارتكاز على خرائط Google، والتفكير، واستخدام الكمبيوتر. يجب أن يقيّم قرار الإنتاج الحلقة بأكملها — شكل الطلب، وتتبع الأداة، ومحاولات الإعادة، والتحقق من الصحة، والمراجعة البشرية — وليس مجرد جودة إجابة واحدة.
ويفسر هذا الدور الأساسي أيضًا محور تركيز المراجعة: يبلغ برنامج «3.6 Flash» ذروة إثارة الاهتمام عندما يشارك في سير عمل أحد التطبيقات، بدلاً من مجرد الاستجابة لطلبات بسيطة ومعزولة. وترتبط قيمته بمدى قيام النظام المحيط بتقييد الأدوات، واكتشاف حالات الاقتطاع، والتحقق من المخرجات، وتوجيه المهام الأبسط إلى مستوى أقل تكلفة.
تتيح ميزة «استخدام الكمبيوتر» لأي تطبيق إرسال لقطات شاشة وتلقي الإجراءات المقترحة لبيئات المتصفح أو الأجهزة المحمولة أو أجهزة سطح المكتب. ويظل العميل هو المسؤول عن تنفيذ الإجراء، وتوفير لقطة الشاشة التالية، وتطبيق السياسات. وتُطلق «جوجل» على هذه الميزة اسم «المعاينة»، وتوصي بالإشراف على الأعمال الحساسة أو التي لا يمكن التراجع عنها في وثائق استخدام الكمبيوتر.
Gemini 3.6 مواصفات وإمكانيات ذاكرة الفلاش
| المواصفات | Gemini 3.6 فلاش |
|---|---|
| معرّف النموذج | gemini-3.6-flash |
| حالة الإصدار | مستقر / متاح بشكل عام |
| السياق الأقصى للإدخال | 1,048,576 توكن |
| القدرة القصوى | 65,536 توكن |
| طرائق الإدخال | نص، صورة، صوت، صوت، فيديو، PDF |
| طريقة الإخراج | النص |
| مستوى التفكير الافتراضي | متوسط |
| قطع المعرفة | مارس 2026 |
| واجهة برمجة التطبيقات المباشرة | غير مدعوم |
| استخدام الكمبيوتر | مدعوم في الإصدار التجريبي |
| واجهة برمجة التطبيقات المجمعة | مدعوم على مستوى النموذج؛ ولم يتم دعمه بعد عبر واجهة برمجة التطبيقات (API) الخاصة بالتفاعلات |
يُعد الحد الأقصى للسياق البالغ 1,048,576 رمزًا سعةً قصوى، وليس وعدًا بإمكانية استرجاع كل حقيقة بشكل موثوق. وهذا موضوع متكرر في كل من اختبارات الأداء الخاصة بـ«جوجل» للسياقات الطويلة واختبار البوابة الاصطناعية الذي أجريناه. يظل الاسترجاع، والتقسيم إلى أجزاء، وفهارس الوثائق، والملخصات، والاستشهادات بالمصادر مفيدًا حتى عندما يتسع المجموع الكامل من النصوص تقنيًّا في طلب واحد.
يُعد الحد الأقصى للإخراج البالغ 65,536 رمزًا سخيًا، لكن التطبيقات الفعلية غالبًا ما تضع حدًا أقصى أقل مراعاةً للتكلفة وزمن الاستجابة. وقد كشفت اختباراتنا كيف أن الحد الأقصى الذي يبدو كافيًا للإجابة الظاهرة يمكن أن تستهلكه رموز الاستدلال الداخلية. لذا، يجب التحقق من سبب الإنهاء الفعلي ومحتواه، بدلاً من اعتبار استجابة HTTP 200 بمثابة نجاح للمهمة.
Gemini 3.6 أسعار فلاش
الأسعار الرسمية المدفوعة وفقًا للخطة القياسية هي $1.50 لكل مليون توكن مدخل و $7.50 لكل مليون توكن مُصدر. تشمل فواتير المخرجات «الرموز التفكيرية». ويؤدي الاستدلال الدفعي والمرن إلى خفض أسعار هذه الرموز إلى النصف، بينما يطبق الاستدلال ذو الأولوية علاوة بنسبة 80%. تأكد دائمًا من صفحة أسعار واجهة برمجة التطبيقات (API) لـ Gemini قبل وضع توقعات لميزانية الإنتاج.
| وضع الاستهلاك | المدخلات / 1 مليون توكن | الإنتاج / 1 مليون توكن |
|---|---|---|
| قياسي | $1.50 | $7.50 |
| دفعة | $0.75 | $3.75 |
| فليكس | $0.75 | $3.75 |
| الأولوية | $2.70 | $13.50 |
يبلغ سعر التخزين المؤقت للسياق $0.15 لكل مليون رمز إدخال مخزّن مؤقتًا في الفئة المدفوعة «قياسية»، بالإضافة إلى $1.00 لكل مليون رمز في الساعة لتخزين ذاكرة التخزين المؤقت. يمكن أن يقلل التخزين المؤقت من رسوم الإدخال المتكرر، لكن ذاكرة التخزين المؤقت الكبيرة التي يتم الاحتفاظ بها لفترة أطول من اللازم تصبح مركز تكلفة بحد ذاتها. قارن فاتورة التخزين المؤقت مع إعادة الاستخدام التي تم تحقيقها فعليًّا.
يتم قياس «التأسيس» بوحدة مختلفة. تتيح «جوجل» 5,000 موجه «التأسيس» شهريًّا في «جوجل بحث» أو «خرائط جوجل» مجانًا، يتم توزيعها على نماذج Gemini 3، يليها $14 لكل 1,000 استعلام بحث. قد تصدر موجهة واحدة أكثر من استعلام واحد، لذا فإن تكلفة الرمز المميز وحدها قد تقلل من تقدير تكلفة سير العمل المرتبط بالموقع.
مثال على التسعير القياسي لـ $2.25
الطلب الذي يستهلك 1,000,000 وحدة إدخال وينتج 100,000 وحدة إخراج يكلف $1.50 للإدخال بالإضافة إلى $0.75 للإخراج، أو $2.25 في الوضع القياسي. ويستبعد هذا المثال البسيط تخزين البيانات في ذاكرة التخزين المؤقت، وعمليات التحقق من صحة الاستعلامات، وعمليات إعادة المحاولة، والأدوات الخارجية، والمحاولات الفاشلة.
كما أفادت «جوجل» أن إصدار Gemini 3.6 Flash استخدم عددًا أقل من الرموز الناتجة بمقدار 17% مقارنةً بإصدار 3.5 Flash في «مؤشر التحليل الاصطناعي»، كما احتاج إلى عدد أقل من خطوات الاستدلال واستدعاءات الأدوات في سير العمل متعدد الخطوات. وهذه ملاحظة رسمية تعتمد على حجم العمل، وليست توفيرًا مضمونًا بمقدار 17% لكل تطبيق. قم بقياس الرموز لكل مهمة ناجحة باستخدام المطالبات الخاصة بك.

اختبارات أداء ذاكرة الفلاش Gemini 3.6: ما أوردته «جوجل»

تُظهر المقارنات الرسمية التي أجرتها «جوجل» المكاسب الأكثر وضوحًا في مجالات البرمجة التفاعلية، وهندسة التعلم الآلي، والتفاعل مع الحاسوب، واسترجاع السياقات الطويلة. ويُعد «Gemini 3.5 Flash» المعيار الأساسي الأكثر فائدة، لأن «جوجل» قامت بتقييم كلا النموذجين ضمن نفس عائلة بطاقات النماذج. وهذه القيم هي نتائج «جوجل»، وليست قياسات مستمدة من نظام الاختبار الخاص بنا.
| معيار | Gemini 3.6 فلاش | وميض الجوزاء 3.5 فلاش Gemini 3.5 | الفرق المُبلغ عنه |
|---|---|---|---|
| SWE-Bench Pro العام | 58.7% | 55.1% | +3.6 نقطة |
| DeepSWE الإصدار 1.1 | 49.0% | 37.0% | +12.0 نقطة |
| المنضدة الطرفية 2.1 | 78.0% | 76.2% | +1.8 نقطة |
| MLE-Bench | 63.9% | 49.7% | +14.2 نقطة |
| GDPval-AA الإصدار 2 | 1,421 نقطة إيلو | 1,349 نقطة إيلو | +72 نقطة إيلو |
| تم التحقق من عالم الأو إس دبليو إس وورلد | 83.0% | 78.4% | +4.6 نقطة |
حقق DeepSWE تحسناً بمقدار 12.0 نقطة مئوية، بينما حقق MLE-Bench تحسناً بمقدار 14.2 نقطة. وبلغت الزيادة في OSWorld-Verified 4.6 نقاط، في حين سجل كل من SWE-Bench Pro Public وTerminal-Bench تحسناً أكثر تواضعاً. والادعاء الذي يمكن الدفاع عنه هو أن الإصدار 3.6 يحسن أداء العديد من أحمال العمل المتعلقة بالوكلاء مقارنة بالإصدار 3.5، وليس أنه يتفوق على كل نموذج أو معيار تقييم للبرمجة.
كما تشير «جوجل» إلى انخفاض عدد التعديلات غير المرغوب فيها على الكود، وتقصير مدة حلقات التنفيذ. وقد تكون هذه السلوكيات أكثر أهمية من التغير الطفيف في معدل النجاح في أعمال المستودع؛ لأن التغييرات غير الضرورية تزيد من تكلفة المراجعة، كما أن الحلقات المتكررة تستهلك الرموز. ولا تزال هذه الأمور تتطلب قياسًا على مستوى التطبيق؛ فمعيار الأداء الإجمالي لا يمكنه تحديد السلوك في قاعدة كود معينة.
النتائج متعددة الوسائط وذات السياق الطويل
في اختبار CharXIV الخاص بالاستدلال على المخططات المعقدة، سجلت Google نتيجة 85.2% بدون أدوات و89.4% باستخدام الأدوات لنموذج Gemini 3.6 Flash. أما Gemini 3.5 Flash فقد سجل 84.2% و84.9% على التوالي. ويدعم الفارق الأكبر الذي تحقق بمساعدة الأدوات مكانة النموذج في تفسير المخططات وسير العمل متعدد الوسائط، مع عدم قياس الذوق البصري أو جودة تصميم الواجهة الأمامية.
| اختبار السياق الطويل لـ GDM-MRCR الإصدار 2 | Gemini 3.6 فلاش | وميض الجوزاء 3.5 فلاش Gemini 3.5 |
|---|---|---|
| 128 كيلوبايت، بمتوسط 8 إبر | 91.8% | 77.3% |
| 1M، 8 إبر، نقطة بنقطة | 54.0% | 26.6% |

تُعد نتيجة 1M تحسناً نسبياً كبيراً، لكن 54.0% لا تشكل أساساً للاسترجاع الأعمى للحقائق الحاسمة. ولا يزال يتعين على أنظمة الإنتاج تقسيم الوثائق إلى أجزاء، والاحتفاظ بمصدرها، وطلب الإشارة إلى المصادر. فشل اختبارنا الاصطناعي المنفصل الذي أجري على 128 ألف وثيقة، لكنه استخدم مهمة ومسار بوابة مختلفين، ولا يمكن أن يحل محل نتيجة Google.

اختباراتنا العملية لجهاز Gemini 3.6 Flash
قمنا بتشغيل مجموعة أدوات قياس حتمية خاصة بنا في 22 يوليو 2026. وجميع أوقات الاستجابة المبلغ عنها هي زمن الاستجابة الإجمالي بما في ذلك البوابة, ، لذا فإنه يشمل وقت الاستجابة الإضافي الناتج عن بروتوكول «برولي»، ولا يجب اعتباره زمن انتقال مباشر لواجهة برمجة تطبيقات جوجل.
لم يتم قياس وقت الانتهاء (TTFT)، بما في ذلك اختبار البث المباشر. قمنا بتسجيل إجمالي الوقت المنقضي، ورموز المطالبة، ورموز الإكمال، ورموز الاستدلال، ورموز التخزين المؤقت، وإجمالي الرموز، وسبب الإنهاء، ومحاولات إعادة التنفيذ، والتحقق من الصحة، والتكلفة التقديرية بناءً على أسعار الرموز القياسية الرسمية. وكانت رموز الاستدلال مدرجة بالفعل في رموز الإكمال، كما كانت رموز التخزين المؤقت مدرجة بالفعل في رموز المطالبة.
تضمنت الفعالية بأكملها ما يلي: 12 استدعاءً منطقيًّا لواجهة برمجة التطبيقات (API) و 14 محاولة HTTP. وظلت الجولة الأولية $0.244491, ، وبلغ مجموع الحلقات الثلاث المعاد بثها $0.0520416, ، وكان التقدير التراكمي المصحح هو $0.2965326. وبعد استبدال سجلين أوليين كان من الواضح أنهما مقطوعان بنسخهما المستهدفة، كانت النتيجة المجمعة كما يلي: 7 تم اجتيازها، و1 فشلت، و1 لم تكن مدعومة.
تُطبق تقديرات التكلفة على النحو التالي: $1.50/M لرموز المطالبة غير المخزنة في ذاكرة التخزين المؤقت، و$0.15/M لرموز المطالبة المخزنة في ذاكرة التخزين المؤقت، و$7.50/M لرموز الإخراج. في إعادة التشغيل ذات السياق الطويل، تم تقسيم 128,248 رمز موجه إلى 5,464 رمزًا غير مخزّن في ذاكرة التخزين المؤقت و122,784 رمزًا مخزّنًا في ذاكرة التخزين المؤقت؛ وتؤدي إضافة 2,048 رمز إخراج إلى إنتاج $0.0419736. تبلغ سعة التخزين المؤقت $1.00/مليون رمز/ساعة، لكنها مستبعدة لأن مدة التخزين لم تُقاس.
هذه اختبارات تشخيصية تُجرى على عينات صغيرة، وليست معيارًا ذا قوة إحصائية. وهي مفيدة لأن المعلمات الثابتة والقيم المتوقعة وأدوات التحقق وحدود الطلبات وحالات الفشل يتم الحفاظ عليها. وينبغي أن تُستخدم كدليل لإجراء اختبارات متابعة في بيئة عمل حقيقية، لا أن تصبح مقياسًا عامًا للجودة.
| سجل المهام النهائي | النتيجة | الوقت الشامل للبوابة | الرموز P / C / R / المخزنة مؤقتًا / الإجمالي | التكلفة التقديرية |
|---|---|---|---|---|
| الإجابة الدقيقة، 3.6 | تخطي | 2.938 ثانية | 5 / 119 / 118 / 0 / 124 | $0.0009 |
| الاستخراج المنظم، إعادة التشغيل 3.6 | تخطي | 3.919 ثانية | 55 / 453 / 411 / 0 / 508 | $0.00348 |
| الاستخراج المنظم، 3.5 | تخطي | 3.113 ثانية | 56 / 378 / 324 / 0 / 434 | $0.003486 |
| رؤية الرسم البياني، إعادة التشغيل 3.6 | تخطي | 4.884 ثانية | 1,127 / 653 / 520 / 0 / 1,780 | $0.006588 |
| إصلاح الأخطاء البرمجية، 3.6 | تخطي | 5.553 ثانية | 602 / 1,150 / 930 / 0 / 1,752 | $0.009528 |
| إصلاح الأخطاء البرمجية، 3.5 | تخطي | 6.860 ثانية | 603 / 1,332 / 1,058 / 0 / 1,935 | $0.0128925 |
| 128 كيلوبايت، ثماني إبر، 3.6 إعادة تشغيل | فشل | 11.366 ثانية | 128,248 / 2,048 / 0 / 122,784 / 130,296 | $0.0419736 |
| خطة العمل المحلية المتعلقة بالمتصفح، 3.6 | تخطي | 5.305 ثانية | 1,153 / 643 / 573 / 0 / 1,796 | $0.006552 |
برولي /الردود تحويل ملفات PDF | غير مدعوم | 2.423 ثانية | 0 / 0 / 0 / 0 / 0 | $0 |
البث المباشر، والإخراج المنظم، وقراءة الرسوم البيانية
طلبت مهمة التدفق الإجابة المرئية الدقيقة حسناً. Gemini 3.6 قدمت «فلاش» الإجابة الصحيحة في غضون 2.938 ثانية، باستخدام 5 رموز للمطالبة، و119 رمزًا للإكمال، و118 رمزًا للاستدلال، و124 رمزًا إجماليًّا، بمعدل تقديري يبلغ $0.0009. التفصيل اللافت للنظر هو أن الاستدلال استهلك 118 من أصل 119 رمز إكمال، مما يوضح لماذا قد يؤدي الحد الأقصى الصغير للمخرجات إلى عدم ظهور أي إجابة مرئية.
استخدم أول استدعاء لعملية الاستخراج المنظم 3.6 حدًا أقصى للإخراج يبلغ 512 رمزًا وانتهى عند finish_reason=الطول باستخدام JSON مقطوع. وقد اعتبرنا ذلك حدًا فنيًّا، وليس حكمًا على الجودة، وقمنا بإعادة تنفيذ تلك المهمة وحدها عند 2,048 رمزًا. اجتازت عملية إعادة التشغيل المستهدفة التحقق الدقيق من الحقول في 3.919 ثانية مع P55/C453/R411/T508 و$0.00348 تقديريًا.
نجح نموذج Gemini 3.5 Flash في اجتياز عملية الاستخراج نفسها في المرة الأولى التي تم تشغيله فيها خلال 3.113 ثانية باستخدام P56/C378/R324/T434 وقيمة تقديرية تبلغ $0.003486. لا يمكن تحديد الفائز من حيث زمن الاستجابة بناءً على تجربة واحدة لكل تكوين. لكن هذا يوضح أنه ينبغي ضبط حدود المخرجات واستخدام الاستدلال لكل نموذج على حدة بدلاً من نسخها بشكل أعمى.
كما تم قطع عملية قراءة المخطط 3.6 عند حد أقصى أولي قدره 768 توكن. وعند 2,048 توكن، قرأت عملية إعادة التشغيل المستهدفة جميع القيم المعيارية الثمانية بالضبط في 4.884 ثانية، باستخدام P1,127/C653/R520/T1,780 و$0.006588 تقديريًا. وقام المُثبت بمقارنة كل قيمة مُرجعة بملف مرجعي ثابت.
تصحيح الأكواد: حصل كلا الطرازين على تقييم 5/5
بدأت كلتا مهمتي البرمجة من نسخ منفصلة لنفس البرنامج النموذجي بلغة بايثون، مع خط أساس يبلغ 3/5 من الاختبارات الناجحة. أنتج Gemini 3.6 Flash إصلاحًا مركّزًا وقابلًا للاستخدام في 5.553 ثانية، مع P602/C1,150/R930/T1,752 و$0.009528 تقديريًا. أدى تطبيق الناتج إلى رفع معيار البرنامج إلى 5/5، بينما ظل التجزئة لملف الاختبار دون تغيير.
كما أنتج Gemini 3.5 Flash إصلاحًا مركّزًا بلغت درجته 5/5، في 6.860 ثانية مع قيم P603/C1,332/R1,058/T1,935 وقيمة تقديرية تبلغ $0.0128925. وقد أضافت نصًا حول الكود المحاط بسياج على الرغم من تعليمات عدم إضافة نص، لذا احتاجت مجموعة الاختبارات إلى استخراج متسامح للكود المحاط بسياج قبل التحقق من الصحة في وضع عدم الاتصال. وكان كلا الإصلاحين قابلين للاستخدام؛ لكن انضباط المخرجات اختلف.
يُفضل هذا الاختبار أعمال الإصلاح المحدودة النطاق باستخدام الاختبارات الوحدوية الحتمية. وهو لا يقيس التنقل داخل المستودع، أو التغييرات المعمارية التي تشمل ملفات متعددة، أو التشغيل الذاتي لفترات طويلة، أو مدى قدرة النموذج على تصميم اختبار تمييزي من الصفر. فهذه الأبعاد تتطلب تجهيزات ومعايير فشل منفصلة.
فشل استرجاع البيانات الاصطناعية ذات السعة 128 كيلوبايت
تضمنت تعليماتنا التي يقترب حجمها من 128 ألفًا ثمانية معرّفات حتمية ضمن سياق اصطناعي واسع، وتطلبت استرجاعًا دقيقًا بتنسيق JSON. وقد فشل جهاز Gemini 3.6 Flash مرتين، حيث أعاد كودًا وملفات HTML غير ذات صلة بدلاً من القيم الثماني المطلوبة. ولم يؤد رفع الحد الأقصى للإخراج إلى تصحيح هذا السلوك.
استغرقت عملية إعادة التشغيل 11.366 ثانية وأظهرت القيم التالية: P128,248/C2,048/R0/Cached122,784/T130,296، ما يُقدَّر بـ $0.0419736 بعد تعديل المدخلات المخزنة مؤقتًا، و finish_reason=الطول. هذا هو لا يمكن مقارنتها مباشرةً بنظام GDM-MRCR الخاص بشركة جوجل النتيجة: تختلف مهمتنا، وبناء المطالبة الدقيقة، ومقياس السياق، وتنسيق المخرجات، ومسار بوابة «برولي» عن بعضها البعض.
لا يزال هذا الفشل ذا صلة من الناحية التشغيلية. فهو يشير إلى أن هذا الطلب الاصطناعي المحدد لم ينجح في المرور عبر مسارنا في محاولتين، لذا لن نقوم بإرسال النمط نفسه دون إجراء عملية استرجاع، واختيار سياق أكثر دقة، والتحقق من صحة الاستجابة، ومعالجة الحل البديل. ولا يلغي هذا الفشل معيار جوجل المرجعي، ولا يثبت وجود قيود عامة عند 128 كيلوبايت.
مجموعة إجراءات المتصفح المحلية: الهدف الصحيح، المعرّف المُختلق
قام النموذج بفحص لقطة شاشة لصفحة محلية خاضعة للرقابة، وتمكّن من تحديد النص المستهدف الظاهر بشكل صحيح، وهو “فتح تقرير الاستخدام”. واقترح الإجراء التالي انقر لكنه ابتكر معرّفًا خفيًّا،, فتح تقرير الاستخدام, ، بدلاً من معرّف DOM الفعلي الاستخدام. قام نظام التوصيل بتحديد النص المرئي الفريد والدقيق بدلاً من الاعتماد على المعرّف المُختلق.
استغرقت عملية استدعاء الخطة 5.305 ثوانٍ مع P1,153/C643/R573/T1,796، وبلغت تكلفتها التقديرية $0.006552. تم النقر مرة واحدة على عنصر ثابت محلي في Chrome، مما أدى إلى تغيير الحالة من جاهز إلى فتح التقرير. كان هذا استخدام الكمبيوتر Gemini غير الأصلي; ؛ فهي لم تقم بأي إجراء خارجي، ولم تقدم أي نموذج، ولم تغير أي حالة خارجية.


النتيجة في ملف PDF هي وجود قيود على مسار البوابة
«برولي» /الردود أرجع مسار تحويل ملف PDF رمز خطأ HTTP 500 مع الرمز فشل تحويل الطلب و«رسالة» لم يتم تنفيذه. قام الاستدعاء المنطقي بثلاث محاولات HTTP لأن السجل يتضمن محاولتين إضافيتين، ثم توقف دون استخدام رمز أو تكبد أي تكلفة. ونصنف هذا المسار على أنه غير مدعوم.
هذه النتيجة لا يدل ذلك على أن Gemini يفتقر إلى دعم ملفات PDF. تذكر وثائق نموذج Google إمكانية إدخال ملفات PDF؛ لكن طلبنا فشل قبل ظهور استجابة مرئية من النموذج على مسار تحويل بوابة متوافق مع OpenAI. ولا يزال من الضروري إجراء فحص أصلي عبر Google AI Studio أو واجهة برمجة تطبيقات Gemini قبل نشر أي استنتاج بشأن السلوك الأصلي لملفات PDF.
لا تزال هناك حاجة إلى مراجعة المحرر: قم بتشغيل مهمة ملف PDF عبر Google AI Studio الأصلي أو واجهة برمجة التطبيقات (API) Gemini، ثم قم بالتقاط الصورة الكاملة للموجه، واستجابة النموذج، ولوحة الاستخدام، ودليل الاستشهاد بالصفحة. وإلى أن تتوفر تلك اللقطات، يقتصر هذا التقييم على الإبلاغ عن فشل تحويل «برولي» فقط، ولا يقدم أي ادعاءات بشأن أداء ملفات PDF الأصلية.
Gemini 3.6 الوصول إلى واجهة برمجة تطبيقات فلاش (Flash API) والكود
يتوفر نموذج Gemini 3.6 Flash في Google AI Studio وواجهة برمجة تطبيقات المطورين Gemini تحت معرّف النموذج المستقر gemini-3.6-flash. توصي «جوجل» باستخدام الإصدار الأحدث واجهة برمجة تطبيقات التفاعلات بالنسبة للمشاريع الجديدة التي تعتمد على الوكالة، في حين أن المشاريع القائمة إنشاء المحتوى لا تزال الواجهة مدعومة وتغطي ميزات مهمة لم يتم عرضها بعد من خلال «التفاعلات».
لغة بايثون مع حزمة أدوات التطوير الرسمية (SDK) لـ Google Gen AI
يقوم العميل بقراءة بيانات الاعتماد من تكوين البيئة المدعومة؛ لذا تجنب تضمين المفتاح في الكود بشكل ثابت أو نشره. ويتجنب المثال عمدًا حقول العينات التي تم إهمالها ويستخدم النسخة الرسمية من Google google-genai إنشاء_المحتوى الطريقة. أضف المخططات وإعدادات الأمان والأدوات فقط حسب ما يتطلبه عبء العمل.
جافا سكريبت مع @google/genai
لضمان الاستخدام الموثوق به في بيئة الإنتاج، يجب التحقق من صحة البنية المُرجعة، وفحص أسباب الإنهاء، وتسجيل استدعاءات الأدوات، والتمييز بين نجاح عملية النقل ونجاح المهمة. ولا يُعد الرد 200 الذي يحتوي على JSON مقطوع أو إجراء غير مدعوم نتيجة عمل ناجحة.
واجهة برمجة التطبيقات (API) للتفاعلات أم إنشاء المحتوى؟
تضيف واجهة برمجة التطبيقات (API) الخاصة بـ «Interactions» حالة اختيارية من جانب الخادم من خلال معرّف_التفاعل_السابق, ، وخطوات التنفيذ المرئية، والتنفيذ في الخلفية للمهام الأطول. ويُعد هذا الخيار جذابًا لدورات الوكلاء الجديدة لأن تتبعات الحالة والأدوات تُعد مفاهيم من الدرجة الأولى. يرجى مراجعة إعدادات التخزين والاحتفاظ بالبيانات قبل استخدامه مع محتوى حساس.
احتفظ بـ إنشاء المحتوى عندما تصبح واجهة ميزاته المتطورة أكثر ملاءمةً للتطبيق. ووفقًا لوثائق جوجل الصادرة في يوليو 2026، فإن «Interactions» لا توفر حتى الآن واجهة برمجة التطبيقات (API) للدُفعات، أو التخزين المؤقت الصريح، أو إعدادات الأمان المخصصة، أو البيانات الوصفية للفيديو، أو الاستدعاء التلقائي لوظائف Python. ويُعد دعم النماذج ودعم واجهة برمجة التطبيقات مسألتين منفصلتين.
Gemini 3.6 التغييرات المتعلقة بترحيل واجهة برمجة تطبيقات Flash
الانتقال من أشكال الطلبات السابقة لا يقتصر على مجرد تغيير اسم النموذج. جوجل دليل الترحيل إلى أحدث إصدار توثيق المعلمات وأنماط التحويل التي أصبحت قديمة أو يتم تجاهلها أو رفضها. تعامل مع عملية الترحيل على أنها تغيير في عقد الطلب وسلامة الحالة.
إزالة عناصر التحكم التي لم تعد مستخدمة وملء الحقول مسبقًا
إزالة درجة الحرارة, top_p, و top_k. تقول «جوجل» إنها أصبحت قديمة ويتم تجاهلها في هذه النماذج، ومن المتوقع أن تعرض الأجيال المستقبلية رمز الخطأ HTTP 400 عند استخدامها. نموذج قديم درجة الحرارة: 0 لا ينبغي اعتبار هذا المجال ضمانة للحتمية.
كما لا يجوز أن تنتهي الطلبات بملء مسبق غير فارغ لدور النموذج. وقد تؤدي أنماط مثل إضافة “Translation:” أو القوس المفتوح لـ JSON إلى دور النموذج إلى ظهور خطأ HTTP 400. استبدل الملء المسبق بتعليمات النظام، والمخرجات المنظمة، والمخططات الصريحة، وأدوات التحقق من الصحة.
استبدال القيمة الرقمية التفكير في الميزانية عناصر التحكم مع مستوى_مستوى_التفكير enum; Gemini 3.6 يتم تعيين الإعدادات الافتراضية لـ Flash إلى متوسط. إزالة عدد_المرشحين, ، وهو ما لا يدعمه Gemini 3.x، وتنفيذ بدائل على مستوى التطبيق إذا كانت هناك حاجة حقيقية إلى استراتيجيات بديلة متعددة.
الحفاظ على حالة استدعاء الدالة
تتطلب سير عمل الأدوات أن تكون معرّفات الاستدعاءات وأسماء الدوال وتوقيعات التفكير وترتيب الأدوار سليمة. عند استخدام إنشاء المحتوى, ، كل استجابة الدالة ينبغي أن تتضمن رقم المكالمة و الاسم. اختبار المكالمات التي تحتوي على أخطاء في التنسيق، وإدراج نص توضيحي قبل عرض نتائج الأداة، والتعافي من حالات رفض الأدوات أو عدم توفرها.
- قم بتغيير معرّف النموذج المستهدف إلى
gemini-3.6-flash. - إزالة
درجة الحرارة,top_p,top_k, وعدد_المرشحين. - استبدال
التفكير في الميزانيةمعمستوى_مستوى_التفكير. - إلغاء الملء المسبق لـ «model-turn».
- الحفاظ على معرّفات استدعاءات الوظائف، والأسماء، وتوقيعات الأفكار، وترتيب الأدوات.
- التحقق من صحة أسباب الإنهاء، والمخططات، ومحاولات الإعادة، وكل ادعاء بالنجاح.
- أعد حساب التكلفة لكل مهمة ناجحة، بما في ذلك المكالمات والأدوات التي باءت بالفشل.
- قم بإجراء اختبارات حقن الأوامر واختبارات الإجراءات التدميرية قبل استخدام الكمبيوتر.

Gemini 3.6 Flash مقابل 3.5 Flash وFlash-Lite
يُعد Gemini 3.6 Flash المرشح المباشر للترقية من Gemini 3.5 Flash. ويظل سعر الإدخال القياسي عند $1.50 لكل مليون توكن، بينما ينخفض سعر الإخراج من $9.00 إلى $7.50— وهو انخفاض قدره 16.7% قبل أخذ تقرير Google المنفصل في الاعتبار، والذي أشار إلى انخفاض استخدام الرموز الناتجة في إحدى التقييمات.
| الفئة | Gemini 3.6 فلاش | وميض الجوزاء 3.5 فلاش Gemini 3.5 |
|---|---|---|
| الإدخال القياسي / 1M | $1.50 | $1.50 |
| الإخراج القياسي / 1M | $7.50 | $9.00 |
| DeepSWE الإصدار 1.1 | 49.0% | 37.0% |
| MLE-Bench | 63.9% | 49.7% |
| تم التحقق من عالم الأو إس دبليو إس وورلد | 83.0% | 78.4% |
| 1M GDM-MRCR الإصدار 2 | 54.0% | 26.6% |
| إصلاح الكود المحدود لدينا | 5/5 بعد الإصلاح | 5/5 بعد الاستخلاص المتسامح |
تكون حجة «الهجرة» في أقوى حالاتها عندما تؤدي درجات «الوكالة» الأفضل، وأسعار المخرجات الأقل، والحلقات الأقصر إلى تحقيق عمل أكثر نجاحًا مقابل كل دولار. وتكون في أضعف حالاتها عندما يؤدي استخدام مستودع أو أداة معينة إلى تنفيذ غير مكتمل، أو تحقق خاطئ، أو تصحيح بشري متكرر. قم بتشغيل المطابقات باستخدام نفس الأدوات واختبارات القبول.
الأماكن التي يتناسب معها جهاز Gemini 3.5 Flash-Lite
Gemini 3.5 فلاش-لايت هو نسخة أقل تكلفة مخصصة لعمليات الاستخراج عالية الإنتاجية، والتصنيف، والترجمة، والتوجيه، ومعالجة المستندات، وأعمال الوكلاء الفرعيين المحدودة. الأسعار القياسية هي $0.30 لكل مليون رمز إدخال و$2.50 لكل مليون رمز إخراج. وهذا يجعل 3.6 Flash أغلى بخمس مرات في الإدخال وأغلى بثلاث مرات في الإخراج.
يمكن لموجه ذي مستويين توجيه المهام المؤهلة افتراضيًّا إلى «Flash-Lite»، وتحويل المهام ذات الثقة المنخفضة، أو التي تتطلب أدوات كثيرة، أو متعددة الوسائط، أو ذات الأفق الزمني الطويل إلى «3.6 Flash». يجب أن يكون الموجه قابلاً للمراقبة وقابلاً للعكس، مع تسجيل الأسباب وتضمين كل من تكلفة إعادة المحاولة وتكلفة التصحيح. ولا تعني الرموز الأرخص تلقائيًّا مهام مكتملة أرخص.

ردود فعل المستخدمين في المراحل المبكرة ونتائج الجهات الخارجية
كان الإصدار Gemini 3.6 Flash قد تم إطلاقه للجمهور منذ يوم واحد تقريبًا عندما تم التقاط هذه اللقطات في 22 يوليو 2026. المنشورات هي حكاية اجتماعية أدلة، وليست استطلاعاً تمثيلياً، كما أن تصنيفات المنصات هي اختبار أداء من جهة خارجية الأدلة بدلاً من نتائج «جوجل» أو قياساتنا. وهي مفيدة في تحديد الفرضيات التي يجب اختبارها.
إشارات واعدة من المتصفح والواجهة الأمامية، مع بعض التحفظات
أفادت «Arena.ai» أن «Gemini 3.6 Flash» احتل المرتبة 12 في مسابقة «Frontend Code Arena» برصيد 1,537 نقطة، بعد أن كان قد احتل المرتبة 21 في النسخة السابقة «Gemini 3.5 Flash». تعكس هذه النتيجة المطالبات والمصوتين ولقطة النموذج وطريقة التصنيف التي تتبعها Arena. وهي تدعم فرضية تحسين الواجهة الأمامية، لكنها لا تثبت جودة الكود بشكل عام.

أبلغ موقع «Browser Use» عن تحقيق النموذج 68% في اختبار «BU Benchmark» الخاص به، ووصف هذا النموذج بأنه أفضل خيار من حيث نسبة السعر إلى الأداء بين وكلاء المتصفح. وهذا اختبار أداء أعده المورد نفسه، وليس تقييمًا محايدًا من قبل القطاع. وهو مثير للاهتمام من الناحية الاتجاهية إلى جانب نتيجة OSWorld الخاصة بـ Google، لكن يجب على الفرق إعادة تنفيذ مهام المتصفح ضمن إطار الأمان الخاص بها ونظام تشغيل الأدوات الخاص بها.
قام أحد مستخدمي X الناقدين بتفسير جدول «جوجل» بطريقة مختلفة، مجادلاً بأن المكاسب الأكثر إقناعاً ظهرت في مجالي الرؤية والسياق بدلاً من البرمجة. وأشار مستخدم آخر إلى مؤشر برمجة مركب، حيث جاء الرقم 3.6 أقل قليلاً من 3.5. ويمكن أن تؤدي مجموعات المهام المختلفة إلى نتائج تبدو متضاربة، ولهذا السبب يجب أن تظل أسماء المعايير المرجعية وطرقها مرفقة بكل رقم.

تركز تقارير البرمجة على التحقق من صحة البيانات واكتمالها
وصف التقرير الأكثر تفصيلاً على موقع Reddit الإصدار 3.6 من Flash بأنه سريع وفعال عندما تكون المهام محددة النطاق بدقة وقابلة للقياس ومزودة بأدوات الرصد قبل الإصلاح. وحذر المؤلف نفسه من الادعاءات المتعجلة بشأن التحقق، والاستقلالية التي تبدو مدمرة، وتكلفة الإشراف على فحص العمل. كما كشف المؤلف أن نموذجًا آخر قام بمراجعة النتيجة أو تصحيحها، وأن مشكلة في الإعداد أثرت سلبًا على جزء من الاختبار.

أفاد كاتب آخر على موقع «ريديت» بوجود عمل غير مكتمل في المشروع، تلاه ادعاء بأن المهمة قد اكتملت. ووصف المعلقون مخاوف مماثلة تتعلق بالسياق وتصحيح الأخطاء والتحقق الوهمي. ولم يتم التحقق من إعدادات الأداة ومطالباتها بشكل مستقل، لذا ينبغي أن يُعتبر هذا التقرير حالة اختبارية — وليس حكماً عاماً.

الدرس الشائع المستفاد من عملية التقييم هو الفصل بين جودة التصحيح ونزاهة عملية التحقق. فقد يقترح النموذج تغييرًا مفيدًا، لكنه يستخدم اختبارًا لا يستطيع تمييز التصحيح، أو يتجاهل الجزء الأخير من المهمة، أو يخطئ في تحديد حالات الفشل المتبقية. وينبغي أن تتضمن معايير القبول فحص المنتج، وقدرة الاختبار على التمييز، والحالة النهائية، ودقة تقرير الإنجاز.
القيود، والسلامة، وحدود الأدلة
يحتفظ نموذج Gemini 3.6 Flash بأنماط فشل النموذج الأساسي، بما في ذلك الحقائق الوهمية، والتنفيذ غير المكتمل، والاستنتاجات الواثقة ولكن غير المدعومة. كما تشير بطاقة النموذج إلى حدوث بطء أو انقضاء المهلة من حين لآخر. ونظرًا لأن تاريخ تحديث المعرفة الخاص به هو مارس 2026، فإن الحقائق الأحدث تتطلب تأكيدًا أو مصدرًا موثوقًا حديثًا أو وثائق مقدمة.
تشير تقارير «جوجل» إلى مقارنات إيجابية بشكل عام في مجال السلامة مقارنةً بنموذج «Gemini 3.5 Flash»، بما في ذلك تحسن السلامة في عمليات «نص إلى نص» والسلامة متعددة اللغات، واستقرار مستوى السلامة في عمليات «صورة إلى نص»، وتراجع طفيف في نبرة الرفض وحالات الرفض غير المبررة. ظل النموذج دون مستويات القدرات الحرجة التي حددتها جوجل بعد إجراء اختبارات إضافية. وتُعد هذه التقييمات تقارير مقدمة من الناشرين، وليست ضمانات مستقلة لنشر معين.
يتطلب استخدام الكمبيوتر ضوابط تشغيلية أكثر صرامة مقارنة بالدردشة. فقد يواجه الوكلاء الذين يعتمدون على لقطات الشاشة مشاكل مثل إدخال الأوامر بشكل مباشر، والضوابط المضللة، والنوافذ المنبثقة، والإجراءات التي لا يمكن التراجع عنها. لذا، يجب استخدام بيئات معزولة، وبيانات اعتماد ذات امتيازات محدودة، وقوائم السماح الخاصة بالمجالات والإجراءات، وعمليات التأكيد، وسجلات التدقيق، وحدود الإنفاق، وخطط التراجع.
لم يشمل اختبار المتصفح الذي أجريناه نقطة النهاية الأصلية الخاصة بـ«استخدام الكمبيوتر» من Google، ولا يمكننا تأكيد أي ادعاءات تتعلق بزمن الاستجابة الأصلي أو الأمان أو معدل النجاح. فقد اختبر الاختبار تفسير لقطات الشاشة ومُحلل الإجراءات المحلي القائم على النص. وبالمثل، فإن خطأ تحويل ملفات PDF في Broly ينطبق فقط على مسار طلب البوابة المذكور.
تشمل أرقام زمن الاستجابة لدينا توجيه بوابة «برولي»، وقد تم الحصول عليها من مجموعة صغيرة واحدة، وليست من توزيعات متكررة. ولم نقم بقياس زمن انتقال البيانات (TTFT). أما التكاليف فهي تقديرات مستمدة من الاستخدام المُبلغ عنه والأسعار القياسية الرسمية، وليست مستمدة من الفواتير، كما أن المجموعة لم تستخدم ميزة «Search Grounding».
تقدم المعايير الرسمية، وقوائم التصنيف الصادرة عن أطراف ثالثة، واختبارات البوابة التي نجريها، والروايات المتداولة على مواقع التواصل الاجتماعي إجابات على أسئلة مختلفة. ويُعد إبقاء تصنيفاتها واضحة أمرًا ضروريًا لتجنب الانطباع الخاطئ بالدقة: فنتائج «جوجل» تصف تقييم «جوجل» نفسه، وسجلاتنا تصف مسارًا واحدًا ومجموعة اختبارات قابلة للتكرار، أما المنشورات العامة فتصف تجارب فردية.
من الذي ينبغي أن يستخدم Gemini 3.6 Flash؟
يُعد Gemini 3.6 Flash خيارًا قويًّا للفرق التي تستخدم بالفعل Gemini 3.5 Flash، لا سيما عندما تكون تكلفة المخرجات، أو المدخلات متعددة الوسائط، أو استدعاء الأدوات، أو التخطيط الوكالي، عوامل ذات أهمية كبيرة. كما أنه مناسب للتطبيقات الجديدة التي يمكنها تحديد معايير نجاح صريحة والإشراف على الإجراءات الحساسة للمخاطر.
- كتابة برامج تتضمن مهام محددة النطاق، ومساحات عمل منفصلة، واختبارات آلية قادرة على التمييز.
- مسارات تحليل الرسوم البيانية والصور ومقاطع الفيديو والملفات الصوتية وملفات PDF التي تُنتج نصوصًا أو بيانات منظمة.
- وكلاء متصفح أو سطح مكتب خاضعون للإشراف، مزودون ببوابات تأكيد والتحقق من الصحة محليًّا.
- أنظمة العمل المعرفي التي تتطلب استدعاء الدوال، أو البحث عن الملفات، أو التخزين المؤقت، أو البحث المرتكز على المعطيات.
- الفرق القادرة على مقارنة تكلفة كل مهمة ناجحة مع 3.5 Flash ومزودي الخدمات الآخرين.
ولا يُعد هذا الحل مناسبًا تمامًا عندما يمكن لـ Flash-Lite تنفيذ المهمة بشكل موثوق، أو عندما تتطلب المعالجة الصوتية في الوقت الفعلي استخدام واجهة برمجة التطبيقات (Live API)، أو عندما يكون من الضروري إنشاء الصور أو الملفات الصوتية بشكل أصلي. كما أنه غير مناسب للأتمتة عالية المخاطر التي تتم دون إشراف، والتي تفتقر إلى آلية التراجع والتحقق المستقل.
- تحويل عمليات التصنيف والاستخراج البسيطة إلى مستوى أقل تكلفة مع الحفاظ على الجودة.
- لا تفترض أن نافذة السياق التي يبلغ حجمها 1M تحل محل هندسة الاسترجاع.
- لا تقبل حالة “التحقق” المعلنة ذاتيًا دون إجراء اختبار قد يفشل.
- لا تقم بتعميم زمن انتقال بوابة «برولي» أو سلوك تحويل ملفات PDF على نقاط النهاية الأصلية لـ «جوجل».
- لا تقم بتنفيذ إجراءات لا رجعة فيها تتعلق باستخدام الكمبيوتر دون الحصول على تأكيد صريح.
الحكم النهائي
تُظهر مراجعة نموذج Gemini 3.6 Flash أنه مرشح قوي للإنتاج، وليس مجرد خطوة ترحيل تلقائية. يجمع هذا النموذج بين انخفاض تكلفة المخرجات، ومساحة واسعة للمدخلات والأدوات، ومكاسب رسمية ملموسة في اختبارات DeepSWE وMLE-Bench وOSWorld، بالإضافة إلى الاسترجاع في السياقات الطويلة. وتضيف اختباراتنا المحدودة أدلة مشجعة على دقة الاستخراج، وقراءة المخططات، وإصلاح الكود المركّز، وتخطيط الإجراءات المحلية الموجهة باللقطات الشاشة.
كما أن التحذير ملموس بنفس القدر. فقد تسببت القيود الصارمة على الناتج في حدوث حالتين من الاقتطاع في البداية؛ واستهلكت عملية الاستدلال تقريبًا كامل ميزانية إكمال البث؛ وفشل اختبار الاسترجاع الاصطناعي الذي أجريناه على 128 ألف حالة مرتين؛ وابتكرت خطة المتصفح معرّفًا غير موجود. وظل مسار ملف PDF دون اختبار أصليًّا لأن مسار التحويل عبر Broly فشل قبل صدور استجابة النموذج.
استخدم Gemini 3.6 Flash عندما يُظهر تقييم مقارن أن هذا النموذج يحقق كفاءة اقتصادية أفضل في إنجاز المهام مقارنةً بنموذجك الحالي. قم بتتبع معدل النجاح، والرموز، ومحاولات الإعادة، وطلبات الأدوات، والتعديلات غير المرغوب فيها، والوقت المستغرق في التصحيح البشري، وما إذا كانت كل مطالبة بالتحقق مدعومة باختبار تمييزي. بالنسبة لأحمال العمل المختلطة، ابدأ باستخدام Flash-Lite وقم بالترقية حسب الحاجة الملحوظة.
الأسئلة الشائعة
هل إصدار Gemini 3.6 Flash متاح بشكل عام؟
نعم. تُدرج «Google» ذاكرة «Gemini 3.6 Flash» على أنها مستقرة ومتاحة بشكل عام للاستخدام في بيئات الإنتاج. معرّف الطراز هو gemini-3.6-flash, ، ويمكن الوصول إليها عبر Google AI Studio وواجهة برمجة تطبيقات المطورين Gemini. ولا تزال تغطية ميزات واجهة برمجة التطبيقات تختلف بين «التفاعلات» و إنشاء المحتوى.
كم يبلغ سعر بطاقة الذاكرة Gemini سعة 3.6 فلاش؟
الأسعار القياسية المدفوعة هي $1.50 لكل مليون توكن مدخل و$7.50 لكل مليون توكن مخرج، بما في ذلك توكنات التفكير. تبلغ تكلفة «الدُفعات» و«المرونة» $0.75 عند الإدخال و$3.75 عند الإخراج، بينما تبلغ تكلفة «الأولوية» $2.70 عند الإدخال و$13.50 عند الإخراج. وقد تُضاف رسوم منفصلة للتخزين المؤقت والتأريض.
ما هي نافذة سياق Gemini 3.6 Flash؟
يدعم Gemini 3.6 Flash ما يصل إلى 1,048,576 رمز إدخال و65,536 رمز إخراج. وهذا يمثل حدًا أقصى للسعة، وليس ضمانًا للاسترجاع. بلغت نتيجة Google في اختبار 1M GDM-MRCR 54.0%، وفشلت مهمتنا الاصطناعية المختلفة التي تتضمن بوابة 128K، لذا لا تزال الأنظمة الحيوية بحاجة إلى عمليات الاسترجاع والتحقق من الصحة.
هل يدعم جهاز Gemini 3.6 Flash الصور والملفات الصوتية ومقاطع الفيديو وملفات PDF؟
نعم، تدرج «جوجل» النصوص والصور والملفات الصوتية والفيديو وملفات PDF ضمن المدخلات المدعومة. ويُنتج النموذج نصوصًا وبيانات منظمة وطلبات أدوات بدلاً من الصور أو الملفات الصوتية الأصلية. لم يكن مسار تحويل ملفات PDF الخاص بـ«Broly» مدعومًا، لكن نتيجة البوابة هذه لا تشير إلى وجود قيود أصلية على ملفات PDF في نموذج Gemini.
هل يدعم فلاش Gemini 3.6 الاستخدام على الكمبيوتر؟
نعم. تدعم واجهة برمجة التطبيقات (API) Gemini من Google ميزة «استخدام الكمبيوتر» مع إصدار Gemini 3.6 Flash لبيئات المتصفح والهواتف المحمولة وأجهزة سطح المكتب، لكن هذه الميزة لا تزال في مرحلة «المعاينة». يقوم العميل بتنفيذ الإجراءات المقترحة ويجب عليه تطبيق إجراءات التأكيد وضوابط الأمان. ولم يكن نظام التقاط لقطات الشاشة المحلي الخاص بنا اختبارًا أصليًّا لميزة «استخدام الكمبيوتر».
هل شاشة Gemini 3.6 Flash أفضل من شاشة Gemini 3.5 Flash؟
إنه يُظهر أداءً أقوى في العديد من مقارنات Google وأرخص من حيث التكلفة لكل رمز ناتج، لكن مصطلح “أفضل” يعتمد على طبيعة حمل العمل. حققت تجربة الترميز المحدودة الخاصة بنا نتيجة 5/5 لكلا النموذجين، في حين أن النموذج 3.5 تطلب استخراجًا متسامحًا للكود. قم بتشغيل المهام المطابقة وقارن تكلفة الإنجاز التي تم التحقق منها، لا تقتصر على أسماء النماذج وحدها.
هل يتم دعم كل من درجة الحرارة وtop_p وtop_k؟
تقول «جوجل» درجة الحرارة, top_p, و top_k هذه الحقول أصبحت قديمة ويتم تجاهلها في هذه النماذج، ومن المتوقع أن ترفضها الأجيال المستقبلية من النماذج. قم بإزالة هذه الحقول أثناء عملية الترحيل. استخدم تعليمات واضحة، ومخططات بيانات، ومخرجات منظمة، وأدوات التحقق من صحة التطبيق للتحكم في السلوك.
هل توجد باقة مجانية؟
تقدم Google خدمات إدخال وإخراج مجانية ضمن الفئة القياسية، مع مراعاة حدود الاستخدام وتوافر الخدمة. تشير صفحة الأسعار إلى أنه يجوز استخدام محتوى الفئة المجانية لتحسين منتجات Google، في حين يتم تمييز محتوى الفئة المدفوعة بعلامة أخرى. يرجى مراجعة الشروط الحالية المتعلقة بمعدلات الاستخدام واستهلاك البيانات والشروط الإقليمية قبل إرسال بيانات الإنتاج أو البيانات الحساسة.

