3 مجالات يتفوق فيها شات جي بي تي على جيميني في 2025
مع تسارع وتيرة التطوير في عالم الذكاء الاصطناعي، أصبحت المقارنة بين العمالقة مثل "OpenAI" و"غوغل" أكثر تعقيداً من مجرد طرح سؤال وانتظار إجابة. ففي ديسمبر 2025، وبعد تكهنات بتراجعها، قلبت OpenAI الطاولة بإطلاق نموذج ChatGPT-5.2، الذي أظهر تفوقاً ملحوظاً في اختبارات معيارية (Benchmarks) دقيقة، بحسب تقرير نشره موقع "slashgear".
التفوق في الأسئلة العلمية المعقدة
أولى ساحات المنافسة كانت اختبار GPQA Diamond، المخصص لقياس التفكير العلمي بمستوى الدكتوراه في الفيزياء والكيمياء والأحياء. يتميز هذا الاختبار بأسئلة "محصنة ضد غوغل"، حيث لا يمكن حلها بالبحث التقليدي السريع.
في هذا المضمار، سجل ChatGPT-5.2 نسبة نجاح بلغت 92.4%، متفوقاً بفارق طفيف على Gemini 3 Pro الذي حقق 91.9%. ولتوضيح صعوبة هذا الاختبار، فإن التوقعات تشير إلى أن حملة الدكتوراه يحققون نحو 65% فقط، بينما يقف غير المتخصصين عند عتبة 34%.
حل المشكلات البرمجية من GitHub
المعيار الثاني هو اختبار SWE-Bench Pro، الذي يضع النماذج أمام تحديات برمجية حقيقية مأخوذة من منصة GitHub. يتطلب هذا الاختبار فهم أكواد غير مألوفة وتقديم حلول عملية.
هنا، نجح شات جي بي تي في حل 24% من المشكلات، متفوقاً على جيميني الذي سجل 18%. ورغم تفوق الذكاء الاصطناعي، إلا أن البشر (مهندسي البرمجيات المحترفين) لا يزالون يتربعون على القمة بنسبة حل تصل إلى 100%، مما يشير إلى المسافة التي لا تزال تفصل الآلة عن الإنسان في هذا المجال.
التفكير التجريدي والألغاز البصرية
في اختبار ARC-AGI-2، الذي يقيس القدرة على استنتاج الأنماط والتفكير التجريدي، أظهر ChatGPT-5.2 Pro تفوقاً واضحاً بنسبة 54.2%. في المقابل، سجلت نسخة Gemini 3 Deep Think (الأعلى تكلفة) نسبة 45.1%، بينما اكتفى Gemini 3 Pro بنسبة 31.1%.
ختاماً، ورغم أن جيميني قد يتصدر تفضيلات المستخدمين في منصات مثل LLMArena، إلا أن لغة الأرقام في هذه المعايير الثلاثة تحديداً تمنح الأفضلية حالياً لنموذج OpenAI الجديد.
التعليقات 0
سجل دخولك لإضافة تعليق
لا توجد تعليقات بعد. كن أول من يعلق!