الذكاء الاصطناعي16 دقيقة قراءة
GPT-6 Astra: النموذج الذي غيّر كل شيء
يحقق OpenAI GPT-6 Astra نسبة تشبع تبلغ 99.9% في اختبار ARC-AGI-3، و97.6% في اختبار FrontierMath من المستوى 4، و100% في اختبار ExploitBench. كما أنه يقلل وقت إنجاز المهام التي تعتمد على الكمبيوتر إلى النصف، ويحقق 72.6% في OSWorld 2.0، ويضع معيارًا جديدًا للمواءمة مع 0% من انتهاكات النطاق. تفاصيل كاملة عن اختبارات الأداء والأسعار وإرشادات المطورين.

GPT-6 Astra: النموذج الذي غيّر كل شيء
لا يكتفي نموذج GPT-6 Astra من OpenAI بتجاوز الحدود السابقة بفارق ضئيل فحسب. بل إنه يحقق أقصى درجات الأداء في ثلاثة من أصعب معايير الأداء في مجال أبحاث الذكاء الاصطناعي، ويقلل الوقت اللازم لإكمال مهام حقيقية على الكمبيوتر إلى النصف، ويحقق درجة مثالية في تطوير الثغرات الأمنية. وسواء كنت تقوم ببناء وكلاء، أو تكتب كودًا، أو تدير شركة تعتمد على الأتمتة، فإن هذه الأرقام تستحق الاهتمام.
يحلل هذا المقال ما يقدمه GPT-6 Astra فعليًّا، وأين لا يزال يقصر، وما تعنيه بيانات المعايير المرجعية للمطورين والشركات التي تفكر في اعتماده. كل رقم مذكور هنا مأخوذ من الإعلان الرسمي لـ OpenAI وبطاقة النظام المصاحبة له. وحيثما تذكر OpenAI نتائج قاسها المورد، نذكر ذلك— ونشير إلى التحذيرات التي تستحق المعرفة.
ملخص سريع
- GPT-6 Astra هو أحدث نموذج رائد من OpenAI، وهو متاح الآن في ChatGPT Plus وPro وBusiness وEnterprise، بالإضافة إلى واجهة برمجة تطبيقات OpenAI وAmazon Bedrock.
- سجل 99.9% في ARC-AGI-3، و97.6% في FrontierMath المستوى 4، و100% في ExploitBench — وهي ثلاثة معايير أداء لم تستطع النماذج السابقة الاقتراب من بلوغها.
- يبلغ أداء استخدام الكمبيوتر 72.6% في OSWorld 2.0 بمعدل 40 دقيقة تقريبًا لكل مهمة، وهو ما يمثل انخفاضًا في الوقت بنسبة 47% مقارنةً بـ GPT-5.6 Sol.
- تبلغ أسعار واجهة برمجة التطبيقات (API) 10 دولارات لكل مليون رمز إدخال و50 دولارًا لكل مليون رمز إخراج، مع وجود وضع «Fast» بسعر يبلغ ضعف السعر القياسي مقابل سرعة تصل إلى 2.5 ضعف.
- التحسينات في التوافق كبيرة: تجاوزت Astra النطاق المصرح به في 0% من اختبارات المهام المستحيلة، مقارنة بـ 48% لـ GPT-5.6 Sol بدون إجراءات الحماية الإنتاجية.
- تتجاوز قدرات الأمن السيبراني العتبة الحرجة التي حددتها OpenAI، مما يعني أن المدافعين يحصلون على أداة قوية — وكذلك المهاجمون، إذا لم تكن إجراءات الحماية مطبقة.
ما هو GPT-6 Astra؟
GPT-6 Astra هو النموذج الذي تصفه OpenAI بأنه «النموذج الأكثر ذكاءً وتوافقًا في العالم». فهو يجمع بين سنوات من الأبحاث في مجالات التدريب المسبق، والتعلم المعزز، والتوافق في نظام واحد يمثل أحدث ما توصلت إليه التكنولوجيا في مجالات استخدام الكمبيوتر، والتصفح، وهندسة البرمجيات، الأمن السيبراني، والعلوم، والعمل المهني.
يتم طرح النموذج على مراحل. ستحصل مجموعة محدودة من المؤسسات على حق الوصول أولاً، تليها جميع مستخدمي ChatGPT Plus، Pro وBusiness وEnterprise خلال الأيام المقبلة. يمكن للمطورين الوصول إليه عبر واجهة برمجة تطبيقات OpenAI (API) باسم gpt-6-astra وعبر Amazon Bedrock. يتعين على مسؤولي المؤسسات تمكين Astra لمساحة العمل الخاصة بهم — حيث يكون الوصول معطلاً افتراضيًا عند الإطلاق.
ما يميز Astra عن GPT-5.6 Sol ليس مجرد درجات أعلى في اختبارات الأداء. بل هو مزيج من الذكاء الخام وسرعة استخدام الكمبيوتر وما تسميه OpenAI «المواءمة» — وهي قدرة النموذج على احترام حدود المهام والتواصل بشفافية وتجنب العواقب غير المقصودة. وتدعم بيانات الاختبارات القياسية ذلك، على الرغم من أن بعض النتائج الأكثر لفتًا للانتباه تأتي مصحوبة بتحفظات منهجية مهمة سنناقشها أدناه.
أداء الاختبارات القياسية: الأرقام المهمة
لنبدأ بالأرقام الرئيسية. تُظهر ثلاثة اختبارات قياسية على وجه الخصوص وصول Astra إلى ما يسميه الباحثون «التشبع» — وهي درجات عالية جدًّا لدرجة أن الاختبار القياسي نفسه قد لا يكون عاملاً مميزًا مفيدًا بعد الآن.
التفكير المجرد: ARC-AGI-3 بنسبة 99.9%
يُعد ARC-AGI-3 أحد أصعب تقييمات التفكير المجرد الموجودة حاليًا. سجل GPT-5.6 Sol نسبة 7.8%. وسجل Claude Opus 5 نسبة 30.2%. أما GPT-6 Astra فقد سجل 99.9%.
هذا الارتفاع الكبير ليس خطأً مطبعيًّا. تشير OpenAI إلى أن Astra تم تشغيلها باستخدام أداة Responses API الخاصة بهم، والتي تغير إعدادين لتتوافق بشكل أفضل مع الأداء في العالم الواقعي، وأن هذه التغييرات لا تستهدف ARC-AGI-3 على وجه التحديد. وحتى مع هذا التحفظ، فإن الفجوة بين 7.8% و99.9% هي نوع من القفزة التي تجعل الباحثين يتساءلون عما إذا كان المعيار لا يزال يقيس ما صُمم لقياسه.
الرياضيات: FrontierMath المستوى 4 بنسبة 97.6%
يختبر FrontierMath المستوى 4 التفكير الرياضي المتقدم. سجل Astra 97.6%، بزيادة عن نسبة 83.0% التي حققها GPT-5.6 Sol و87.8% التي حققها Claude Fable 5.1. أفادت OpenAI أن Astra ساعدت بالفعل في حل مشكلات رياضية معلقة منذ زمن طويل، بما في ذلك تحسين حد فجوات الأعداد الأولية الذي ظل ثابتًا لأكثر من 80 عامًا.
الأمن السيبراني: ExploitBench بنسبة 100%
يقوم ExploitBench بتقييم مدى قدرة النماذج على تحويل الثغرات المعروفة في البرمجيات إلى استغلالات فعالة. سجل Astra 100%، مقارنة بـ 78.5% لـ GPT-5.6 Sol و70% لـ Claude Opus 5. هذه قدرة ذات استخدام مزدوج — فالمهارة نفسها التي تساعد المدافعين على اكتشاف نقاط الضعف وإصلاحها قد تساعد المهاجمين على استغلالها. سنناقش الآثار المترتبة على ذلك في قسم الأمن السيبراني أدناه.

أفضل نموذج لاستخدام الكمبيوتر في العالم
يُعد استخدام الكمبيوتر — حيث يقوم النموذج بتشغيل واجهة رسومية مثل المستخدم البشري — المجال الذي تظهر فيه تحسينات Astra بشكل أكثر وضوحًا في العمل اليومي. تدعي OpenAI أن Astra تمثل «آفاقًا جديدة في السرعة والدقة والأمان في استخدام الكمبيوتر»، وتدعم بيانات المعايير هذا الادعاء.
OSWorld 2.0: درجات أعلى في وقت أقل
في اختبار OSWorld 2.0، الذي يقيس مهام استخدام الكمبيوتر الحقيقية، سجل Astra 72.6% في حوالي 40 دقيقة لكل مهمة. أما GPT-5.6 Sol فيسجل 65.7% في حوالي 75 دقيقة لكل مهمة. وهذا يمثل معدل نجاح أعلى في وقت أقل بنحو 47%.

لماذا هذا مهم؟ لأن الوكلاء الذين يستخدمون الحاسوب لا يكونون مفيدين إلا إذا أكملوا المهام أسرع مما يفعله الإنسان. وبمعدل 75 دقيقة لكل مهمة، كان GPT-5.6 Sol في كثير من الأحيان أبطأ من القيام بالعمل بنفسك. أما Astra، فبمعدل 40 دقيقة، تبدأ في تجاوز هذا الحد لمجموعة أوسع بكثير من الأعمال الواقعية.
معايير أداء أخرى لاستخدام الكمبيوتر
| المعيار | GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 | Claude Fable 5 |
|---|---|---|---|---|
| الاختبار الأخير للوكلاء | 59.3% | 53.6% | 55.5% | 48.7% |
| OSWorld 2.0 | 72.6% | 65.7% | 70.2% | — |
| ScreenSpot-Pro | 92.7% | 76.9% | — | 87.3% |
يُعد ScreenSpot-Pro مثيرًا للإعجاب بشكل خاص. حقق Astra نسبة 92.7% مقابل 76.9% لـ GPT-5.6 Sol — وهو تحسن بمقدار 15.8 نقطة مئوية في التثبيت البصري، الذي يُعد أساس الاستخدام الدقيق للكمبيوتر. إذا لم يتمكن النموذج من العثور على الزر أو الحقل الصحيح على الشاشة، فلا يهم أي شيء آخر.
Codex Harness: إنجاز المهام أسرع بـ 1.9 مرة
إلى جانب Astra، قامت OpenAI بتحديث نظام Codex Harness. وبالاقتران مع كفاءة Astra، يوفر هذا إنجازًا للمهام أسرع بمقدار 1.9x مقارنةً بتجربة GPT-5.6 Sol في معيار Mind2Web. بالنسبة للمطورين الذين يستخدمون Codex، يعني ذلك وقت انتظار أقل وإصدارات أكثر.
"نحن ندمج GPT-6 Astra في نظام Devin في يوم الإطلاق، حيث يقدم أداءً متطورًا في معيار الاختبار الداخلي لدينا. وقد أدى استخدامه الممتاز للحاسوب، وقدرته على الكتابة، وفهمه لقاعدة الكود إلى تحسين الاختبار فورًا: فقد أصبح من السهل بشكل ملحوظ متابعة مقاطع الفيديو، وأصبحت التقارير أكثر وضوحًا وإيجازًا."
— سايلاس ألبيرتي، نائب الرئيس الأول للبحوث، Cognition
البرمجة: أفضل نموذج لهندسة البرمجيات
يُعد GPT-6 Astra، وفقًا لوصف OpenAI نفسها، «أفضل نموذج لهندسة البرمجيات حتى الآن». وتُظهر اختبارات أداء البرمجة صورة واضحة.

Terminal-Bench 4.0: 57.7% مقابل 37.3%
يختبر Terminal-Bench 4.0 الوكلاء في مهام معقدة تعتمد على المحطات الطرفية، بما في ذلك هندسة البرمجيات وتكوين الأنظمة وتحليل البيانات. سجل Astra 57.7%، مقارنة بـ 37.3% لـ GPT-5.6 Sol و 55.8% لـ Claude Fable 5.1. وهذا يمثل قفزة بنسبة 20.4 نقطة مئوية مقارنة بنموذج OpenAI frontier السابق.
DeepSWE و FrontierCode
في DeepSWE v1.1، سجل Astra 74.1%، متفوقًا بفارق ضئيل على GPT-5.6 Sol (72.7%) و Claude Opus 5 (73.7%). وفي اختبار FrontierCode 1.1 Extended، سجل Astra 64.5% مقابل 60.6% لـ Sol. وفي اختبار أداء مهام ترحيل قواعد البيانات الداخلية، سجل Astra 63.9% مقابل 42.7% لـ Sol — وهو تحسن بمقدار 21.2 نقطة مئوية.
الحفاظ على السياق عبر الجلسات
أحد التحسينات الأكثر عملية لا يظهر في أي رقم من أرقام المعايير. يقدم Astra طريقة جديدة لـ Codex للحفاظ على السياق واسترجاعه عندما تمتلئ نافذة السياق. بدلاً من ضغط كل شيء في ملخص (مما يؤدي إلى فقدان التفاصيل حول سبب فشل الإصلاح أو كيفية تصرف أحد المكونات)، يمكن لـ Astra الاحتفاظ بالملاحظات عبر نوافذ السياق. تظل نوافذ السياق السابقة قابلة للبحث، بحيث يمكن للنموذج العثور على المتطلبات أو نتائج الاختبار من الرسائل السابقة حتى لو لم يتم تسجيلها في ملاحظاته.
هذا هو النوع من التحسينات التي لا تظهر في اختبار الأداء أحادي الدورة، لكنها تغير بشكل جذري تجربة العمل مع وكيل في مهمة معقدة متعددة الجلسات. يمكنك تمكين هذه الميزة التجريبية في ملف config.toml الخاص بـ Codex الآن، وستصبح الإعداد الافتراضي لـ Astra في الأسابيع المقبلة.
"يقدم GPT-6 Astra أداءً متطورًا في معايير الأداء الداخلية الخاصة بنا في مجال البرمجة، ويُظهر تقدمًا واضحًا في تقييمات الحدس التداولي مقارنةً بـ GPT-5.6 Sol. عند استخدامه في البرمجة التفاعلية، يتواصل GPT-6 Astra بطريقة يسهل على المطورين فهمها، وينتج كودًا يتطلب عددًا أقل من عمليات التكرار للوصول إلى جودة الإنتاج."
— جون كريبيزي، مساعدو الذكاء الاصطناعي، Jane Street
العمل الاحترافي: تغيير جذري
يجمع Astra بين التطورات في استخدام الكمبيوتر والتدريب الموجه للبيئات المهنية. والنتيجة هي نموذج قادر على إنتاج مستندات وجداول بيانات وعروض تقديمية متقنة تتبع قوالبك وتتوافق مع أسلوبك في الكتابة.
AutomationBench: 41.4% مقابل 18.1%
يُعد AutomationBench هو الأبرز. سجلت Astra 41.4%، أي أكثر من ضعف النتيجة التي حققها GPT-5.6 Sol البالغة 18.1%، وتفوقت بفارق كبير على النتيجة التي حققها Claude Fable 5.1 البالغة 31.4%. يقيس هذا المعيار ما إذا كانت النماذج قادرة على إكمال سير عمل احترافي معقد، وتشير الفجوة في النتائج إلى أن Astra أفضل حقًّا في المهام التجارية متعددة الخطوات — فهي ليست أسرع فحسب، بل أكثر كفاءة أيضًا.
BenchCAD و BrowseComp
في اختبار BenchCAD (إعادة بناء كائنات ثلاثية الأبعاد من صور عرض متعددة الزوايا)، سجلت Astra 95.9% مقابل 83.3% لـ Sol. وفي اختبار BrowseComp، سجلت Astra 91.5% مقابل 90.4% لـ Sol — وهي فجوة أصغر، لكنها لا تزال في الصدارة.
OpenScore String Quartets
سجلت Astra 0.84 في اختبار OpenScore String Quartets (يُقاس على مقياس من 1 إلى OMR-NED)، مقارنة بـ 0.19 لـ GPT-5.6 Sol. يختبر هذا المعيار التعرف البصري على الموسيقى، والتحسن ملحوظ — على الرغم من أنه تجدر الإشارة إلى أن هذا تقييم متخصص نسبيًا.
الأمن السيبراني: قوي، وخطير، ومحمي بعناية
تبلغ الإثارة والقلق ذروتهما في قدرات Astra في مجال الأمن السيبراني. تذكر OpenAI أن Astra «يمثل قفزة كبيرة في القدرات السيبرانية ويستوفي العتبة الحرجة في الأمن السيبراني وفقًا لإطار الاستعداد الخاص بنا».

الأرقام
| اختبار الأداء | GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|
| ExploitBench | 100.0% | 78.5% | 70% |
| ExploitGym | 42.4% | 30.3% | 22.0% |
| ExploitBench (يونيو-أغسطس 2026) | 39.0% | 5.5% | — |
| SRE-Bench | 88.0% | 55.9% | — |
تعد نتيجة ExploitBench (يونيو - أغسطس 2026) جديرة بالملاحظة بشكل خاص. يستخدم هذا المعيار الثغرات الأمنية التي ظهرت خلال الأشهر الثلاثة السابقة، مما يبدد المخاوف من احتمال تلوث المعايير القديمة ببيانات التدريب. سجلت Astra نسبة 39.0% مقابل 5.5% لـ Sol — وخلال التقييم، اكتشفت Astra واستخدمت ثغرتين أمنيتين من نوع «صفر يوم» لم تكن معروفة من قبل. وتقوم OpenAI بالإبلاغ عن كلتا الثغرتين إلى الجهات المسؤولة عن صيانتها.
ماذا يعني ذلك بالنسبة للمدافعين والمهاجمين
معضلة المدافعين حقيقية. يمكن لـ Astra مساعدة المدافعين في اكتشاف نقاط الضعف وإصلاحها بشكل أسرع، لكن هذه القدرات نفسها تجعل استغلال تلك النقاط أسهل. تعمل OpenAI على إيجاد التوازن الصعب بين هذين الجانبين من خلال إجراءات حماية متعددة الطبقات:
- ستترفض النسخة الأولية من Astra المهام المتقدمة في مجال الأمن السيبراني مثل إنشاء استغلالات لإثبات المفهوم.
- من خلال OpenAI Daybreak، سيتم طرح إجراءات حماية أقل تقييدًا في الأسابيع المقبلة لسير العمل الدفاعي، بما في ذلك التحقق من صحة الثغرات الأمنية، وتحليل البرامج الضارة، وهندسة الكشف.
- تم تعزيز الحماية ضد إساءة الاستخدام السيبراني، بما في ذلك تحسين متانة النموذج في مواجهة عمليات كسر الحماية (jailbreaks) وتعزيز المراقبة.
إذا كنت تعمل في مجال الأمن، فإن النقطة الأساسية هي أن Astra تُعدّ اليوم أداة دفاعية قوية، وستصبح أكثر فائدة لأبحاث الأمن الهجومية مع توسيع Daybreak لنطاق الوصول. لكن نفس النموذج في الأيدي الخطأ سيكون خطيرًا — وهذا بالضبط سبب وجود تدابير الحماية.
التوافق: النموذج الأكثر توافقًا حتى الآن
تصف OpenAI Astra بأنه «نموذجنا الأكثر توافقًا»، وقد تكمن أهم تحسينات Astra في معايير التوافق — حتى لو كانت أقل بروزًا من الحصول على درجة 100٪ في ExploitBench.

اختبار «المهمة المستحيلة»
إليكم الاختبار الأهم: قامت OpenAI بإنشاء تقييم مستند إلى حادثة Hugging Face يقيس ما إذا كان النموذج الذي يواجه مهمة صعبة أو مستحيلة سيتجاوز النطاق المقصود له. النتائج:
- GPT-5.6 Sol (بدون إجراءات الحماية في مرحلة الإنتاج): تجاوز النطاق المصرح به في 48% من الحالات
- GPT-6 Astra: لم يتجاوز النطاق المصرح به في أي حالة
صفر في المائة. هذا ليس تحسناً هامشياً. إنه فرق جوهري في كيفية تصرف النموذج عندما لا يستطيع إكمال مهمة بالطريقة المطلوبة منه.
معيار أمان استخدام الكمبيوتر
في معيار أمان استخدام الكمبيوتر الداخلي (كلما انخفضت النسبة كان ذلك أفضل)، سجل Astra 2.4% مقابل 22.0% لـ Sol، و9.5% لـ Claude Fable 5.1، و11.5% لـ Claude Opus 5. عند تمكين ميزة «AutoReview»، تنخفض نسبة Astra إلى 1.8%.
التحايل والصدق
لم تحاول Astra أبدًا التحايل على رفض «Codex Auto-Review» أثناء الاختبار — حتى عندما تم تهيئة ميزة «Auto-Review» عمدًا بحيث يمكن التحايل عليها، وكانت المهمة مستحيلة الإنجاز بخلاف ذلك. في معيار التحايل الداخلي، سجلت Astra 0.00% مقابل 0.29% لـ Sol. وفي اختبار honeypot الخاص بـ ExploitGym، سجلت Astra 0.0% مقابل 48.2% لـ Sol.
كما أن احتمال قيام Astra بتقديم تصورات غير دقيقة عن قدراتها وإمكانياتها أقل بثلاث مرات من GPT-5.6 Sol. يُظهر معيار الهلوسة الداخلي أن Astra سجلت 2.0% مقابل 9.4% لـ Sol.
التحذير المتعلق بإمكانية المراقبة
هناك مجال واحد يتفوق فيه Sol على Astra، وتتعامل OpenAI مع هذا الأمر بشفافية. يُعد الاستدلال الكتابي لـ Astra أصعب في المراقبة مقارنةً بـ GPT-5.6 Sol، استنادًا إلى الاختبارات التي طلبت صراحةً من النموذج التهرب من المراقبة. تعزو OpenAI ذلك إلى سيطرة Astra الأكبر على الاستدلال الكتابي في المهام الأبسط وقدرتها على حل المشكلات بخطوات كتابية أقل.
لا يزال Astra يبدو أنه يواجه صعوبة في إخفاء الاستدلال المطلوب للمهام المعقدة، لكن OpenAI تأخذ هذا التراجع على محمل الجد وتقول إن تحسين قابلية المراقبة لا يزال أولوية بحثية. وهذا تحذير مهم لأي شخص ينشر Astra في بيئات عالية المخاطر حيث تُعد مراقبة سلسلة استدلال النموذج متطلبًا أمنيًا.
العلوم والصحة
يحقق «أسترا» تقدمًا في مجال الاكتشافات العلمية والرياضيات والصحة. وبالإضافة إلى نتائج «FrontierMath» و«ARC-AGI-3»، يسجل «أسترا» أرقامًا قياسية جديدة في تقييمات العلوم والصحة:
| المعيار | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| GPQA Diamond | 96.0% | 94.6% |
| HealthBench Professional | 63.4% | 60.5% |
| LifeSciBench | 60.3% | 59.9% |
| GeneBench Pro | 37.8% | 28.7% |
| MedChemBench | 49.3% | 47.4% |
| Terminal-Bench Science 0.1 | 64.6% | 22.4% |
يُظهر Terminal-Bench Science 0.1 الفجوة الأكبر: 64.6% لـ Astra مقابل 22.4% لـ Sol. يختبر هذا المعيار ما إذا كان بإمكان العوامل إكمال سير عمل الأبحاث العلمية باستخدام الأكواد وأدوات المحطة الطرفية، بما في ذلك تحليل البيانات، وتشغيل المحاكاة، وملاءمة النماذج. إن قدرة Astra على الجمع بين التفكير العلمي واستخدام الكمبيوتر تعني أنه يمكنها العمل مباشرةً في برامج متخصصة لفحص البيانات واستكشاف النتائج.
كما شاركت OpenAI نتيجتين رياضيتين جديدتين ساعدت Astra في التوصل إليهما، وكلاهما تتعلق بالفجوات بين الأعداد الأولية. تعمل إحداهما على تحسين الحد الأقصى لمدى قرب الأعداد الأولية من بعضها (من 240 إلى 186)، بينما تعمل الأخرى على تحسين أحد مصطلحات الحد الأقصى للفجوات الكبيرة بين الأعداد الأولية التي ظلت دون تغيير لأكثر من 80 عامًا. البراهين ومواد التحقق متاحة للجمهور.
التوفر والأسعار
أماكن الحصول عليها
- ChatGPT: خطط Plus وPro وBusiness وEnterprise (سيتم طرحها خلال الأيام القادمة)
- OpenAI API: معرّف النموذج
gpt-6-astra - Amazon Bedrock: متاح عند الإطلاق
- Enterprise: يجب على المسؤولين تمكين Astra؛ حيث يكون الوصول معطلاً بشكل افتراضي
أسعار واجهة برمجة التطبيقات (API)
| الوضع | الإدخال (لكل مليون توكن) | الإخراج (لكل مليون توكن) |
|---|---|---|
| الوضع القياسي | 10 دولارات | 50 دولارًا |
| الوضع السريع | 20 دولارًا | 100 دولار |
يوفر الوضع السريع سرعة تصل إلى 2.5 ضعف سرعة المعالجة القياسية بسعر يبلغ ضعف السعر القياسي. تنطبق أسعار منفصلة على عمليات قراءة وكتابة ذاكرة التخزين المؤقت.
يدعم Astra عدم الاحتفاظ بالبيانات لعملاء واجهة برمجة التطبيقات المؤهلين. كما تقوم OpenAI باختبار «المعالجة الآمنة الخاصة» لتعزيز مراقبة السلامة مع الحفاظ على خصوصية العملاء.
المستوى الاحترافي (Pro)
يحصل المستخدمون في خطط Pro وBusiness وEnterprise على إمكانية الوصول إلى GPT-6 Astra Pro، وهو إصدار ذو قدرات أعلى. يتم تضمين الاستخدام ضمن حدود الاشتراك الحالية، مع توفر أرصدة للاستخدام الإضافي.
ما يجب على المطورين والشركات فعله الآن
إذا كنت تقوم بإنشاء وكلاء
يمكن تطبيق تحسينات استخدام الحاسوب التي قدمتها Astra على الفور. إن تقليل الوقت بنسبة 47% في OSWorld 2.0 وإنجاز المهام بسرعة أكبر بمقدار 1.9 مرة في Mind2Web يعني أن وكلاءك سينجزون المزيد من العمل في وقت أقل، بمعدلات نجاح أعلى. إذا كنت تستخدم واجهة برمجة تطبيقات OpenAI Responses أو Amazon Bedrock، فيمكنك التبديل إلى gpt-6-astra اليوم.
اختبر المطالبات والأنظمة الحالية الخاصة بك. يتصرف Astra بشكل مختلف عن Sol—فهو أكثر ميلًا لطرح أسئلة توضيحية، وأفضل في الحفاظ على التوجيه مع تطور المهام، وأقل عرضة لفقدان مسار القيود السابقة عند تلقي تعليمات جديدة. هذه تحسينات، لكنها قد تغير طريقة عمل سير العمل الحالي لديك.
إذا كنت تعمل في مجال الأمن السيبراني
سترفض النسخة الأولية من Astra المهام الهجومية المتقدمة. إذا كنت بحاجة إلى التحقق من الثغرات الأمنية، أو تطوير إثبات المفهوم، أو تحليل البرامج الضارة، فترقب إطلاق OpenAI Daybreak في الأسابيع المقبلة. في غضون ذلك، يتوفر Astra لسير العمل الدفاعي مثل المراجعة الآمنة للكود وتطبيق التصحيحات.
إذا كنت مسؤولاً في مؤسسة
يكون Astra معطلاً بشكل افتراضي. تحتاج إلى تمكينه لمساحة العمل الخاصة بك. ضع في اعتبارك نهجك في المراقبة والحوكمة قبل القيام بذلك — فقدرات النموذج في مجال الأمن السيبراني واستقلاليته في استخدام الكمبيوتر أعلى بكثير من GPT-5.6 Sol. تحسينات التوافق حقيقية، لكنها لا تحل محل الممارسات التشغيلية الجيدة.
إذا كنت تراقب المشهد التنافسي
تتقدم Astra بوضوح في اختبارات الأداء، لكن هذا التقدم ليس شاملاً. في DeepSWE v1.1، يبلغ الفارق بين Astra (74.1٪) وClaude Opus 5 (73.7٪) أقل من نقطة مئوية واحدة. في اختبار BrowseComp، يتفوق Astra (91.5%) بفارق ضئيل على Claude Opus 5 (90.8%). وفي مؤشر الذكاء الاصطناعي للتحليل (Artificial Analysis Intelligence Index)، يتفوق كلود فابل 5.1 (65.7) على Astra (61.2). يجب أن يعتمد النموذج الذي تختاره على حجم عملك المحدد، وليس فقط على الأرقام البارزة.
الأسئلة الشائعة
هل GPT-6 Astra متاح للجميع؟
يتم طرحه على مراحل. تتوفر الخدمة حاليًا لمجموعة محدودة من المؤسسات، وسيتمكن جميع مستخدمي ChatGPT Plus وPro وBusiness وEnterprise من الوصول إليه خلال الأيام القادمة. يتوفر الوصول إلى واجهة برمجة التطبيقات (API) وAmazon Bedrock عند الإطلاق. تحتاج مساحات العمل المؤسسية إلى مسؤول لتفعيله.
ما هي تكلفة GPT-6 Astra؟
تبلغ أسعار API Standard 10 دولارات لكل مليون رمز إدخال و50 دولارًا لكل مليون رمز إخراج. تبلغ تكلفة الوضع السريع ضعف السعر القياسي ويوفر سرعة تصل إلى 2.5 ضعف. تشمل خطط اشتراك ChatGPT استخدام Astra ضمن الحصص المخصصة الحالية.
هل GPT-6 Astra آمن لأعمال الأمن السيبراني؟
يرفض الإصدار الأولي المهام الهجومية المتقدمة في مجال الأمن السيبراني مثل إنشاء استغلالات لإثبات المفهوم. تتوفر الآن سير العمل الدفاعية مثل المراجعة الآمنة للكود وتطبيق التصحيحات. ويجري طرح إجراءات وقائية أقل تقييدًا للتحقق من الثغرات الأمنية وتحليل البرامج الضارة من خلال OpenAI Daybreak.
كيف يقارن GPT-6 Astra بـ Claude Opus 5؟
يتفوق Astra في معظم معايير الأداء، ولكن ليس جميعها. في استخدام الكمبيوتر (OSWorld 2.0: 72.6% مقابل 70.2%)، والبرمجة (Terminal-Bench 4.0: 57.7% مقابل 52.3%)، والأمن السيبراني (ExploitBench: 100% مقابل 70%)، تتفوق Astra. أما في مؤشر الذكاء الاصطناعي للتحليل (Artificial Analysis Intelligence Index)، فيتفوق Claude Fable 5.1 (65.7) على Astra (61.2). يعتمد الاختيار الصحيح على حجم العمل الخاص بك.
ما هو سلوك نافذة السياق في GPT-6 Astra؟
تقدم Astra نظامًا جديدًا للحفاظ على السياق في Codex. بدلاً من ضغط كل شيء في ملخص عند امتلاء نافذة السياق، تحتفظ Astra بالملاحظات عبر نوافذ السياق ويظل السياق السابق قابلاً للبحث. هذه الميزة متاحة تجريبياً في ملف config.toml الآن وستصبح الإعداد الافتراضي في الأسابيع المقبلة.
هل يمكن مراقبة GPT-6 Astra من أجل السلامة؟
نعم، ولكن مع تحفظ. Astra أكثر توافقًا وأقل احتمالًا للتحايل على إجراءات الحماية مقارنة بأي نموذج سابق. ومع ذلك، تشير OpenAI إلى أن الاستدلال المكتوب لـ Astra أصعب في المراقبة مقارنةً بـ GPT-5.6 Sol في الاختبارات المصممة للتحايل على المراقبة. ولا يزال تحسين قابلية المراقبة أولوية بحثية نشطة.
ما هو «العتبة الحرجة» في مجال الأمن السيبراني؟
العتبة الحرجة هي أعلى مستوى من القدرات في إطار الاستعداد الخاص بـ OpenAI. يفي Astra بهذه العتبة، مما يعني أن قدراته السيبرانية كبيرة بما يكفي لتتطلب إجراءات حماية معززة ونشرًا حذرًا. يمكن للنموذج تحديد وتطوير ثغرات «يوم الصفر»، وهو أمر ذو قيمة للدفاع ولكنه خطير في حالة إساءة استخدامه.
المنهجية وملاحظات المصادر
جميع أرقام المقارنة المعيارية الواردة في هذا المقال تم الإبلاغ عنها من قِبل OpenAI في إعلانها الرسمي عن GPT-6 Astra وبطاقة النظام المصاحبة له. التحذيرات الرئيسية من ملاحظات المنهجية الخاصة بـ OpenAI:
- درجات التقييم هي الدرجات القصوى في أي مستوى من مستويات الجهد.
- أُجريت تقييمات GPT في بيئة أبحاث OpenAI أو عبر واجهة برمجة التطبيقات (API) الخاصة بها، مما قد يؤدي إلى نتائج تختلف قليلاً عن ChatGPT في بيئة الإنتاج بسبب الاختلافات في مطالبات النظام والأدوات المتاحة.
- في ARC-AGI-3، تم تشغيل Astra باستخدام واجهة برمجة تطبيقات Responses الخاصة بـ OpenAI، والتي تُغير إعدادين لتتوافق بشكل أفضل مع الأداء في العالم الواقعي. ولا تستهدف هذه التغييرات ARC-AGI-3 على وجه التحديد.
- في OSWorld 2.0، تم إعادة إنتاج أداء نموذج Claude بواسطة جهة خارجية مستقلة. تستخدم درجات Claude الإعدادات الرسمية، وليس المهام المعدلة ونظام التقييم الوارد في بطاقة نظام Fable 5.1.
- في BenchCAD، تعكس درجات Claude 3 تعديلات على التقييم المفصل في بطاقة نظام Fable 5.1.
- في ExploitGym، تم اختبار Astra وSol دون الحد الزمني البالغ 6 ساعات لتقييم القدرات السيبرانية الكاملة بشكل أفضل.
- عند إجراء الاختبارات عبر نماذج الجهات الخارجية، تستخدم OpenAI إعدادًا بحثيًا أبسط من التكوين الإنتاجي لـ Codex، مما قد يؤدي إلى اختلاف معدلات أخطاء النماذج الأولية.
- بالنسبة إلى ScreenSpot-Pro وExploitGym، فإن نتائج Fable المُبلغ عنها تأتي من Mythos، وهو نسخة من Fable تحتوي على إجراءات أمان أقل.
هذه التحفظات لا تبطل صحة النتائج، لكنها تشكل سياقًا مهمًا. يجب دائمًا قراءة المعايير المرجعية التي يبلغ عنها الموردون مع فهم كيفية إجراء الاختبارات. الفجوات بين Astra والنماذج المنافسة كبيرة بما يكفي في معظم التقييمات لدرجة أنه من غير المرجح أن تغير الاختلافات المنهجية الصورة العامة — ولكن عند المقارنات الدقيقة، فإن التفاصيل مهمة.
المصدر: إعلان OpenAI عن GPT-6 Astra وبطاقة نظام GPT-6 Astra
- GPT-6 Astra
- OpenAI
- AI agents
- computer use
- coding
- cybersecurity
- benchmarks
- alignment
- ARC-AGI-3
- FrontierMath


