Majid Ghorbaninazhad

⚡ تيكين آناليز | كسر حاجز 750 توكناً/ثانية؛ ثورة Cerebras ونموذج Astra لـ OpenAI

في تاريخ الحوسبة الفائقة والذكاء الاصطناعي، نادراً ما تتزامن قفزتان ثوريتان لتغيرا مجرى التاريخ التقني. في منتصف أغسطس 2026، أحدث الإعلان المشترك من مختبرات OpenAI وشركة Cerebras Systems زلزالاً تقنياً كبيراً بكسر حاجز التأخير.

في تاريخ الحوسبة الفائقة والذكاء الاصطناعي، نادراً ما تتزامن قفزتان ثوريتان في توقيت واحد لتغيرا مجرى التاريخ التقني. في منتصف أغسطس ۲۰۲۶، أحدث الإعلان المشترك من مختبرات OpenAI وشركة أشباه الموصلات الرائدة

Cerebras Systems زلزالاً تقنياً كبيراً: تحقيق سرعة معالجة استدلالية بلغت ۷۵۰ توكناً في الثانية على نموذج GPT-5.6 Sol ، بالتزامن مع كشف الستار عن نموذج استدلال علمي فائق التطور يُدعى «Astra» نجح في حل وإثبات

۱۰ معضلات تاريخية مفتوحة في الرياضيات ونظرية التعقيد الحاسوبي . ولسنوات طويلة، ظل «جدار تأخير الاستدلال» (Inference Latency Wall) العقبة الكبرى أمام إطلاق العنان للوكلاء الأذكياء المستقلين والتطبيقات الصوتية

التفاعلية الفورية. فبينما يعالج الدماغ البشري المحادثات في نوافذ زمنية تتراوح بين ۵۰ و ۱۰۰ مللي ثانية، كانت نماذج الذكاء الاصطناعي على كلاسترات الـ GPU التقليدية تستغرق ثوانٍ معدودة لتوليد الأجوبة المعقدة.

إن الوصول لمعدل ۷۵۰ توكناً في الثانية أي أسرع بعشر مرات من سرعة قراءة الإنسان يلغي مفهوم وقت الانتظار نهائياً في التفاعل بين الإنسان والآلة. ۱. كسر حاجز الصوت في الاستدلال؛ ۷۵۰ توكناً في الثانية وعصر الإدراك

اللحظي في هندسة أنظمة الذكاء الاصطناعي الموزعة، يحدد معياران أساسيان مدى كفاءة النظام: زمن أول توكن (TTFT) و الفارق الزمني بين التوكنات (ITL) . فعندما ينفذ وكيل ذكي مسار استدلال متسلسل معقد يتطلب آلاف

التوكنات للتحليل والتصحيح الذاتي واستدعاء الأدوات، فإن سرعة التوليد تحدد ما إذا كان الوكيل سيعمل بسرعة التفكير البشري أو سيتعرض للشلل بسبب طوابير المعالجة. ولفهم أسباب عجز العتاد التقليدي، يجب فحص ديناميكية

«التوليد الذاتي المتسلسل» (Autoregressive Decoding) ؛ فعلى عكس مرحلة معالجة المدخلات الأولية (Prefill) ذات الحوسبة المتوازية، فإن توليد كل توكن جديد يتطلب قراءة كامل أوزان النموذج وذاكرة الكاش المؤقتة

اقرأ المزيد على الموقع