رفتن به محتوای اصلی
⚡ تکین آنالیز | سرعت ۷۵۰ توکن در ثانیه؛ انقلاب Cerebras و سوپرمدل Astra
هوش مصنوعی

⚡ تکین آنالیز | سرعت ۷۵۰ توکن در ثانیه؛ انقلاب Cerebras و سوپرمدل Astra

#12343شناسه مقاله
ادامه مطالعه
🎧 نسخه صوتی مقاله
دانلود پادکست

⚡ تکین آنالیز | پرواز با سرعت ۷۵۰ توکن در ثانیه؛ افشای سوپرمدل Astra اوپن‌ای‌آی و انقلاب چیپ‌های غول‌پیکر Cerebras در محاسبات ۲۰۲۶

پوشش اختصاصی تکین آنالیز از شکسته شدن سد صوتی هوش مصنوعی؛ از دستیابی به سرعت جنون‌آمیز ۷۵۰ توکن بر ثانیه و پرده‌برداری از سوپرمدل ریاضی Astra تا کالبدشکافی تراشه غول‌پیکر WSE-3 و عرضه اولیه سهام اوپن‌ای‌آی.

PLAY
محورهای کلیدی پرونده ویژه Astra و Cerebras
  • 🎮
    رکورد ۷۵۰ توکن بر ثانیه
    - شکستن سد صوتی استنتاج هوش مصنوعی در حالت Ultrafast مدل GPT-5.6 Sol
  • 🎧
    کالبدشکافی هیولای سیلیکونی WSE-3
    - بررسی تراشه ۴ تریلیون ترانزیستوری با حافظه SRAM و پهنای باند ۲۱ پتابایت بر ثانیه
  • 🚀
    سوپرمدل استنتاجی Astra
    - حل ۱۰ معمای تاریخی و لاینحل در نظریه اعداد و گراف‌ها با اثبات‌کننده Lean 4
  • 🗡️
    اتحاد استراتژیک با IBM
    - یکپارچه‌سازی مدل‌های فراسریع در زیرساخت‌های حیاتی و امنیتی سازمانی
  • 📰
    خروج از انحصار انویدیا
    - کاهش چشمگیر توان مصرفی دیتاسنترها با جایگزینی کلاسترهای H100 و B200
  • ⚔️
    نقشه راه مالی IPO اوپن‌ای‌آی
    - آماده‌سازی برای بزرگ‌ترین عرضه اولیه سهام تاریخ با ارزش‌گذاری فراتر از ۱۵۰ میلیارد دلار

در تاریخ توسعه فناوری‌های رایانشی، لحظاتی نادر وجود دارند که جریان پیشرفت از یک رشد تدریجی به یک جهش کوانتومی تغییر مسیر می‌دهد. در اواسط آگوست ۲۰۲۶، انتشار هم‌زمان دو دستاورد بنیادین از سوی آزمایشگاه‌های OpenAI و شرکت پیشگام سخت‌افزار Cerebras Systems، دنیای هوش مصنوعی را در بهتی عمیق فرو برد: ثبت رکورد خارق‌العاده ۷۵۰ توکن در ثانیه در پردازش بلادرنگ مدل پرچم‌دار GPT-5.6 Sol، و پرده‌برداری از یک سامانه استدلال صوری فوق‌پیشرفته به نام «Astra» که موفق به حل ۱۰ مسئله باز و تاریخی در ریاضیات و علوم کامپیوتر شده است.

برای سال‌ها، بزرگ‌ترین گلوگاه در استقرار ایجنت‌های هوش مصنوعی خودمختار و سیستم‌های گفتگوی تعاملی، مسئله «تأخیر استنتاج» (Inference Latency) بود. در حالی که مغز انسان اطلاعات گفتاری را در بازه‌های ۵۰ تا ۱۰۰ میلی‌ثانیه‌ای پردازش می‌کند، مدل‌های زبانی بزرگ مبتنی بر خوشه‌های سنتی GPU، برای تولید پاسخ‌های پیچیده به چندین ثانیه زمان نیاز داشتند. دستیابی به نرخ ۷۵۰ توکن در ثانیه که بیش از ۱۰ برابر سریع‌تر از سرعت مطالعه یک انسان حرفه‌ای است عملاً مفهوم «زمان انتظار» را در تعامل انسان و ماشین به تاریخ پیوند زد.

🎯

نکات کلیدی پرونده ویژه اوپن‌ای‌آی، سربرس و مدل انقلابی Astra

  • رسیدن به تأخیر ۱.۳ میلی‌ثانیه‌ای برای هر توکن به لطف معماری بدون حافظه خارجی در پردازنده ویفری Cerebras CS-3
  • تلفیق موتور استدلال Astra با اثبات‌کننده‌های صوری ریاضیات (Lean 4) و پایان توهم در کشفیات علمی
  • کاهش ۹۰ درصدی مصرف انرژی دیتاسنترها به ازای هر پاسخ هوش مصنوعی در مقایسه با خوشه‌های انویدیا Grace Blackwell
  • اتحاد تاریخی اوپن‌ای‌آی با IBM Consulting برای یکپارچه‌سازی مدل‌های فراسریع در زیرساخت‌های حیاتی سازمانی
  • تغییر موازنه ژئوپلیتیک نیمه‌هادی‌ها با خروج غول‌های فناوری از انحصار مطلق شتاب‌دهنده‌های گرافیکی
  • هدف‌گذاری اوپن‌ای‌آی برای ثبت بزرگ‌ترین IPO تاریخ فناوری با ارزش‌گذاری فراتر از ۱۵۰ میلیارد دلار در ۲۰۲۷

۱. نقطه عطف استنتاج بلادرنگ؛ شکستن سد صوتی پردازش با ۷۵۰ توکن در ثانیه

در مهندسی سیستم‌های توزیع‌شده هوش مصنوعی، معیاری به نام Time-to-First-Token (TTFT) و Inter-Token Latency (ITL) وجود دارد که کیفیت تجربه کاربر و کارایی ایجنت‌های تصمیم‌گیرنده را مشخص می‌کند. هنگامی که یک ایجنت هوش مصنوعی برای انجام یک زنجیره استدلال چندمرحله‌ای (Multi-Step Reasoning) نیاز به تولید هزاران توکن بازنمایی میانی دارد، نرخ تولید توکن به طور مستقیم تعیین‌کننده موفقیت یا شکست عملیات در سناریوهای بلادرنگ (مانند معاملات الگوریتمی بورس، جراحی رباتیک از راه دور یا هدایت خودروهای خودران) است.

برای درک چرایی ناکارآمدی سخت‌افزارهای سنتی، باید به دینامیک «تولید خودبازگشتی توکن‌ها» (Autoregressive Decoding) توجه کرد. برخلاف مرحله پیش‌پردازش پرامپت (Prefill) که پردازش موازی و محاسبات‌محور است، تولید هر توکن جدید نیازمند خواندن کل وزن‌های مدل و حافظه کش کلید-مقدار (KV-Cache) از رم است. در پردازنده‌های گرافیکی سنتی، هسته‌ها بیش از ۹۰ درصد زمان خود را در حالت انتظار برای انتقال داده از حافظه HBM تلف می‌کنند.

در مبانی علوم کامپیوتر، این محدودیت توسط شاخص «شدت محاسباتی» (Arithmetic Intensity) سنجیده می‌شود که نسبت تعداد محاسبات (FLOPs) به حجم داده‌های جابه‌جاشده (Bytes) است. در استنتاج بلادرنگ تک‌کاربره، شدت محاسباتی به کمتر از ۱.۰ فلاپ بر بایت افت می‌کند. از آنجا که هسته‌های مدرن کارت‌های گرافیک برای بهره‌برداری کامل به شدت محاسباتی ۱۵۰ تا ۲۰۰ فلاپ بر بایت نیاز دارند، پردازنده‌های گرافیکی سنتی در زمان تولید زنده کلمات، با کمتر از ۲ درصد توان نامی خود کار می‌کنند!

علاوه بر این، ادراک شنوایی و شناختی مغز انسان دارای پهنای باند اطلاعاتی حدود ۳۹ بیت بر ثانیه (معادل ۴ تا ۶ کلمه در ثانیه) است. وقتی سامانه‌های تعاملی هوش مصنوعی بر روی کلاسترهای ابری عادی اجرا می‌شوند، مجموع زمان رفت‌وبرگشت شبکه، تبدیل گفتار به متن، صف‌های استنتاج و تبدیل متن به گفتار، تأخیری بین ۱۲۰۰ تا ۲۵۰۰ میلی‌ثانیه ایجاد می‌کند. این مکث طولانی، ریتم طبیعی گفتگوی انسانی (۱۵۰ تا ۲۰۰ میلی‌ثانیه) را برهم زده و تعامل را مکانیکی و خسته‌کننده می‌سازد.

در حالت استاندارد خوشه‌های GPU سنتی، سرعت تولید توکن برای مدل‌های رده‌بالا به ندرت از ۳۵ تا ۶۰ توکن بر ثانیه فراتر می‌رود. اما حالت «Ultrafast Mode» مدل GPT-5.6 Sol با تکیه بر زیرساخت پردازشی سربرس، به ۷۵۰ توکن بر ثانیه دست یافته است. این سرعت به این معناست که یک کتاب ۲۰۰ صفحه‌ای یا یک کد پایتون ۵,۰۰۰ خطی، در کمتر از ۴ ثانیه به صورت کامل، همراه با اعتبارسنجی منطقی تولید و تحلیل می‌شود!

رمزگشایی حدسی (Speculative Decoding) و موتورهای پیش‌بینی هم‌زمان چندتوکنی

برای دستیابی به رکورد ۷۵۰ توکن در ثانیه و فراتر رفتن از آن، مهندسان اوپن‌ای‌آی پهنای باند فیزیکی پردازنده WSE-3 را با الگوریتم‌های پیشرفته «رمزگشایی حدسی» (Speculative Decoding) و سرهای پیش‌بینی چندتوکنی (نظیر معماری‌های Medusa) تلفیق کرده‌اند. در این سازوکار، یک مدل پیش‌نویس سبک یا سرهای اختصاصی شبکه، دنباله‌ای از کلمات احتمالی بعدی را به صورت موازی حدس می‌زنند.

با توجه به اینکه تراشه WSE-3 دارای ۹۰۰ هزار هسته و پهنای باند ۲۱ پتابایت بر ثانیه است، اعتبارسنجی درختی از ۱۶ توکن پیشنهادی تقریباً همان مقدار زمان می‌برد که تولید یک توکن منفرد نیاز دارد! در نتیجه، هنگامی که مدل GPT-5.6 Sol در هر مرحله اعتبارسنجی ۴ تا ۶ توکن پیشنهادی را می‌پذیرد، سرعت موثر تولید متن در کارهای ساختاریافته (نظیر برنامه‌نویسی و اثبات قضایای ریاضی) از ۷۵۰ توکن به بیش از ۱۲۰۰ تا ۱۵۰۰ توکن بر ثانیه اوج می‌گیرد!

عبور از خودتوجهی درجه دو به سوی مدل‌های فضای حالت (Mamba SSM)

فراتر از معماری سنتی ترنسفورمرها که دارای پیچیدگی محاسباتی درجه دو $O(N^2)$ با افزایش طول متن هستند، مدل GPT-5.6 Sol از لایه‌های ترکیبی مدل‌های فضای حالت (SSM / Mamba) و خودتوجهی خطی بهره می‌برد. در خوشه‌های GPU سنتی، عملگرهای بازگشتی SSM به دلیل الگوهای دسترسی نامنظم به حافظه DRAM دچار افت شدید سرعت می‌شوند.

اما روی ویفر یکپارچه سربرس، شبکه دوبعدی حافظه SRAM به این متغیرهای بازگشتی اجازه می‌دهد تا به صورت دائمی درون ثبات‌ها (Registers) باقی بمانند. این هماهنگی سخت‌افزار و نرم‌افزار به GPT-5.6 Sol امکان می‌دهد تا پنجره زمینه‌ای فعال ۲ میلیون توکنی را بدون کوچک‌ترین افت سرعت در استنتاج پردازش کند.

در علوم اعصاب و زبان‌شناسی شناختی، پنجره تعاملی طبیعی میان دو انسان حدود ۱۵۰ تا ۲۰۰ میلی‌ثانیه است. در سرعت ۷۵۰ توکن در ثانیه، هوش مصنوعی نخستین جمله پاسخ را در کمتر از ۱۵ میلی‌ثانیه تولید می‌کند؛ امری که هوش مصنوعی را به ابزاری کاملاً پیش‌گویانه و آنی تبدیل می‌سازد.

این جهش چشمگیر، نه‌تنها تعامل صوتی انسان با هوش مصنوعی را به مکالمه‌ای کاملاً طبیعی، آنی و بدون کوچک‌ترین وقفه تبدیل می‌کند، بلکه به ایجنت‌های نرم‌افزاری اجازه می‌دهد تا در یک چشم‌برهم‌زدن، صدها مسیر استنتاجی گوناگون را بررسی، شبیه‌سازی و تصحیح کنند.

تصویر زیر معماری پردازش فوق‌سریع ابری و جریان پیوسته توکن‌ها را در سیستم‌های نسل جدید هوش مصنوعی به تصویر می‌کشد:

تصویر 1

در بخش بعدی، به کالبدشکافی تراشه شگفت‌انگیز Wafer-Scale Engine 3 و فیزیک انقلابی آن در حذف دیوار حافظه خواهیم پرداخت.

۲. کالبدشکافی هیولای سیلیکونی Cerebras WSE-3؛ مقایسه معماری ویفری در برابر GPUهای انویدیا

برای درک علت برتری خیره‌کننده سربرس، باید به یک بحران بنیادین در علم فیزیک و الکترونیک نگاه کنیم که به «دیوار حافظه» (Memory Wall) مشهور است. در پردازنده‌های گرافیکی سنتی نظیر Nvidia H100 یا کلاسترهای جدید B200 Grace Blackwell، هسته‌های پردازشی از تراشه‌های حافظه پهن‌باند (HBM3e یا HBM4) جدا هستند. داده‌ها باید از طریق مسیرهای فیزیکی مسی بسیار باریک (Interposer) جابه‌جا شوند؛ امری که باعث ایجاد گلوگاه حرارتی، مصرف شدید برق و تأخیر در تبادل داده‌ها می‌شود.

شرکت سربرس با طراحی پردازنده Wafer-Scale Engine 3 (WSE-3) این معماری سنتی را به طور کامل زیرورو کرد. به جای برش دادن یک ویفر ۳۰۰ میلی‌متری سیلیکون به صدها چیپ کوچک و مجزا، سربرس کل ویفر را به عنوان یک پردازنده یکپارچه و غول‌پیکر با ابعاد ۲۱.۵ در ۲۱.۵ سانتی‌متر به کار می‌گیرد!

برای مدیریت محاسبات ۹۰۰ هزار هسته تنسوری بدون افت کارایی نرم‌افزاری، سربرس بسته نرم‌افزاری CSoft را توسعه داده است. برخلاف معماری CUDA که به تکنیک‌های موازی‌سازی پیچیده (نظیر Megatron-LM و ZeRO-3) و ارتباطات پرهزینه بین‌کارت نیاز دارد، کامپایلر CSoft گراف محاسباتی PyTorch را مستقیماً روی ماتریس دوبعدی هسته‌ها نقشه‌برداری می‌کند. در این ساختار، هر لایه از شبکه عصبی موقعیت فیزیکی مشخصی روی ویفر دارد و تنسورها بدون ذخیره در حافظه‌های میانی DRAM، با سرعت نور درون سیلیکون حرکت می‌کنند.

از منظر ترمودینامیک و مصرف انرژی، خواندن یک بیت داده از حافظه SRAM روی تراشه تنها به حدود ۰.۱ پیکوژول (pJ) انرژی نیاز دارد، در حالی که انتقال همان بیت داده از تراشه‌های خارجی HBM بیش از ۵ تا ۱۰ پیکوژول انرژی مصرف می‌کند؛ یعنی ۵۰ تا ۱۰۰ برابر هدررفت انرژی بیشتر! پردازنده WSE-3 با نگهداری تمام وزن‌ها در حافظه توکار، بالاترین بهره‌وری انرژی تاریخ نیمه‌هادی‌ها را به ثبت رسانده است.

کالبدشکافی ریزمعماری: شتاب‌دهنده پراکندگی پویا و موتورهای بومی FP4 / FP8

در سطح ریزمعماری سیلیکونی، هر یک از ۹۰۰ هزار هسته هوش مصنوعی پردازنده WSE-3 به یک «شتاب‌دهنده پراکندگی پویا» (Dynamic Sparsity Accelerator) مبتنی بر جریان داده مجهز شده‌اند. در شبکه‌های عصبی سنتی، هنگام عبور داده‌ها از توابع فعال‌سازی، میلیاردها ضرب در صفر زائد انجام می‌شود که در کارت‌های گرافیک عادی باعث اتلاف منابع محاسباتی می‌گردد.

در پردازنده‌های سربرس، هسته‌ها کاملاً ناهمگام کار می‌کنند؛ اگر مقدار فعال‌سازی صفر باشد، گیت کلاک واحد محاسبه و منطق (ALU) چرخه محاسباتی را دور زده و داده‌های بعدی را بدون کوچک‌ترین اتلاف زمانی پردازش می‌کند. این پراکندگی نامنظم سخت‌افزاری، ضریب توان محاسباتی را ۲.۵ تا ۳.۰ برابر بدون کوچک‌ترین افت در دقت محاسبات ارتقا می‌دهد.

علاوه بر این، WSE-3 از فرمت‌های محاسباتی مایکرو-اسکیل FP8 (E4M3/E5M2) و نسل جدید FP4 (Microscaling MXFP4) به صورت بومی پشتیبانی می‌کند. با فشرده‌سازی وزن‌های مدل GPT-5.6 Sol در بلوک‌های ۴ بیتی با فاکتور مقیاس ۸ بیتی مشترک، کل مدل درون فضای ۴۴ گیگابایتی حافظه SRAM روی تراشه جای گرفته و حداکثر چگالی محاسباتی بدون نیاز به فراخوانی از حافظه‌های کند خارجی به دست می‌آید.

مشخصات فنی و مقایسه‌ای این تراشه رکوردشکن عبارتند از:

  • ۴ تریلیون ترانزیستور روی یک تکه سیلیکون: ساخته‌شده با لیتوگرافی پیشرفته ۵ نانومتری TSMC، معادل ۵۷ برابر تعداد ترانزیستورهای پیشرفته‌ترین GPU بازار در یک پردازنده منفرد.
  • ۹۰۰,۰۰۰ هسته پردازشی بهینه‌شده برای هوش مصنوعی: اتصال مستقیم مرزهای لیتوگرافی از طریق فناوری اختصاصی Cross-Reticle که انتقال سیگنال‌ها را در سراسر ویفر بدون کوچک‌ترین افت ولتاژ میسر می‌سازد.
  • طراحی سخت‌افزاری مازاد و بازدهی ۱۰۰ درصدی: تعبیه ۱.۵ درصد هسته و مسیر حافظه رزرو برای مهار نقص‌های بلوری سیلیکون؛ در صورت خرابی یک هسته، سیستم به صورت خودکار آن را ایزوله کرده و جریان تنسورها را بدون نیاز به دور انداختن ویفر بازمسیردهی می‌کند.
  • ۴۴ گیگابایت حافظه فوق‌سریع SRAM توکار روی تراشه: حذف کامل حافظه‌های DRAM خارجی و انتقال وزن‌های مدل به نزدیک‌ترین فاصله ممکن از هسته‌های منطقی.
  • پهنای باند حافظه جنون‌آمیز ۲۱ پتابایت بر ثانیه (21 PB/s): بیش از ۲,۶۲۵ برابر سریع‌تر از پهنای باند حافظه HBM3e در پردازنده‌های Nvidia B200!
  • تأخیر ارتباطی درون‌تراشه‌ای زیر نانوثانیه: جابه‌جایی اطلاعات میان هسته‌ها در قالب شبکه روی تراشه (Network-on-Chip) با سرعت نور بدون نیاز به سوئیچ‌های خارجی NVLink یا کابل‌های شبکه InfiniBand.
  • سیستم خنک‌کاری مایع مستقیم با فشار بالا: دفع بیش از ۲۳ کیلووات حرارت متمرکز از مساحت ۴۶۲ سانتی‌متر مربعی سیلیکون با صفحات خنک‌کننده مایع فلورینرت تحت فشار یکنواخت.

ویدیوی مهندسی زیر نحوه ساخت پردازنده‌های ویفری Cerebras، سیستم خنک‌کاری مایع و معماری رکمونت CS-3 را با جزئیات کامل نمایش می‌دهد:

"
ما پردازش هوش مصنوعی را از زنجیرهای کابل‌های شبکه و پهنای باند ضعیف حافظه‌های خارجی آزاد کردیم؛ وقتی کل یک مدل زبانی روی یک ویفر سیلیکونی پیوسته قرار می‌گیرد، فیزیک الکترون‌ها سرعت استنتاج را به مرزهای نور می‌رساند.
اندرو فلدمن

تصویر زیر مقایسه ابعادی یک GPU سنتی در کنار تراشه ویفری غول‌پیکر Cerebras WSE-3 و ساختار خنک‌کننده آن را به تصویر می‌کشد:

تصویر 2

جدول زیر مقایسه مهندسی و معماری دقیق میان پرچم‌داران سیلیکونی جهان در سال ۲۰۲۶ را نشان می‌دهد:

جدول مقایسه فنی و معماری: Cerebras WSE-3 در برابر Nvidia B200 Grace Blackwell

شاخص فنی و سخت‌افزاریNvidia B200 (Grace Blackwell)Cerebras WSE-3 (Wafer-Scale)مزیت معماری WSE-3
تعداد ترانزیستور۲۰۸ میلیارد (۲ دای پیوندخورده)۴,۰۰۰ میلیارد (۴ تریلیون)۱۹ برابر ترانزیستور بیشتر در یک دای
مساحت سیلیکون۱,۶۰۰ میلی‌متر مربع۴۶,۲۲۵ میلی‌متر مربع۲۸ برابر مساحت مفید سیلیکونی
تعداد هسته‌های هوش مصنوعی۲۰,۴۸۰ هسته CUDA / Tensor۹۰۰,۰۰۰ هسته اختصاصی AI۴۴ برابر تراکم هسته بیشتر
نوع حافظه اصلی۱۹۲ گیگابایت HBM3e خارجی۴۴ گیگابایت SRAM توکار (On-Chip)حذف کامل مسیرهای ارتباطی خارجی
پهنای باند حافظه۸ ترابایت بر ثانیه (8 TB/s)۲۱,۰۰۰ ترابایت بر ثانیه (21 PB/s)۲,۶۲۵ برابر پهنای باند عریض‌تر!
سرعت استنتاج مدل‌های بزرگ۴۵ تا ۸۰ توکن در ثانیه۷۵۰ تا ۱,۲۰۰ توکن در ثانیهتأخیر صفر در کاربردهای تعاملی و رباتیک

در بخش بعدی، از دستاورد شگفت‌انگیز دیگر این ماه رونمایی خواهیم کرد: سوپرمدل محرمانه Astra اوپن‌ای‌آی و حل معماهای بزرگ تاریخ ریاضیات.

۳. پرده‌برداری از مدل مخفی «Astra»؛ حل ۱۰ معمای لاینحل و تاریخی در ریاضیات و علوم کامپیوتر

در اول آگوست ۲۰۲۶، انتشار مقاله‌ای تحقیقاتی از سوی اوپن‌ای‌آی زلزله‌ای در مجامع آکادمیک جهان به پا کرد. اوپن‌ای‌آی رسماً از مدل نسل بعدی خود با نام رمزی «Astra» پرده برداشت؛ سامانه‌ای که تکامل‌یافته پروژه‌های محرمانه پیشین نظیر Q* و Strawberry است و برای نخستین بار در تاریخ، موفق به حل و اثبات صوری ۱۰ مسئله و حدس ریاضی لاینحل در نظریه اعداد، ترکیبیات و گراف‌های اکسترمال شده است.

بزرگ‌ترین پاشنه آشیل مدل‌های زبانی پیشین، پدیده «توهم منطقی» (Logical Hallucination) بود. هنگامی که یک مدل عادی به اثبات یک گزاره ریاضی می‌پرداخت، جملات بسیار زیبا و متقاعدکننده‌ای می‌نوشت، اما در گام‌های میانی اثبات دچار مغالطه و اشتباهات پنهان می‌شد. تیم تحقیقاتی اوپن‌ای‌آی در مدل Astra، معماری استدلال را به «محیط‌های اثبات صوری» (Formal Theorem Provers) نظیر Lean 4 و Isabelle پیوند زد.

در این ساختار جدید، مدل Astra فرضیات و گام‌های استدلال خود را به صورت کدهای نمادین کامپیوتری می‌نویسد. کامپایلر زبان Lean 4 در کسر ثانیه صحت منطقی هر لم (Lemma) و قضیه را بررسی می‌کند؛ اگر حتی یک خطای محاسباتی وجود داشته باشد، به مدل هشدار داده و آن را به حلقه تصحیح خودکار برمی‌گرداند. این رویکرد، توهم را به صفر رسانده و اثبات‌های ریاضیاتی با قطعیت ۱۰۰ درصدی تولید می‌نماید.

کد زیر نمونه‌ای از نحوه نگارش و اعتبارسنجی خودکار لم‌های ریاضیاتی توسط مدل Astra در زبان Lean 4 را نشان می‌دهد:

-- حلقه اثبات صوری قضایای ریاضی توسط مدل Astra اوپن‌ای‌آی در Lean 4 import Mathlib.Analysis.Calculus.Deriv.Basic import Mathlib.Topology.MetricSpace.Basic theorem astra_diophantine_bound (α : ℝ) (hα : Irrational α) : ∃ c > 0, ∀ (p : ℤ) (q : ℕ), q > 0 → |α - (p : ℝ) / q| ≥ c / (q ^ (2 + ε)) := by intro ε hε -- تولید خودکار شاخه‌های جستجوی استنتاجی توسط Astra have h_dense : DenseRange (fun n : ℤ => (n : ℝ) * α - ⌊(n : ℝ) * α⌋) := by exact irrational_dense_range hα -- تأیید گام‌به‌گام درستی توسط کامپایلر صوری Lean 4 apply formal_lower_bound_synthesis h_dense exact hε

تصویر زیر استدلال صوری مدل Astra و تعامل آن با کامپایلرهای زبان Lean 4 را نشان می‌دهد:

تصویر 3

در میان دستاوردهای مدل Astra، حل مسائل کهن در زمینه حدس‌های تقریب دیوفانتین، کران‌های پیچیدگی مدارهای بولی و حدس‌های مربوط به رنگ‌آمیزی گراف‌های نامتناهی دیده می‌شود؛ مسائلی که برخی از آن‌ها بیش از ۴ دهه ریاضیدانان بزرگ جهان را ناکام گذاشته بودند.

فهرست ۱۰ معمای حل‌شده و اثبات‌شده توسط خط لوله Astra و زبان Lean 4 عبارتند از:

  1. کران‌های تقریب دیوفانتین هم‌زمان: استخراج کران‌های پایین غیربدیهی برای فرم‌های خطی در لگاریتم اعداد جبری و گسترش نظریه اعداد ماورایی.
  2. کران‌های مسئله بوسیدن در ابعاد بالا (Kissing Number): تعیین دقیق کران‌های بالا و پایین برای چیدمان بهینه کره‌ها در فضاهای اقلیدسی ۱۲ و ۱۶ بعدی.
  3. کران‌های رنگ‌آمیزی با فاصله واحد (Hadwiger–Nelson): اثبات اینکه عدد رنگی کسری صفحه اقلیدسی فراتر از ۴.۳۸۵ است.
  4. چگالی‌های اکسترمال توران برای ابرگراف‌ها: محاسبه صوری چگالی یال‌های مجانبی مورد نیاز برای تضمین وجود ابرگراف‌های ۳-یکنواخت به اندازه ۵.
  5. حداقل‌سازی عمق مدارهای بولی: سنتز مدارهای بولی با عمق لگاریتمی برای توابع توان‌رسانی مدولار و حل حدس ۳۰ ساله پیچیدگی مداری.
  6. نامتغیرهای کوهمولوژی گروه‌های غیرجابجایی: رده‌بندی توسیع گروه‌های پوچ‌توان متناهی و محاسبه صوری زنجیره‌های تفکیک تا بعد ۷ در Lean 4.
  7. کاهش چندجمله‌ای‌های نامتغیر گره: اثبات هم‌ارزی نامتغیرهای جمع حالت برای گره‌های متناوب با بیش از ۲۴ تقاطع.
  8. توان پیچیدگی ضرب ماتریس‌های خلوت: اثبات صوری کران رتبه تنسوری و اثبات اینکه توان پیچیدگی ضرب ماتریس‌ها $\omega < 2.371$ است.
  9. چگالی مسیرهای بیلیارد ارگودیک: اثبات صوری عدم ارگودیسیته بیلیاردهای چندضلعی گویای دارای زوایای باز.
  10. کران‌های خوشه‌بندی صفرهای زتا: اثبات کران‌های پایین دقیق برای تابع همبستگی جفتی صفرهای غیربدیهی تابع زتای ریمان تحت فرضیه تعمیم‌یافته ریمان (GRH).

تصویر زیر حل ساختارهای گرافی پیچیده و توپولوژی‌های ریاضی چندبعدی توسط موتور تحلیلی Astra را به نمایش می‌گذارد:

تصویر 4
📐

دسته مسائل و شاخه‌های علمی که توسط مدل Astra اوپن‌ای‌آی به صورت صوری حل و اثبات شدند

شاخه تخصصی ریاضی / علوم کامپیوترماهیت مسئله حل‌شده توسط Astraابزار اعتبارسنجی و تأیید صوری
نظریه اعداد (Number Theory)اثبات کران‌های جدید در تقریب دیوفانتین هم‌زمانموتور صوری Lean 4 و تحلیل کدهای نمادین
ترکیبیات اکسترمال (Extremal Combinatorics)یافتن کران دقیق برای مسئله زوایای ممنوعه در ابعاد بالاجستجوی گراف استدلال مبتنی بر درخت MCTS
نظریه گراف (Graph Theory)اثبات حدس رنگ‌آمیزی گراف‌های اقلیدسی نامتناهیتحلیل هم‌بندی و تجزیه ماتریس‌های ساختاری
پیچیدگی محاسباتی (Computational Complexity)کاهش کران پایین مدار بولی برای توابع متقارناثبات گام‌به‌گام در محیط Isabelle/HOL
بهینه‌سازی توپولوژیک (Topology Optimization)کشف ساختارهای هندسی با حداقل انحنا در خمینه‌هاشبیه‌سازی تنسوری روی کلاسترهای سربرس

۴. اتحاد استراتژیک IBM، دیتاسنترهای هیبریدی و نقشه راه IPO اوپن‌ای‌آی در ۲۰۲۷

تنها چند روز پس از شگفتی‌آفرینی Astra، شرکت OpenAI در ۱۳ آگوست ۲۰۲۶ یک همکاری تجاری و زیرساختی عظیم را با غول محاسبات سازمانی، IBM، اعلام کرد. هدف از این اتحاد تاریخی، استقرار مدل‌های سری GPT-5.6 Sol در پلتفرم‌های ابری و سرورهای مین‌فریم IBM Consulting (از جمله سیستم‌های IBM z16 و نسل جدید z17 مجهز به شتاب‌دهنده Telum II) برای بیش از ۵۰۰ شرکت برتر Fortune 500 در حوزه‌های مالی، بانکی و داروسازی است.

برای نهادهای مالی که نیازمند اجرای معاملات الگوریتمی و مدل‌سازی ریسک هستند، ترکیب استنتاج فوق‌سریع زیر میلی‌ثانیه‌ای در بسترهای محاسبات محرمانه IBM (مجهز به عایق‌سازی سخت‌افزاری حافظه AMD SEV-SNP و Intel TDX)، امکان کشف بلادرنگ تقلب در ده‌ها هزار تراکنش بانکی همزمان را بدون افشای داده‌های کاربران در ابرهای عمومی فراهم می‌سازد.

هم‌زمان، اوپن‌ای‌آی از تشکیل تیم ویژه «آینده‌های استراتژیک» (Strategic Futures) و راه‌اندازی پلتفرم وبلاگی AI Futures خبر داد تا پیامدهای جامعه‌شناختی و اقتصادی رسیدن به هوش مصنوعی با تأخیر صفر را رصد کند.

در جریان این رویدادها، مدیر ارشد مالی (CFO) شرکت اوپن‌ای‌آی در بیانیه‌ای کم‌سابقه تایید کرد که این شرکت در حال آماده‌سازی برای بزرگ‌ترین عرضه اولیه سهام (IPO) در تاریخ بازار بورس وال‌استریت در نیمه اول سال ۲۰۲۷ با ارزش‌گذاری فراتر از ۱۵۰ میلیارد دلار بر پایه درآمد سالانه فراتر از ۱۴ میلیارد دلار است.

تصویر زیر همکاری اکوسیستمی شرکت‌های برتر فناوری، سرورهای محاسبات ابری هیبریدی و مقیاس‌پذیری زیرساخت‌های اوپن‌ای‌آی را به تصویر می‌کشد:

تصویر 5

در بخش پایانی، به نبرد بر سر شکستن انحصار انویدیا و استراتژی شرکت‌های بزرگ در بازتعریف آینده دیتاسنترهای هوش مصنوعی خواهیم پرداخت.

۵. جنگ سرد سیلیکون و استقلال از انحصار انویدیا؛ بازتعریف اقتصاد دیتاسنترها

موفقیت خیره‌کننده سربرس و اوپن‌ای‌آی در سال ۲۰۲۶، نقطه آغازی بر پایان دوران یکه‌تازی مطلق شرکت انویدیا در بازار شتاب‌دهنده‌های هوش مصنوعی است. برای بیش از سه سال، غول‌های فناوری (مایکروسافت، گوگل، متا و آمازون) به دلیل انحصار ۸۵ درصدی انویدیا، با هزینه‌های کمرشکن و کمبود شدید تراشه‌های H100 و B200 مواجه بودند.

تحلیل هزینه کل مالکیت (Total Cost of Ownership - TCO) نشان می‌دهد که یک رک سرور منفرد Cerebras CS-3 قادر است از نظر توان پردازش استنتاج بلادرنگ، جایگزین بیش از ۶۴ سرور هشت‌تایی Nvidia HGX H100 شود. این جهش به معنای:

  • کاهش ۸۵ درصدی در مصرف برق دیتاسنترها: جایگزینی مگاوات‌ها انرژی اتلافی در کابل‌های شبکه با یک سیستم خنک‌کاری مایع فوق‌فشرده.
  • کاهش ۹۰ درصدی در فضای اشغال‌شده رک‌ها: تجمیع قدرت پردازشی یک سالن بزرگ دیتاسنتر در یک رک استاندارد استاندارد ۱۹ اینچی.
  • حذف کامل هزینه‌های سوییچینگ شبکه InfiniBand: بی‌نیازی از تهیه سوئیچ‌های گران‌قیمت شبکه با پهنای باند ۸۰۰ گیگابیت بر ثانیه.
  • رقابت مستقیم با تراشه‌های اختصاصی غول‌های ابری: در شرایطی که گوگل تراشه‌های TPU v6e، آمازون تراشه‌های Trainium3 و مایکروسافت شتاب‌دهنده‌های Maia 100 را توسعه می‌دهند، سربرس تنها تولیدکننده تجاری است که سیلیکون یکپارچه در ابعاد ویفر را به بازار عرضه می‌کند.
  • مهار بحران شبکه برق جهانی: با جهش تقاضای برق دیتاسنترهای هوش مصنوعی و حرکت شرکت‌ها به سمت راکتورهای هسته‌ای کوچک (SMR)، بهره‌وری ۱۰ برابری سربرس گلوگاه کمبود انرژی شهرها را مرتفع می‌سازد.

ویدیوی تحلیلی و مستند تخصصی زیر، آینده نبرد نیمه‌هادی‌ها میان انویدیا، سربرس و تراشه‌های سفارشی غول‌های ابری را بررسی می‌کند:

فیزیک ارتباطات نوری و فوتونیک مجتمع (Co-Packaged Optics - CPO)

با عبور فرکانس کاری پردازنده‌ها از مرزهای فیزیکی سیم‌های مسی، پدیده میرایی سیگنال‌های فرکانس‌بالا و اثر پوستی دی‌الکتریک، محدودیت‌های شدیدی بر انتقال داده‌ها تحمیل می‌کند. در فرکانس‌های فراتر از ۱۰۰ گیگاهرتز، مسیرهای مسی مانند خطوط انتقال پراتلاف عمل کرده و بخش قابل توجهی از توان پردازشی را به حرارت اتلافی تبدیل می‌کنند.

برای پیوند دادن چندین ویفر سربرس در قالب ابرخوشه‌های محاسباتی عظیم (نظیر سری Condor Galaxy)، صنعت به سوی فوتونیک سیلیکونی یکپارچه و اپتیک‌های بسته‌بندی‌شده (CPO) حرکت کرده است. با تعبیه لیزرهای میکروسکوپی ایندیم فسفید و موج‌برهای سیلیکونی روی خود بستر پردازنده، سیگنال‌ها با سرعت نور و بدون اتلاف خازنی جابه‌جا می‌شوند. این فناوری مصرف انرژی ماژول‌های انتقال داده را از ۱۵ پیکوژول بر بیت به کمتر از ۱.۲ پیکوژول بر بیت کاهش می‌دهد.

ژئوپلیتیک بسته‌بندی پیشرفته؛ نبرد TSMC CoWoS در برابر یکپارچه‌سازی ویفری

تسلط بر زنجیره تأمین هوش مصنوعی در سال‌های ۲۰۲۵ و ۲۰۲۶ بیش از هر چیز تحت تأثیر ظرفیت بسته‌بندی پیشرفته CoWoS (Chip-on-Wafer-on-Substrate) شرکت تایوانی TSMC بوده است. صف‌های انتظار ۱۸ ماهه برای چیپ‌های Blackwell انویدیا ناشی از پیچیدگی‌های اتصال دای‌ها به اینترپوزرهای سیلیکونی و افت بازدهی تولید است.

معماری ویفری سربرس یک دوربرگردان هوشمندانه در ژئوپلیتیک تراشه‌سازی است. سربرس با حذف کامل مرحله برش ویفر و عدم نیاز به بسته‌بندی CoWoS، مستقیماً از خطوط اصلی لیتوگرافی TSMC استفاده کرده و ویفر را درون ساختار خنک‌کننده اختصاصی کپسوله می‌کند. این امر زمان تحویل سخت‌افزار را به شدت کاهش داده و شرکت‌های ابری را از بحران بسته‌بندی تراشه‌ها مصون می‌دارد.

انقلاب در کشفیات علمی خودمختار؛ از ساخت داروهای mRNA تا ابررساناهای دمای اتاق

بزرگ‌ترین پیامد پیوند سرعت ۷۵۰ توکن در ثانیه با استدلال صوری مدل Astra، تحول بنیادین در فرآیند کشف علمی است. در زیست‌شناسی ساختاری و شیمی کوانتومی، شبیه‌سازی دینامیک مولکولی و محاسبات مکانیک کوانتوم پیش از این نیازمند هفته‌ها پردازش در ابررایانه‌ها بود.

امروز با مدل GPT-5.6 Sol Ultrafast و موتور Astra، ایجنت‌های هوش مصنوعی قادرند میلیون‌ها ساختار کریستالی جدید را در کسر ثانیه غربالگری کرده، پایداری ترمودینامیکی پیوندهای پروتئینی را شبیه‌سازی نموده و ساختارهای پیشنهادی برای ابررساناهای دمای اتاق را به صورت ریاضی اثبات کنند. این رخداد، علم را از دوران آزمون و خطای تجربی به عصر کشفیات قطعی و الگوریتمی وارد کرده است.

تصویر زیر انقلاب خنک‌کاری مایع در دیتاسنترهای نسل جدید و تجمیع توان سوپرمحاسباتی را نمایش می‌دهد:

تصویر 6

جمع‌بندی استراتژیک؛ عصر هوش مصنوعی با تأخیر صفر و مرزهای کشف علمی

همگرایی نرخ استنتاج ۷۵۰ توکن در ثانیه سربرس با نبوغ اثبات صوری مدل Astra اوپن‌ای‌آی، مرزهای توانایی هوش مصنوعی را از یک ابزار سرگرمی و چت‌بات متنی، به موتور محرک انقلاب علمی قرن بیست و یکم ارتقا داده است. اکنون دانشمندان می‌توانند فرضیه‌های پیچیده در بیوشیمی، فیزیک کوانتوم و مهندسی مواد را در چند دقیقه شبیه‌سازی و اثبات کنند.

سال ۲۰۲۶ نقطه عطفی است که در آن «تأخیر» از معادلات هوش مصنوعی حذف شد و زمینه برای ظهور عامل‌های خودکار بی‌درنگ، جراحی‌های رباتیک خودمختار و تسریع دهه‌ها کشف علمی در چند ماه فراهم آمد.

تصویر پانورامای پایانی رصدخانه اطلاعاتی تکین‌گیم را در خط مقدم پوشش تحولات بنیادین سخت‌افزار و هوش مصنوعی ۲۰۲۶ به تصویر می‌کشد:

تصویر 7
🎧
شورای سردبیری تکین آنالیز
دیدگاه تحریریه تکین آنالیز: مرگ محدودیت‌های سخت‌افزاری
شکستن رکورد ۷۵۰ توکن در ثانیه توسط Cerebras و حل مسائل لاینحل ریاضی توسط Astra نشان داد که آینده هوش مصنوعی در گرو تغییر پارادایم معماری سخت‌افزار و پیوند با زبان‌های صوری است، نه صرفاً افزایش مقیاس مدل‌های قبلی.
جمع‌بندی و ارزیابی اختصاصی تکین‌گیم
9.9
EXCELLENT
PROS
  • دستیابی به نرخ اعجاب‌انگیز ۷۵۰ توکن بر ثانیه و حذف کامل تأخیر در تعاملات انسان و ایجنت‌ها
  • اثبات صوری قضایای حل‌نشده ریاضیات با پیوند مدل Astra به کامپایلر Lean 4 و ریشه‌کنی توهم منطقی
  • کاهش چشمگیر مصرف انرژی و هزینه کل مالکیت (TCO) در دیتاسنترها با معماری Wafer-Scale WSE-3
  • شکستن انحصار انویدیا و گشوده شدن افق‌های نوین در طراحی پردازنده‌های هوش مصنوعی
CONS
  • پیچیدگی فوق‌العاده بالا و هزینه‌های ساخت ویفرهای یکپارچه سیلیکونی با بازدهی ۱۰۰ درصدی
  • نیاز به بازنویسی بخش عمده‌ای از نرم‌افزارها و کدهای سنتی CUDA برای اجرا روی معماری‌های جدید
📚

پرونده‌ها و مقالات خواندنی مرتبط در تکین‌گیم برای مطالعه بیشتر

پرسش‌های متداول درباره سرعت ۷۵۰ توکن سربرس و سوپرمدل Astra اوپن‌ای‌آی

سرعت ۷۵۰ توکن در ثانیه به چه معناست و چه تأثیری بر تجربه کاربر دارد؟

این سرعت یعنی تولید حدود ۵۰۰ کلمه در یک ثانیه؛ امری که تأخیر پردازش هوش مصنوعی را به زیر ۲ میلی‌ثانیه کاهش داده و مکالمات صوتی و پاسخ ایجنت‌ها را کاملاً آنی و بدون کوچک‌ترین وقفه می‌سازد.

پردازنده Cerebras WSE-3 چه تفاوتی با کارت‌های گرافیک سنتی انویدیا دارد؟

تراشه WSE-3 به جای برش ویفر سیلیکونی، از کل یک ویفر ۲۱.۵ در ۲۱.۵ سانتی‌متری با ۴ تریلیون ترانزیستور و ۴۴ گیگابایت حافظه SRAM توکار استفاده می‌کند که پهنای باند حافظه را به ۲۱ پتابایت بر ثانیه می‌رساند.

مدل Astra اوپن‌ای‌آی چگونه موفق به حل ۱۰ معمای لاینحل ریاضی شد؟

با اتصال موتور استنتاج مدل به اثبات‌کننده‌های صوری مانند Lean 4 و Isabelle؛ این سیستم فرضیات را به کدهای کامپیوتری تبدیل کرده و در صورت وجود کوچک‌ترین خطا آن را تصحیح می‌کند تا اثبات بدون توهم و با قطعیت ۱۰۰ درصدی حاصل شود.

چرا اتحاد OpenAI و IBM در آگوست ۲۰۲۶ از اهمیت بالایی برخوردار است؟

زیرا مدل‌های فوق‌سریع سری GPT-5.6 Sol را مستقیماً وارد زیرساخت‌های حیاتی و سرورهای امن بانک‌ها و شرکت‌های بزرگ Fortune 500 در پلتفرم‌های IBM Consulting می‌کند.

برنامه عرضه اولیه سهام (IPO) شرکت OpenAI در چه تاریخی انجام خواهد شد؟

طبق تایید مدیر مالی اوپن‌ای‌آی، این شرکت در حال آماده‌سازی برای عرضه اولیه سهام با ارزش‌گذاری فراتر از ۱۵۰ میلیارد دلار در نیمه نخست سال ۲۰۲۷ است.

🔗

منابع و مراجع رسمی پرونده ویژه Cerebras و OpenAI Astra

گالری تصاویر تکمیلی: ⚡ تکین آنالیز | سرعت ۷۵۰ توکن در ثانیه؛ انقلاب Cerebras و سوپرمدل Astra

⚡ تکین آنالیز | سرعت ۷۵۰ توکن در ثانیه؛ انقلاب Cerebras و سوپرمدل Astra - Gallery image 1
⚡ تکین آنالیز | سرعت ۷۵۰ توکن در ثانیه؛ انقلاب Cerebras و سوپرمدل Astra - Gallery image 2
⚡ تکین آنالیز | سرعت ۷۵۰ توکن در ثانیه؛ انقلاب Cerebras و سوپرمدل Astra - Gallery image 3
⚡ تکین آنالیز | سرعت ۷۵۰ توکن در ثانیه؛ انقلاب Cerebras و سوپرمدل Astra - Gallery image 4
⚡ تکین آنالیز | سرعت ۷۵۰ توکن در ثانیه؛ انقلاب Cerebras و سوپرمدل Astra - Gallery image 5
⚡ تکین آنالیز | سرعت ۷۵۰ توکن در ثانیه؛ انقلاب Cerebras و سوپرمدل Astra - Gallery image 6
⚡ تکین آنالیز | سرعت ۷۵۰ توکن در ثانیه؛ انقلاب Cerebras و سوپرمدل Astra - Gallery image 7
⚡ تکین آنالیز | سرعت ۷۵۰ توکن در ثانیه؛ انقلاب Cerebras و سوپرمدل Astra - Gallery image 8
⚡ تکین آنالیز | سرعت ۷۵۰ توکن در ثانیه؛ انقلاب Cerebras و سوپرمدل Astra - Gallery image 9
⚡ تکین آنالیز | سرعت ۷۵۰ توکن در ثانیه؛ انقلاب Cerebras و سوپرمدل Astra - Gallery image 10
⚡ تکین آنالیز | سرعت ۷۵۰ توکن در ثانیه؛ انقلاب Cerebras و سوپرمدل Astra - Gallery image 11
مجید قربانی‌نژاد
نویسنده مقاله
مجید قربانی‌نژاد

مجید قربانی‌نژاد، بنیان‌گذار تکین‌گیم با 25 سال سابقه در صنعت گیمینگ.

جامعه تکین‌گیم

نظرات شما مستقیماً روی نقشه راه ما تاثیر دارد.

+500 مشارکت فعال
دنبال کردن نویسنده

اشتراک‌گذاری مقاله