در سپتامبر ۲۰۲۶، گوگل با رونمایی رسمی از دو مدل صوتی پرچمدار Gemini 3.8 Live و Extended Thinking، یکی از بزرگترین بنبستهای تعامل انسان و کامپیوتر را شکست. هوش مصنوعی دیگر برای فکر کردن مکث نمیکند، بلکه همزمان استدلال کرده و سخن میگوید.
در سپتامبر سال ۲۰۲۶، شرکت گوگل با رونمایی رسمی از دو مدل صوتی پرچمدار خود تحت عنوان Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking، یکی از بزرگترین و کهنهترین بنبستهای تعامل انسان و کامپیوتر را
در هم شکست. برای سالها، تعامل صوتی با پیشرفتهترین مدلهای هوش مصنوعی جهان گرفتار یک پارادوکس آزاردهنده بود: یا مدلها مانند دستیارهای ساده سریع پاسخ میدادند اما از تفکر عمیق و منطق چندمرحلهای ناتوان
بودند، یا مانند مدلهای استدلالی پیشرفته برای حل مسائل ریاضی و پردازش دادهها به ۵ تا ۳۰ ثانیه زمان نیاز داشتند؛ زمانی که در یک تماس صوتی به «سکوت مرگبار» (Dead Air) تبدیل میشد و جریان زنده گفتوگو را
کاملاً نابود میکرد. اکنون گوگل با بازطراحی بنیادین معماری پردازش صوت و تفکیک جریان مکالمه از موتور استدلال زنجیرهای، مفهومی نوین به نام «تفکر در حین صحبت» (Thinking while Talking) را متولد کرده است.
در این معماری انقلابی، هوش مصنوعی دیگر برای فکر کردن مکث نمیکند؛ بلکه در همان لحظه که با آرامش و لحنی طبیعی میگوید «اجازه بدید من پایگاه داده رو بررسی کنم...»، در پسزمینه در حال اجرای کدهای پایتون،
کوئریهای SQL، فراخوانی ابزارهای خارجی و اعتبارسنجی فرضیات پیچیده است. این جهش تکنولوژیک، مرزهای رابط کاربری صوتی را بازتعریف کرده و ما را یک گام بزرگ به رویای تعامل کاملاً طبیعی با ماشین نزدیکتر میکند.
[IMAGE_PLACEHOLDER_1] برای درک اهمیت این دستاورد، نخست باید به کالبدشکافی ساختاری دوگانه گوگل نگاهی بیندازیم؛ جایی که غول مانتین ویو تصمیم گرفت به جای یک مدل همهکاره اما سنگین، دو ابزار متمایز را متناسب
با نیازهای تجاری و محاسباتی دنیا عرضه کند. استراتژی دوگانه گوگل: تفکیک سرعت آنی از استدلال سنگین توسعهدهندگان در شرکت گوگل دیپمایند و تیم تحقیقاتی جمینای در جریان ارزیابیهای میدانی دریافتند که الگوهای
ادامه مطلب در سایت