تراشه فروزن وی۲ گوگل؛ جهشی در هوش مصنوعی کم تاخیر

گوگل با تراشه آزمایشی فروزن وی۲ می‌خواهد بخشی از معماری جمینای را وارد سیلیکون کند تا پردازش هوش مصنوعی کم‌مصرف‌تر، سریع‌تر و کم‌تاخیرتر شود.

.4 دیدگاه
تراشه فروزن وی۲ گوگل؛ جهشی در هوش مصنوعی کم تاخیر

4 دقیقه

دنبال کردن در گوگل

تصور کنید یک تراشه سرور نه فقط یک مدل را اجرا کند، بلکه با ظرافت از نقشه راه همان مدل پیروی کند. مهندسان گوگل بی‌سروصدا دقیقا در حال ساخت چنین چیزی هستند: یک شتاب‌دهنده سرور با نام رمز فروزن وی۲ که بخش‌هایی از معماری جمینای را در سیلیکون جای می‌دهد و هدف آن افزایش چشمگیر بهره‌وری و کاهش تأخیر است.

این اطلاعات از گزارشی در نشریه اینفورمیشن به نقل از دو منبع آگاه به دست آمده است. ادعای آن‌ها قابل توجه است: فروزن وی۲ می‌تواند به ازای هر وات، شش تا ده برابر بیشتر از جدیدترین واحدهای پردازش تنسور گوگل، توکن پردازش کند. زمان هدف چه موقع است؟ سال ۲۰۲۸. انگیزه نیز روشن و برای هر کسی که رشد تقاضای رایانش ابری را فراتر از ظرفیت موجود دیده باشد، آشناست؛ طبق گزارش‌ها، گوگل کلاد به دلیل فشار شدید تقاضا برای پردازش هوش مصنوعی ناچار شده برخی قراردادهای مشتریان را رد کند.

جاسازی معماری به جای قوانین

واحدهای پردازش تنسور و پردازنده‌های گرافیکی سنتی، سخت‌افزارهایی همه‌منظوره هستند. شما یک مدل را بارگذاری می‌کنید و سخت‌افزار تصمیم‌های زیادی را هنگام اجرا می‌گیرد؛ اینکه داده‌ها چگونه جابه‌جا شوند، کدام عملیات زمان‌بندی شود و چه زمانی حافظه فراخوانی شود. این انعطاف‌پذیری قدرتمند است، اما سربار هم دارد. فروزن وی۲ مسیر متفاوتی را دنبال می‌کند: برخی تصمیم‌های اختصاصی جمینای را در منطق سطح ترانزیستور ثابت می‌کند. نتیجه، مراحل اجرایی کمتر و جابه‌جایی داده کمتر برای هر درخواست است. حرکت کمتر. سربار کمتر. تأخیر پایین‌تر. در نتیجه، کاربردهای تازه و بلادرنگ واقع‌بینانه‌تر می‌شوند.

ایده‌ای حتی جسورانه‌تر نیز روی میز بود. طبق گزارش‌ها، طراحی‌های اولیه فروزن به رهبری جف دین تلاش می‌کردند وزن‌های مدل را مستقیما در سیلیکون سخت‌کدنویسی کنند. این کار یک بهینه‌سازی رادیکال محسوب می‌شد. اما خیلی زود هم کهنه می‌شد؛ تراشه‌هایی که به یک نسخه مشخص از مدل وابسته‌اند، عمر مفید بسیار کوتاهی دارند. گوگل راه میانه را انتخاب کرد. فروزن وی۲ اسکلت معماری را در سخت‌افزار جای می‌دهد، اما وزن‌ها را قابل به‌روزرسانی نگه می‌دارد؛ بنابراین همان تراشه می‌تواند چندین نسخه از جمینای را پشتیبانی کند، تا زمانی که این نسخه‌ها از الگوهای معماری مشابهی پیروی کنند.

این رویکرد می‌تواند زمان پاسخ‌گویی را آن‌قدر کاهش دهد که نسل تازه‌ای از برنامه‌های تعاملی هوش مصنوعی و کاربردهای کم‌تاخیر را ممکن کند.

گوگل قصد ندارد ناوگان واحدهای پردازش تنسور خود را با فروزن وی۲ جایگزین کند. بهتر است آن را یک مسیر آزمایشی در کنار تولید واحدهای پردازش تنسور بدانیم؛ بستری برای آزمودن سیلیکون تخصصی‌تر، آن هم در شرایطی که طراحی مدل‌ها به ثبات بیشتری می‌رسد. نقشه راه خود محصولات واحد پردازش تنسور نیز اخیرا نیازهای آموزش و استنتاج را از هم جدا کرده است؛ تراشه‌های نسل هشتم در رویداد کلاد نکست در ماه آوریل معرفی شدند. تلاش مربوط به فروزن وی۲ در مقیاس کوچک‌تری انجام می‌شود و گوگل برای آن تولید انبوه در سطح واحدهای پردازش تنسور را برنامه‌ریزی نکرده است.

زمان احتمالی ورود فروزن وی۲ با دیگر تحرکات صنعت نیز هم‌خوانی دارد. طبق گزارش‌ها، گوگل با اینتل قرارداد بسته تا تا سال ۲۰۲۸ بیش از سه میلیون تراشه واحد پردازش تنسور را بسته‌بندی کند. هم‌زمان، استارتاپ‌ها و رقبا نیز در حال بررسی سیلیکون آگاه از مدل هستند. شرکت تالاس مستقر در تورنتو تراشه اچ‌سی۱ خود را همراه با لاما ۳.۱ ۸بی معرفی کرده و می‌گوید بدون استفاده از حافظه پهن‌باند روی بسته، به سرعت ۱۷ هزار توکن در ثانیه می‌رسد. این استارتاپ حدود ۱۸۶ میلیون یورو جذب سرمایه داشته است. همچنین سال گذشته انویدیا یک قرارداد مجوز فناوری با گروک به ارزش حدود ۱۸.۶ میلیارد یورو امضا کرد؛ نشانه‌ای روشن از اینکه بازار برای ادغام رفتار مدل و سخت‌افزار ارزش بالایی قائل است.

البته این مسیر با مصالحه‌هایی همراه است. جاسازی معماری، برخی انواع انعطاف‌پذیری را کاهش می‌دهد. این روش برای مواردی مناسب‌تر است که خانواده‌های مدل در گذر زمان ساختار نسبتا ثابتی داشته باشند. همچنین چرخه عمر محصول را تغییر می‌دهد: سیلیکونی که پیرامون معماری یک مدل طراحی می‌شود، باید با ثبات قابل پیش‌بینی طراحی و مقیاس استقرار توجیه شود. همین موضوع موضع محتاطانه گوگل را توضیح می‌دهد. فروزن وی۲ آزمایشی است و هر آزمایشی لزوما به محصول نهایی تبدیل نمی‌شود.

در حال حاضر، گوگل فروزن وی۲ را به‌طور عمومی تأیید نکرده است. سخنگوی این شرکت به اینفورمیشن یادآوری کرده که بسیاری از پروژه‌های داخلی هرگز به مرحله تولید نمی‌رسند. با این حال، ایده اصلی، یعنی انتقال بخشی از منطق مدل به سیلیکون برای صرفه‌جویی در انرژی و کاهش تأخیر، از یک کنجکاوی دانشگاهی به یک راهبرد رقابتی تبدیل شده است. با ادامه رشد تقاضا برای هوش مصنوعی کم‌مصرف و کم‌تاخیر، باید انتظار داشت شرکت‌های بیشتری ترکیب‌های مشابهی از سخت‌افزار آگاه از مدل و وزن‌های قابل به‌روزرسانی را آزمایش کنند.

پدرام حاتمی
«سلام! من پدرام هستم، عاشق گجت‌ها، موبایل‌های تازه و تکنولوژی‌هایی که دنیا رو عوض می‌کنن. هر روز با تازه‌ترین اخبار تکنولوژی همراهت هستم.»

نظر بگذارید

نظرات (4)

پمپزون

زیاد اغراق شده بنظر من، اما ایده جذابه. امیدوارم شرکت‌ها قبلِ سرمایه‌گذاری حساب کنن، مقیاس و هزینه و به‌روزرسانی وزن‌ها مهمه

آرمین

واقعیه؟ گوگل که تایید نکرده... یعنی تا 2028 منتظر باشیم یا بازی رسانه‌ایه؟ یه ذره شک دارم، اما امیدوارم درست باشه

توربومک

معقول به نظر می‌رسه، مسیر منطقی برای کاهش تاخیر و مصرف ولی به کاربری محدود وابسته است. باید دید مدل‌ها چقدر پایدار می‌مونن

دیتاپال

وای، ایده جالبیه! اگه واقعا 6-10 برابر بازدهی بده زندگی دیتاسنترها عوض میشه، اما نگران عمر تراشه‌ام، سریع کهنه نشه...