لانگ کت ۲.۰؛ مدل عظیم میتوآن بدون سخت افزار انویدیا

میتوآن با معرفی لانگ‌کت ۲.۰ نشان می‌دهد آموزش مدل‌های زبانی عظیم با تراشه‌ها و کلاسترهای بومی چین ممکن است؛ اما کارایی واقعی آن به نتایج بنچمارک‌های مستقل وابسته است.

پدرام حاتمیپدرام حاتمی.2 دیدگاه
لانگ کت ۲.۰؛ مدل عظیم میتوآن بدون سخت افزار انویدیا

2 دقیقه

تصور کنید یک مدل زبانی غول‌پیکر بسازید، آن هم بدون حتی یک کارت انویدیا در رک سرور. عجیب است؟ دیگر نه. میتوآن بی‌سروصدا از لانگ‌کت-۲.۰ رونمایی کرده است؛ یک مدل متن‌باز عظیم که فرض‌های رایج درباره سخت‌افزاری را به چالش می‌کشد که می‌تواند سنگین‌ترین بارهای کاری هوش مصنوعی را بر دوش بکشد.

لانگ‌کت-۲.۰ حدود ۱.۶ تریلیون پارامتر دارد و از پنجره زمینه‌ای نزدیک به یک میلیون توکن پشتیبانی می‌کند؛ قابلیتی که آن را در میان گسترده‌ترین مدل‌های زبانی موجود قرار می‌دهد. از نظر مقیاس، سازندگان آن می‌گویند این مدل با نمونه‌هایی مانند دیپ‌سیک وی۴ پرو رقابت می‌کند، اما خبر اصلی صرفا اندازه خام مدل نیست. نکته مهم، داستان سخت‌افزار آن است.

برخلاف تلاش‌های پیشین که از تراشه‌های داخلی فقط برای استنتاج استفاده می‌کردند، میتوآن گزارش داده است که لانگ‌کت-۲.۰ هم آموزش و هم استنتاج را روی یک پشته کاملا مبتنی بر چین انجام داده است. این شرکت ادعا می‌کند از یک کلاستر محاسباتی ساخته‌شده از حدود ۵۰ هزار کارت گرافیک چینی و ده‌ها هزار ای‌سیک اختصاصی برای وظایف هوش مصنوعی استفاده کرده است. نتیجه، آموزش در مقیاس بزرگ روی سخت‌افزارهایی جایگزین برای زنجیره تأمین جهانی تحت سلطه انویدیا است.

این شرکت خانواده دقیق پردازنده‌های استفاده‌شده را افشا نکرده است. هواوی گزینه‌ای بدیهی به نظر می‌رسد، اما میتوآن از نام بردن تأمین‌کنندگان خودداری کرده است. این ابهام مهم است، زیرا سازگاری نرم‌افزاری، بلوغ درایورها و لایه‌های هماهنگ‌سازی، درست به اندازه خود تراشه‌ها، عملکرد واقعی را شکل می‌دهند.

لانگ‌کت-۲.۰ نقطه عطفی در استقلال سخت‌افزاری به شمار می‌آید، اما توانایی‌های عملی آن تا زمان انتشار بنچمارک‌های مستقل همچنان اثبات‌نشده باقی می‌ماند.

تا اینجا، این مدل هنوز در مجموعه‌های ارزیابی پیشرو مانند آرتیفیشال آنالسیس یا آرنا اجرا نشده و همچنین آزمون‌های تخصصی‌تری مثل آخرین آزمون عامل‌ها و سایبرجیم را پشت سر نگذاشته است. بنچمارک‌ها نشان خواهند داد که آیا آموزش روی یک پشته بومی به دقت، تأخیر و بهره‌وری رقابتی تبدیل می‌شود یا نه. آیا این مدل با نمونه‌های آموزش‌دیده بر پایه انویدیا هم‌سطح خواهد بود، یا با نوع کاملا متفاوتی از مصالحه روبه‌رو هستیم؟

پیامد گسترده‌تر روشن است: اکوسیستم چین در حال آزمودن این موضوع است که آیا تراشه‌های جایگزین و کلاسترهای عظیم داخلی می‌توانند پژوهش هوش مصنوعی پیشرو را پایدار نگه دارند یا خیر. چنین روندی می‌تواند فرض‌های مربوط به زنجیره تأمین را دگرگون کند و نوآوری بومی را شتاب دهد. فعلا لانگ‌کت-۲.۰ نشانه‌ای از توانمندی و دلیلی برای دنبال کردن نتایج بنچمارک‌هاست؛ نتایجی که مشخص می‌کنند با یک جهش واقعی روبه‌رو هستیم یا صرفا با آزمایشی جذاب.

پدرام حاتمی
«سلام! من پدرام هستم، عاشق گجت‌ها، موبایل‌های تازه و تکنولوژی‌هایی که دنیا رو عوض می‌کنن. هر روز با تازه‌ترین اخبار تکنولوژی همراهت هستم.»

نظر بگذارید

نظرات (2)

امیر

اوه! یه میلیون توکن؟ یعنی چت‌های طولانی‌تر بدون افت حافظه، هیجان‌زده‌م ولی امیدوارم مصرف برق و هزینه‌اش وحشتناک نباشه... منتظر بنچمارک‌ها هستم

دیتاپالس

واقعا میشه بدون انویدیا اینقدر بزرگ آموزش داد؟ اگه بنچمارک‌ها نیان، همه‌چیز می‌مونه حدس و گمان. امیدوارم تست‌های مستقل چیزای جالب بگن، ولی یه حس تردید دارم