5 دقیقه
تصور کنید یک قرارداد یکمیلیونصفحهای، یک پایگاه کد گسترده یا ساعتها ویدئو را به هوش مصنوعی بسپارید و بدون انتظار طولانی، پاسخی منسجم و قابل استفاده دریافت کنید. این همان وعدهای است که علیبابا با کوئن ۳.۸ مکس مطرح میکند؛ بزرگترین و توانمندترین مدل این شرکت تا امروز.
چرا اندازه و بهرهوری ناگهان مهم شدهاند
کوئن ۳.۸ مکس حدود ۲.۴ تریلیون پارامتر دارد و از این نظر در کنار مدلهای بسیار بزرگ مانند کیمی کی ۳ از مونشات ایآی قرار میگیرد که حدود ۲.۸ تریلیون پارامتر دارد. تعداد پارامترها معیار نهایی کیفیت نیست، اما همچنان نشانهای رایج از توان محاسباتی و حجم دادههای آموزشی بهکاررفته در این سامانهها محسوب میشود. در عمل، آنچه برای توسعهدهندگان و کسبوکارها اهمیت دارد این است که این مدلهای هوش مصنوعی چقدر کار مفید انجام میدهند، بدون آنکه هزینه پردازش ابری را سرسامآور کنند.
اینجاست که انتخابهای معماری علیبابا اهمیت پیدا میکند. این شرکت میگوید کوئن ۳.۸ مکس از طراحی «ترکیب متخصصان» یا اماوئی استفاده میکند. بهجای آنکه در هر درخواست، همه بخشهای شبکه فعال شوند، این معماری وظایف را به زیرشبکههای تخصصی هدایت میکند. در پیادهسازی علیبابا، برای هر پرسوجو فقط حدود ۹۵ میلیارد پارامتر فعال میشود. نتیجه روشن است: تأخیر کمتر و هزینه استنتاج بسیار پایینتر، در حالی که پایگاه دانشی کلی مدل همچنان عظیم باقی میماند. علیبابا حتی ادعا میکند این مدل یک پروژه کامل مهندسی نرمافزار را در ۱۶ روز به پایان رسانده است؛ نمایشی کاربردی از توان عملیاتی واقعی، نه صرفا خودنمایی در بنچمارکها.

وزنهای باز بخش دیگری از این ماجرا هستند. بسیاری از تیمهای چینی هوش مصنوعی مدلهای بزرگ را با وزنهای پایه قابل دانلود منتشر میکنند و از توسعهدهندگان میخواهند آنها را بهصورت محلی اجرا، سازگار و آزمایش کنند. این رویکرد در مقابل چندین شرکت آمریکایی قرار میگیرد که مدلهای اصلی را بسته نگه میدارند و معیارهای عملکرد را شفاف منتشر نمیکنند. این میزان از بازبودن، آزمایش و نوآوری را سرعت میدهد و رقابت را از دسترسی محدودشده به این سمت میبرد که تیمها واقعا چه محصولی بر پایه مدل میسازند.
در رتبهبندیهای عمومی، مدل جدید همین حالا توجهها را جلب کرده است. در پلتفرم مقایسه آرنا دات ایآی، کوئن ۳.۸ مکس در صدر مدلهای متنی چینی قرار دارد، هرچند در رتبهبندی جهانی متن، پس از کلود فِیبل ۵ و چند نسخه اوپوس از آنتروپیک ایستاده است. در حوزه تصویر و درک بصری، علیبابا میگوید کوئن ۳.۸ مکس به جایگاه دوم جهان رسیده و تنها پشت یکی از نسخههای کلود فِیبل ۵ قرار گرفته است. این جایگاهها نشان میدهد مدل جدید یک رقیب چندوجهی جدی است، نه فقط یک موتور متنی بزرگترشده.
هر دو مدل کوئن ۳.۸ مکس و کیمی کی ۳ از ورودیهای چندوجهی شامل متن، تصویر و ویدئو پشتیبانی میکنند و میتوانند تا یک میلیون توکن را در یک پنجره زمینه پردازش کنند. توکنها اجزای بنیادین متن و کد هستند؛ پشتیبانی از پنجرههای توکنی بسیار بزرگ یعنی مدل میتواند پروندههای حقوقی کامل، مشخصات فنی طولانی یا برنامههای چندماژوله را در یک گذر دریافت و تحلیل کند. این قابلیت نوع جریانهای کاری قابل پشتیبانی با هوش مصنوعی را تغییر میدهد و از کار با قطعات کوتاه و پرامپتهای محدود، به استدلال روی اسناد کامل میرساند.
این موضوع برای تیمهای محصول و سازمانها چه معنایی دارد؟ نخست اینکه توازن میان مقیاس و هزینه تغییر کرده است. طراحیهای مبتنی بر ترکیب متخصصان، مدلهایی با ظرفیت بالا را نوید میدهند که فقط بخشهایی از شبکه خود را فعال میکنند و به ارائهدهندگان خدمات کمک میکنند استنتاج پرظرفیت را بدون رشد خطی هزینه عرضه کنند. دوم اینکه مدلهای پایه باز، اکوسیستم گستردهتری از توسعهدهندگان را برای بهینهسازی، تنظیم دقیق و عرضه کاربردهای تخصصی حوزهای وارد میدان میکنند. سوم اینکه تواناییهای چندوجهی و زمینه طولانی، این مدلها را برای خودکارسازی کارهای دانشی، تولید کد پیچیده و بررسیهای مقرراتی یا حقوقی جذاب میسازد.
دسترسی به این مدل ساده خواهد بود: علیبابا میگوید کوئن ۳.۸ مکس از هفته آینده از طریق پلتفرم مدل استودیو این شرکت عرضه میشود. برای پژوهشگران و استارتاپهایی که ترجیح میدهند مدلها را بهصورت محلی اجرا یا سازگار کنند، در دسترس بودن وزنهای پایه میتواند کوئن ۳.۸ مکس را به معنای واقعی به یک مدل بنیادین تبدیل کند؛ چیزی که تیمها بر پایه آن میسازند، نه فقط از طریق یک رابط برنامهنویسی کاربردی به آن دسترسی دارند.
رقابت در حال داغتر شدن است. آزمایشگاههای چینی بهسرعت در حال مقیاسدهی مدلهای باز هستند و همزمان معماریهایی را آزمایش میکنند که بهرهوری را در اولویت قرار میدهند. بازیگران غربی بیشتر بر ایمنی، همراستاسازی و حکمرانی مدلهای بسته تمرکز کردهاند. کاربران و سازمانها از این تنوع سود میبرند: گزینههای بیشتر، تکرار سریعتر و در بهترین حالت، مدلهایی که با نیازهای مشخص کسبوکار سازگارند، نه جعبههای سیاه یکسان برای همه.
پس تیتر اصلی روشن است: علیبابا یک مدعی مهم دیگر را وارد رقابت مدلهای زبانی بزرگ کرده است. نکته ظریفتر این است که رقابت اکنون حول ظرفیت قابل استفاده میچرخد؛ مدلهایی که از نظر دانش بزرگاند، اما هوشمندانه تصمیم میگیرند چه زمانی توان خود را به کار بگیرند. این همان قمار مهندسی واقعی است و کوئن ۳.۸ مکس شرط علیبابا در این میدان محسوب میشود.





نظر بگذارید
نظرات
هنوز نظری ثبت نشده. اولین نفر باشید.