کوئن ۳.۸ مکس علی بابا؛ مدل عظیم تازه در رقابت هوش مصنوعی

علی‌بابا با مدل هوش مصنوعی کوئن ۳.۸ مکس، ظرفیت عظیم، هزینه استنتاج کمتر، ورودی چندوجهی و زمینه یک‌میلیون‌توکنی را هدف گرفته و رقابت مدل‌های بزرگ را جدی‌تر می‌کند.

.
کوئن ۳.۸ مکس علی بابا؛ مدل عظیم تازه در رقابت هوش مصنوعی

5 دقیقه

دنبال کردن در گوگل

تصور کنید یک قرارداد یک‌میلیون‌صفحه‌ای، یک پایگاه کد گسترده یا ساعت‌ها ویدئو را به هوش مصنوعی بسپارید و بدون انتظار طولانی، پاسخی منسجم و قابل استفاده دریافت کنید. این همان وعده‌ای است که علی‌بابا با کوئن ۳.۸ مکس مطرح می‌کند؛ بزرگ‌ترین و توانمندترین مدل این شرکت تا امروز.

چرا اندازه و بهره‌وری ناگهان مهم شده‌اند

کوئن ۳.۸ مکس حدود ۲.۴ تریلیون پارامتر دارد و از این نظر در کنار مدل‌های بسیار بزرگ مانند کیمی کی ۳ از مون‌شات ای‌آی قرار می‌گیرد که حدود ۲.۸ تریلیون پارامتر دارد. تعداد پارامترها معیار نهایی کیفیت نیست، اما همچنان نشانه‌ای رایج از توان محاسباتی و حجم داده‌های آموزشی به‌کاررفته در این سامانه‌ها محسوب می‌شود. در عمل، آنچه برای توسعه‌دهندگان و کسب‌وکارها اهمیت دارد این است که این مدل‌های هوش مصنوعی چقدر کار مفید انجام می‌دهند، بدون آنکه هزینه پردازش ابری را سرسام‌آور کنند.

اینجاست که انتخاب‌های معماری علی‌بابا اهمیت پیدا می‌کند. این شرکت می‌گوید کوئن ۳.۸ مکس از طراحی «ترکیب متخصصان» یا ام‌اوئی استفاده می‌کند. به‌جای آنکه در هر درخواست، همه بخش‌های شبکه فعال شوند، این معماری وظایف را به زیرشبکه‌های تخصصی هدایت می‌کند. در پیاده‌سازی علی‌بابا، برای هر پرس‌وجو فقط حدود ۹۵ میلیارد پارامتر فعال می‌شود. نتیجه روشن است: تأخیر کمتر و هزینه استنتاج بسیار پایین‌تر، در حالی که پایگاه دانشی کلی مدل همچنان عظیم باقی می‌ماند. علی‌بابا حتی ادعا می‌کند این مدل یک پروژه کامل مهندسی نرم‌افزار را در ۱۶ روز به پایان رسانده است؛ نمایشی کاربردی از توان عملیاتی واقعی، نه صرفا خودنمایی در بنچمارک‌ها.

وزن‌های باز بخش دیگری از این ماجرا هستند. بسیاری از تیم‌های چینی هوش مصنوعی مدل‌های بزرگ را با وزن‌های پایه قابل دانلود منتشر می‌کنند و از توسعه‌دهندگان می‌خواهند آن‌ها را به‌صورت محلی اجرا، سازگار و آزمایش کنند. این رویکرد در مقابل چندین شرکت آمریکایی قرار می‌گیرد که مدل‌های اصلی را بسته نگه می‌دارند و معیارهای عملکرد را شفاف منتشر نمی‌کنند. این میزان از بازبودن، آزمایش و نوآوری را سرعت می‌دهد و رقابت را از دسترسی محدودشده به این سمت می‌برد که تیم‌ها واقعا چه محصولی بر پایه مدل می‌سازند.

در رتبه‌بندی‌های عمومی، مدل جدید همین حالا توجه‌ها را جلب کرده است. در پلتفرم مقایسه آرنا دات ای‌آی، کوئن ۳.۸ مکس در صدر مدل‌های متنی چینی قرار دارد، هرچند در رتبه‌بندی جهانی متن، پس از کلود فِیبل ۵ و چند نسخه اوپوس از آنتروپیک ایستاده است. در حوزه تصویر و درک بصری، علی‌بابا می‌گوید کوئن ۳.۸ مکس به جایگاه دوم جهان رسیده و تنها پشت یکی از نسخه‌های کلود فِیبل ۵ قرار گرفته است. این جایگاه‌ها نشان می‌دهد مدل جدید یک رقیب چندوجهی جدی است، نه فقط یک موتور متنی بزرگ‌ترشده.

هر دو مدل کوئن ۳.۸ مکس و کیمی کی ۳ از ورودی‌های چندوجهی شامل متن، تصویر و ویدئو پشتیبانی می‌کنند و می‌توانند تا یک میلیون توکن را در یک پنجره زمینه پردازش کنند. توکن‌ها اجزای بنیادین متن و کد هستند؛ پشتیبانی از پنجره‌های توکنی بسیار بزرگ یعنی مدل می‌تواند پرونده‌های حقوقی کامل، مشخصات فنی طولانی یا برنامه‌های چندماژوله را در یک گذر دریافت و تحلیل کند. این قابلیت نوع جریان‌های کاری قابل پشتیبانی با هوش مصنوعی را تغییر می‌دهد و از کار با قطعات کوتاه و پرامپت‌های محدود، به استدلال روی اسناد کامل می‌رساند.

این موضوع برای تیم‌های محصول و سازمان‌ها چه معنایی دارد؟ نخست اینکه توازن میان مقیاس و هزینه تغییر کرده است. طراحی‌های مبتنی بر ترکیب متخصصان، مدل‌هایی با ظرفیت بالا را نوید می‌دهند که فقط بخش‌هایی از شبکه خود را فعال می‌کنند و به ارائه‌دهندگان خدمات کمک می‌کنند استنتاج پرظرفیت را بدون رشد خطی هزینه عرضه کنند. دوم اینکه مدل‌های پایه باز، اکوسیستم گسترده‌تری از توسعه‌دهندگان را برای بهینه‌سازی، تنظیم دقیق و عرضه کاربردهای تخصصی حوزه‌ای وارد میدان می‌کنند. سوم اینکه توانایی‌های چندوجهی و زمینه طولانی، این مدل‌ها را برای خودکارسازی کارهای دانشی، تولید کد پیچیده و بررسی‌های مقرراتی یا حقوقی جذاب می‌سازد.

دسترسی به این مدل ساده خواهد بود: علی‌بابا می‌گوید کوئن ۳.۸ مکس از هفته آینده از طریق پلتفرم مدل استودیو این شرکت عرضه می‌شود. برای پژوهشگران و استارتاپ‌هایی که ترجیح می‌دهند مدل‌ها را به‌صورت محلی اجرا یا سازگار کنند، در دسترس بودن وزن‌های پایه می‌تواند کوئن ۳.۸ مکس را به معنای واقعی به یک مدل بنیادین تبدیل کند؛ چیزی که تیم‌ها بر پایه آن می‌سازند، نه فقط از طریق یک رابط برنامه‌نویسی کاربردی به آن دسترسی دارند.

رقابت در حال داغ‌تر شدن است. آزمایشگاه‌های چینی به‌سرعت در حال مقیاس‌دهی مدل‌های باز هستند و هم‌زمان معماری‌هایی را آزمایش می‌کنند که بهره‌وری را در اولویت قرار می‌دهند. بازیگران غربی بیشتر بر ایمنی، هم‌راستاسازی و حکمرانی مدل‌های بسته تمرکز کرده‌اند. کاربران و سازمان‌ها از این تنوع سود می‌برند: گزینه‌های بیشتر، تکرار سریع‌تر و در بهترین حالت، مدل‌هایی که با نیازهای مشخص کسب‌وکار سازگارند، نه جعبه‌های سیاه یکسان برای همه.

پس تیتر اصلی روشن است: علی‌بابا یک مدعی مهم دیگر را وارد رقابت مدل‌های زبانی بزرگ کرده است. نکته ظریف‌تر این است که رقابت اکنون حول ظرفیت قابل استفاده می‌چرخد؛ مدل‌هایی که از نظر دانش بزرگ‌اند، اما هوشمندانه تصمیم می‌گیرند چه زمانی توان خود را به کار بگیرند. این همان قمار مهندسی واقعی است و کوئن ۳.۸ مکس شرط علی‌بابا در این میدان محسوب می‌شود.

سارا احمدی
سلام! من سارا هستم، عاشق دنیای فناوری و گجت‌های جدید. از بچگی شیفته موبایل و لپ‌تاپ بودم و حالا خوشحالم که می‌تونم آخرین اخبار و ترندهای دنیای تکنولوژی رو باهاتون به اشتراک بذارم.

نظر بگذارید

نظرات

هنوز نظری ثبت نشده. اولین نفر باشید.