رونمایی ژیپو از جی ال ام ۵.۳؛ مدل کدنویسی ۷۴۳ میلیاردی

ژیپو ای‌آی با مدل جی‌ال‌ام ۵.۳ نشان می‌دهد بهبود پساآموزش چگونه می‌تواند کدنویسی هوش مصنوعی، جریان‌های کاری عاملی و تحلیل امنیت سایبری را بدون افزایش پارامترها ارتقا دهد.

.3 دیدگاه
رونمایی ژیپو از جی ال ام ۵.۳؛ مدل کدنویسی ۷۴۳ میلیاردی

3 دقیقه

دنبال کردن در گوگل

یک باگ که رد آن به سال ۱۹۸۱ می‌رسید و دهه‌ها از چشم‌ها پنهان مانده بود، نقطه شروع ماجرا شد. همین کشف، لحن تازه‌ترین رونمایی ژیپو ای‌آی را مشخص کرد: جی‌ال‌ام ۵.۳، یک مدل زبان ۷۴۳ میلیارد پارامتری که برای کدنویسی، جریان‌های کاری عاملی و تحلیل امنیت سایبری تنظیم شده است.

ژیپو ای‌آی می‌گوید جی‌ال‌ام ۵.۳ نه به عنوان یک مدل پایه بزرگ‌تر، بلکه به عنوان مدلی هوشمندتر عرضه می‌شود. وزن‌ها همچنان روی ۷۴۳ میلیارد پارامتر باقی مانده‌اند، اما تیم سازنده لایه پساآموزش را بازطراحی کرده است: محیط‌های شبیه‌سازی‌شده غنی‌تر، تنوع بیشتر در وظایف و محاسبات تعاملی سنگین‌تر برای بیرون کشیدن بهبودهای عملکردی. نتیجه بیشتر از آنکه شبیه مقیاس‌دهی کورکورانه باشد، به یک پالایش دقیق و هدفمند شباهت دارد.

دسترسی اولیه از طریق طرح پولی کدنویسی جی‌ال‌ام و پلتفرم زدکد آغاز می‌شود. دسترسی از طریق رابط برنامه‌نویسی کاربردی و وزن‌های قابل دانلود مدل نیز قرار است پس از بازبینی‌های امنیتی مرحله‌ای، طی هفته‌های آینده به صورت تدریجی منتشر شود؛ یعنی سازمان‌ها می‌توانند مدل را زودتر آزمایش کنند، در حالی که ژیپو آن را برای توزیع گسترده‌تر ارزیابی می‌کند.

بهره‌وری توکنی یکی از شاخص‌های اصلی این رونمایی بود. در بنچمارک کد داخلی زی‌.ای‌آی، جی‌ال‌ام ۵.۳ با استفاده از حدود ۷۵٬۰۰۰ توکن خروجی به نرخ موفقیت ۳۴.۵ درصد رسید، در حالی که جی‌ال‌ام ۵.۲ با حدود ۹۶٬۰۰۰ توکن، موفقیت ۲۳.۴ درصدی ثبت کرده بود. به زبان ساده: حرف کمتر، نتیجه بیشتر. این همان نوع بهبودی است که مهندسان خیلی زود متوجه آن می‌شوند.

وقتی صحبت از توان خام برنامه‌نویسی می‌شود، تصویر یکدست نیست. ترمینال بنچ ۳.۰ که عملکرد را در محیط‌های زنده لینوکس و سامانه‌های خودکار ارزیابی می‌کند، امتیاز جی‌ال‌ام ۵.۳ را به ۲۸.۳ رساند؛ جهشی بزرگ نسبت به امتیاز ۴.۶ در نسل پیشین. چشمگیر است، اما رقبای تجاری هنوز جلوترند؛ کلود فیبل ۵ امتیاز ۳۳.۷ و جی‌پی‌تی ۵.۶ سول امتیاز ۳۴.۶ را کسب کردند و جایگاه‌های بالای جدول را حفظ کردند.

در رفع باگ‌های دنیای واقعی که در دیپ‌اس‌دابلیوئی نسخه ۱.۱ آزمایش شد، جی‌ال‌ام ۵.۳ امتیاز ۶۶.۹ را ثبت کرد؛ پیشرفتی قابل توجه نسبت به نسل قبل، اما اندکی پایین‌تر از رقبایی مانند کیمی کی ۳ با امتیاز ۶۷.۵ و فیبل ۵ با امتیاز ۶۹.۷. جمع‌بندی روشن است: جی‌ال‌ام ۵.۳ فاصله خود را با رقابت متن‌باز و بسته کمتر کرده، اما برترین پشته‌های سازمانی همچنان بسیار رقابتی باقی مانده‌اند.

جایی که جی‌ال‌ام ۵.۳ واقعا غافلگیر می‌کند، امنیت سایبری است: این مدل در بنچمارک سایبرجیم با امتیاز ۸۴.۵ درصد صدرنشین شد و فیبل ۵ با ۸۳.۸ درصد و جی‌پی‌تی ۵.۶ سول با ۸۳.۶ درصد را پشت سر گذاشت. ژیپو یک پرونده امنیتی منتشر کرده که نشان می‌دهد جی‌ال‌ام ۵.۳ در ۲۶۹ پروژه متن‌باز، ۲٬۴۳۶ آسیب‌پذیری را شناسایی کرده است؛ از این میان، ۱٬۰۹۷ مورد در بازه ریسک متوسط تا بحرانی طبقه‌بندی شده‌اند. یک کشف بیش از همه جلب توجه می‌کند: اکسپلویتی که منشأ آن به سال ۱۹۸۱ بازمی‌گردد و طبق گزارش‌ها، اسکنرها و پژوهشگران قبلی به طور میانگین ۲۶.۶ سال آن را شناسایی نکرده بودند.

همه این موارد، جی‌ال‌ام ۵.۳ را به رقیبی معتبر برای بازیگران منطقه‌ای مانند کیمی کی ۳ و ورودی بحث‌برانگیز در برابر مدل‌های تجاری آمریکایی تبدیل می‌کند. این فقط یک انتشار دیگر نیست؛ بلکه مطالعه موردی مهمی است درباره کنار گذاشتن رشد صرف پارامترها به نفع پساآموزش هوشمندتر و هدفمندتر، همراه با دستاوردهای قابل توجه در امنیت سایبری به عنوان مزیت اضافه.

آیا جی‌ال‌ام ۵.۳ فروشندگان را وادار می‌کند بخش‌های بیشتری از زنجیره ابزارهای خود را باز کنند یا موج تازه‌ای از مهندسی متمرکز بر بنچمارک را به راه می‌اندازد؟ چند ماه آینده، با آزمون‌های رابط برنامه‌نویسی کاربردی و بررسی دقیق جامعه فنی، پاسخ را روشن خواهد کرد.

پدرام حاتمی
«سلام! من پدرام هستم، عاشق گجت‌ها، موبایل‌های تازه و تکنولوژی‌هایی که دنیا رو عوض می‌کنن. هر روز با تازه‌ترین اخبار تکنولوژی همراهت هستم.»

نظر بگذارید

نظرات (3)

بیونیکس

پیشرفت امنیتی چشمگیره، ۲۶۹ پروژه و ۲٬۴۳۶ آسیب‌پذیری؛ اما آیا گزارش‌‌ها کاملن قابل اعتمادن؟ یه کمی شک دارم...

آرمین

آیا واقعا وزن‌ها همون ۷۴۳ میلیارد موندن؟ اگه فقط بازآموزی باشه، این بهبود واقعا از مقیاس بهتره یا فقط بازی با بنچمارکه؟

دیتاپالس

وااای، باگ از ۱۹۸۱؟ یعنی سال‌هاا... یعنی پساآموزش واقعا اثر کرده ولی نگرانم دسترسی پولی باشه، کی می‌تونه زود تست کنه؟