4 دقیقه
تصور کنید در ایستگاهی شلوغ ایستادهاید، هدفون در گوش دارید و میشنوید که حرفهای یک غریبه، تقریبا پیش از آنکه جملهاش را تمام کند، به زبان شما برگردانده میشود. این همان وعدهای است که گوگل با جمینای ۳.۵ لایو ترنسلیت ارائه میکند؛ مدلی که ساخته شده تا ترجمه زنده گفتار، بهجای حس ماشینی و خشک، شبیه همراهی چندزبانه باشد که در لحظه برایتان ترجمه میکند.
جمینای ۳.۵ لایو ترنسلیت میتواند گفتار را در بیش از ۷۰ زبان تشخیص دهد و ترجمه کند، درحالیکه ریتم، زیر و بمی صدا و سرعت بیان گوینده را حفظ میکند تا خروجی ترجمه طبیعی باشد، نه رباتیک. این قابلیت با یک راهکار جادویی و ساده به دست نیامده است؛ گوگل از رویکرد پردازش جریانی استفاده میکند که صدا را همزمان با صحبت کردن پردازش میکند و مکثهای آزاردهنده سیستمهای قدیمیتر را کاهش میدهد؛ همان سیستمهایی که منتظر میماندند گوینده حرفش را تمام کند و بعد پاسخ میدادند.
تاخیر بسیار کم است. واقعا بسیار کم. گوگل میگوید ترجمهها فقط چند ثانیه پس از صدای اصلی پخش میشوند و همین موضوع گفتوگو را روانتر و طبیعیتر میکند. این مدل همچنین ورودی چندزبانه را بدون نیاز به تنظیمات دستی مدیریت میکند؛ یعنی میتوانید در یک مکالمه چندزبانه شرکتکنندگان مختلفی داشته باشید و مدل خودش جریان گفتوگو را کنترل کند. دیگر نیازی به جابهجایی بین منوها در میانه تماس نیست. خبری از سردرگمی برای تغییر حالت هم نیست. هدف دقیقا همین است.
دسترسی اولیه از اپلیکیشن گوگل ترنسلیت روی اندروید و آیاواس آغاز میشود. برای استفاده، هدفون را وصل کنید و گزینه لایو ترنسلیت را در گوشه پایین سمت چپ لمس کنید. اگر هدفون بیسیم یا هندزفری در دسترس ندارید، حالت تازه «گوش دادن» در اندروید ترجمهها را از بلندگوی گوشی پخش میکند؛ کافی است دستگاه را مثل یک تماس معمولی کنار گوش خود بگیرید و اجازه دهید گوشی نقش مترجم را انجام دهد.

برای جلسات، این قابلیت میتواند یک تغییر بزرگ باشد. زیرنویس زنده گوگل میت پیشتر برای ترجمه گفتار فقط به پنج زبان محدود بود. با جمینای ۳.۵، پشتیبانی به بیش از ۷۰ زبان افزایش پیدا میکند و امکان بیش از ۲٬۰۰۰ جفتزبان مختلف در یک جلسه فراهم میشود؛ پوششی بسیار گستردهتر برای تیمهای جهانی، کلاسهای آموزشی و رویدادهای بینالمللی.
در نسخه وب، گوگل در حال معرفی یک کنترل تکضربهای است تا ترجمه زنده بلافاصله آغاز شود. این قابلیت بهصورت آزمایشی از همین ماه عرضه خواهد شد؛ اقدامی که نشان میدهد این شرکت میخواهد ترجمه همزمان و آنی، بیش از آنکه یک افزونه به نظر برسد، به قابلیتی داخلی و طبیعی در تجربه کاربری تبدیل شود.
این مدل برای عملکرد پایدار در محیطهای پر سروصدا و غیرقابل پیشبینی طراحی شده است. همهمه پسزمینه، صدای خیابان یا همپوشانی صدای چند نفر؛ جمینای ۳.۵ برای مقاومت در برابر چنین شرایطی ساخته شده است. توسعهدهندگان نیز میتوانند انتظار داشته باشند این مدل در سراسر اکوسیستم گوگل دیده شود؛ از ترنسلیت گرفته تا میت و سپس در رابطهای برنامهنویسی کاربردی برای اپلیکیشنهای شخص ثالث.
تمام صداهایی که مدلهای گوگل تولید میکنند، دارای واترمارک نامرئی سینثآیدی خواهند بود که در خروجی جاسازی میشود؛ قابلیتی که تشخیص گفتار تولیدشده با هوش مصنوعی را ممکن میکند و به کاهش سوءاستفاده کمک میکند.
بااینحال هنوز پرسشهایی باقی است. این سیستم با گویشهای منطقهای، جابهجایی میان زبانها در یک مکالمه یا زبانهایی که دادههای محدودی دارند چگونه برخورد خواهد کرد؟ وقتی گفتوگوها در لحظه رونویسی و ترجمه میشوند، حریم خصوصی و رضایت کاربران چگونه مدیریت میشود؟ گوگل به دو دهه تجربه در حوزه ترجمه اشاره میکند و میگوید میلیاردها کاربر همین حالا به ابزارهای آن تکیه دارند، اما ورود یک مدل قدرتمند پردازش جریانی به استفاده روزمره، چالشهای تازهای در سیاستگذاری و تجربه کاربری ایجاد میکند.
برای هر کسی که سفر میکند، آموزش میدهد یا جلسات جهانی برگزار میکند، ترجمه زنده جمینای ۳.۵ یک جهش کاربردی است: اصطکاک کمتر، سرعت بیشتر و صدایی که انسانی به نظر میرسد. وقتی زبان دیگر دیوار نباشد و به بخشی از صدای پسزمینه تبدیل شود، پرسش از «چگونه ترجمه کنیم» فراتر میرود و به این میرسد که «چگونه متفاوت گوش بدهیم».














نظر بگذارید
نظرات (3)
من یه بار ابزار ترجمه زنده تو کنفرانس امتحان کردم، خیلی کمک کرد ولی بعضی کلمات اشتباه برمیگشتن، اگه این بهتر باشه سفر و جلسات سادهتر میشه
این وعدهها جذابه، ولی با گویشهای محلی و لهجههای سنگین چی؟ اگه صدا لحظهای پردازش میشه، حریم خصوصی چطور تضمین میشه ؟
واقعا؟ یعنی قراره یه مترجم همزمان تو گوشم باشه؟ هیجانزدهم ولی یه کمی هم نگران حریم خصوصیام... جالبه!