» هوش مصنوعی و رباتیک » خانواده جمینای 3.8 لایو به‌عنوان پیشرفته‌ترین مدل‌های مکالمه‌ای گوگل معرفی شدند [تماشا کنید]

خانواده جمینای 3.8 لایو به‌عنوان پیشرفته‌ترین مدل‌های مکالمه‌ای گوگل معرفی شدند [تماشا کنید]

شهریور ۲۵, ۱۴۰۵ 008

گوگل دو مدل هوش مصنوعی جدید با نام‌های جمینای 3.8 لایو و Gemini 3.8 Live Extended Thinking را معرفی کرده است. این سیستم‌ها پیشرفته‌ترین مدل‌های مکالمه زنده این غول فناوری محسوب می‌شوند و با ارتقای قابلیت‌های پردازشی و استدلال موازی، امکان همکاری صوتی و اجرای وظایف پیچیده از طریق مکالمه را برای کاربران فراهم می‌کنند.

مدل اول یعنی Gemini 3.8 Live با تمرکز بر مقیاس‌پذیری بالا و مدیریت هزینه‌ها توسعه پیدا کرده و هوش مکالمه‌ای را با ادراک بصری و مکالمه روان ترکیب کرده است. در سوی دیگر، نسخه جیمنای 3.8 لایو Extended Thinking برای حل مسائل پیچیده‌تر طراحی شده و سطح بالاتری از توان پردازشی و استدلال چندمرحله‌ای را به نمایش می‌گذارد. توسعه‌دهندگان و مشتریان سازمانی می‌توانند از این دو مدل به عنوان زیرساختی پایدار جهت طراحی ایجنت‌های صوتی استفاده کنند.

قابلیت‌ها و استدلال پیشرفته در جیمنای 3.8 لایو

بررسی‌های فنی گوگل نشان می‌دهد مدل Gemini 3.8 Live Extended Thinking توانسته رتبه اول شاخص کیفیت صدا‌به‌صدا در پایگاه سنجش هوش مصنوعی Artificial Analysis را با امتیاز ۸۲.۶ به دست بیاورد. این مدل در انجام وظایف ایجنتی مستقل روی بنچمارک τ-Voice امتیاز ۶۸.۶ درصد و در آزمون Sierra به نام τ-Voice-banking امتیاز ۳۵.۱ درصد را ثبت کرده است. علاو‌ه‌براین، در آزمون استدلال صوتی Big Bench Audio موفق به کسب امتیاز ۹۷.۷ درصد شده و هم‌زمان قیمت رقابتی خود را در مقایسه با سایر محصولات هوش مصنوعی پیشرو بازار حفظ کرده است.

در ویدیو زیر، کاربر طرحی از یک وب‌سایت را برای مدل Gemini 3.8 Live Extended Thinking روی کاغذ می‌کشد و سپس هوش مصنوعی گوگل مرحله‌به‌مرحله آن را پیاده‌سازی می‌کند.

مدل سبک‌تر جیمنای 3.8 لایو نیز رتبه دوم را در بنچمارک Speech Agent Arena از نظر ترجیح کاربران از آن خود کرده است. همچنین در ارزیابی EVA-Bench که برای بررسی عملکرد ایجنت‌های صوتی ارائه شده، این مدل‌ها تعادل خوبی میان دقت و کیفیت طبیعی مکالمه داشته‌اند.

یکی از مشخصه‌های کلیدی مدل پایه، درک سریع ورودی‌های تصویری در مکالمه عنوان شده است که پاسخ‌های کاربردی‌تری را به همراه می‌آورد. این هوش مصنوعی توانایی تشخیص خودکار و جابه‌جایی پیوسته بین ۹۷ زبان مختلف را در طول یک گفت‌وگو دارد. از سوی دیگر، ابزارها و دستورات نرم‌افزاری آن می‌توانند در پس‌زمینه اجرا شوند، بدون آنکه اختلالی در روند صحبت با کاربر ایجاد کنند؛ یعنی مدل در حین پیگیری درخواست‌ها یا محاسبات پشت‌صحنه، مکالمه را زنده نگه می‌دارد. به‌علاوه، نسخه Extended در هنگام حل مسائل دشوار می‌تواند استدلال ذهنی و صحبت کردن را به‌طور هم‌زمان پیش ببرد و با مواردd مثل گزارش لحظه‌ای پیشرفت مراحل، ارتباط صوتی را قطع نمی‌کند.

در ویدیو زیر کاربر با نمایش لوله‌های آب از طریق دوربین گوشی خود، از مدل پایه جیمنای 3.8 لایو برای حل مشکل کمک می‌گیرد.

تمامی صداهای تولیدشده توسط این سیستم‌ها نیز با فناوری SynthID واترمارک می‌شوند تا اصالت محتوا قابل رهگیری باشد.

هم‌اکنون انتشار هر دو مدل رسماً شروع شده است. مدل Gemini 3.8 Live برای توسعه‌دهندگان از طریق Gemini API و Google AI Studio، برای کسب‌وکارها در پیش‌نمایش خصوصی Gemini Enterprise، و برای عموم کاربران در بخش Search Live فعال شده است. همچنین نسخه Gemini 3.8 Live Extended Thinking برای توسعه‌دهندگان در استودیو، برای مشتریان تجاری Workspace، و برای کاربران عادی در جمینای لایو و مشترکین پلن‌های گوگل در داکس، جیمیل و Keep ارائه شده است.

به این نوشته امتیاز بدهید!

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

  • ×