ویدئو را به Gemini بده؛ خودش می‌فهمد کجای آن مهم است!

گوگل قابلیت جدید Agentic Video Understanding را برای مدل‌های Gemini ارائه کرده است. مدل می‌تواند در یک ویدئوی طولانی به‌صورت پویا بین فریم‌ها، صوت و متن پیاده‌سازی‌شده جابه‌جا شود و فقط قسمت‌هایی را که برای پاسخ به سؤال لازم است بررسی کند. گوگل می‌گوید این روش برای ویدئوهای طولانی می‌تواند مصرف توکن را تا ۸۸ درصد نسبت به پردازش ثابت کاهش دهد.
Subscribe to تحلیل ویدئوهای آموزشی