ویدئو را به Gemini بده؛ خودش میفهمد کجای آن مهم است!
گوگل قابلیت جدید Agentic Video Understanding را برای مدلهای Gemini ارائه کرده است. مدل میتواند در یک ویدئوی طولانی بهصورت پویا بین فریمها، صوت و متن پیادهسازیشده جابهجا شود و فقط قسمتهایی را که برای پاسخ به سؤال لازم است بررسی کند. گوگل میگوید این روش برای ویدئوهای طولانی میتواند مصرف توکن را تا ۸۸ درصد نسبت به پردازش ثابت کاهش دهد.