亚洲财经

搜索

Gemini开始主动“翻视频”:省下的不只是Token,而是长视频理解的工作方式

过去让多模态模型理解一段视频,常见做法是按固定频率抽帧,再把画面、音频和字幕一起送进模型。方法简单,却有一个明显缺陷:无论问题落在第十秒还是第二小时,系统都要先为整段素材付费。Google在9月1日为Gemini推出的代理式视频理解,试……