发现商业评论 旗下
洞察商业 启迪未来

谷歌为Gemini模型增智能体视频理解功能,降成本提效率助力视频处理新突破

   时间:2026-09-03 20:48 来源:快讯作者:沈瑾瑜

谷歌近日宣布,为Gemini系列中的3.7 Flash、3.6 Flash及3.5 Flash-Lite模型引入了一项突破性的智能体视频理解功能。这一创新不仅显著提升了模型对视频内容的分析精度,还大幅降低了资源消耗与成本,为视频处理领域带来了新的可能性。

传统的视频处理方式多采用静态模式,即按照固定的帧率读取视频内容,默认帧率为每秒1帧(1FPS)。尽管开发者可以通过应用程序接口调整这一参数,但这种方式在处理长视频或需要高精度分析的场景时,往往面临高额Token开销与关键细节遗失的两难选择。谷歌此次推出的智能体视频理解功能,通过将模型的核心推理能力与原生视频工具相结合,实现了对视频视觉帧、音频及转录文本的动态检索、扫描与核验,从而有效解决了这一问题。

据基准测试结果显示,搭载这一新功能的Gemini模型在视频分析成本上最高可降低66%,Token消耗量最高减少88%,同时分析准确率最高提升7%。这一技术优势在长视频处理中尤为显著,使得开发者在保持分析质量的同时,能够显著降低运营成本。谷歌特别指出,Gemini 3.7 Flash与新功能的结合,在综合表现上达到了分析质量与成本效率的最佳平衡,处于视频理解任务准确率与成本的帕累托最优前沿。

智能体视频理解功能赋予了模型自主决策能力,使其能够根据任务目标自主选择读取内容、播放速度,以及选取视频帧、音频、转录文本等信息模态。这一变革意味着,以往需要开发者手动完成的筛选操作,如今可由模型通过智能循环调用内部工具自动完成,从而大幅缩减了开发工作量。例如,在处理快速运动画面或细微视觉异常时,模型可以针对指定时间窗口调高采样帧率,确保不遗漏任何关键信息。

该功能还具备多项实用特性,如支持亚秒级时刻检索,能够精准捕捉固定帧率下容易遗漏的状态变化与剪辑边界,为高精度自动化视频编辑提供了有力支持。同时,它还能对时长数小时的长视频开展复杂内容检索,而无需消耗海量Token资源。智能体视频理解功能还能对时序下的重复动作、多类物体实现精准计数,进一步拓展了其应用场景。

目前,这项功能已在Google AI Studio及Gemini企业智能体平台的Gemini应用程序接口上线,支持本地视频上传与YouTube视频解析。开发者只需在接口配置中将处理模式设置为“agentic”,即可轻松开启这一能力。谷歌还透露,未来这项技术能力将逐步向面向普通用户的产品落地,包括推送至Gemini应用全部Flash、Flash-Lite模型用户,以及赋能YouTube视频页面的“Ask YouTube”功能,依托Gemini模型输出更贴合视频画面内容的问答结果。

 
 
更多>同类内容
全站最新
热门内容