发现商业评论 旗下
洞察商业 启迪未来

谷歌为Gemini模型添智能体视频理解功能,降成本提精度助力视频处理

   时间:2026-09-03 21:14 来源:快讯作者:任飞扬

谷歌近日宣布,为Gemini 3.7 Flash、3.6 Flash以及3.5 Flash-Lite模型引入了一项创新的智能体视频理解功能。这一功能不仅显著提升了模型在视频分析任务中的准确率,还大幅降低了资源消耗与使用成本。值得注意的是,该功能遵循Gemini API的标准Token计费规则,不会额外增加使用费用。

传统上,模型处理视频主要依赖静态处理模式,即按照固定帧率读取视频内容,默认帧率为1帧每秒。尽管开发者可以通过应用程序接口调整这一参数,但这种方式在处理长视频时往往面临高额Token开销与遗漏关键细节的权衡难题。谷歌此次推出的智能体视频理解功能,通过将模型核心推理能力与原生视频工具相结合,实现了从视频视觉帧、音频及转录文本中动态检索、扫描和核验目标片段的能力。

基准测试数据显示,搭载智能体视频理解功能的Gemini模型在视频分析成本上最高可降低66%,Token消耗量最高减少88%,同时分析准确率最高提升7%。这一技术优势在长视频处理场景中尤为显著,有效解决了开发者在处理长视频时面临的成本与细节保留的矛盾。谷歌指出,Gemini 3.7 Flash与新功能的结合,在分析质量与成本效率之间实现了最佳平衡,处于视频理解任务准确率与成本的帕累托最优前沿。

智能体视频理解功能赋予了模型自主决策能力,使其能够根据任务目标自主选择读取内容、播放速度,并灵活选取视频帧、音频及转录文本等信息模态。这一转变意味着,以往需要开发者手动完成的筛选操作,如今可由模型通过智能循环调用内部工具自动完成,从而大幅缩减了开发工作量。

该功能还具备多项实用特性,如支持亚秒级时刻检索,能够精准捕捉固定帧率下容易遗漏的状态变化与剪辑边界,为高精度自动化视频编辑提供了有力支持。它还能对长达数小时的长视频进行复杂内容检索,而无需消耗海量Token资源。针对快速运动画面或细微视觉异常,该功能可通过调高指定时间窗口的采样帧率进行检测,同时实现对时序下重复动作及多类物体的精准计数。

目前,这项功能已在Google AI Studio及Gemini企业智能体平台的Gemini应用程序接口上线,支持本地视频上传与YouTube视频解析。开发者只需在接口配置中将处理模式设置为“agentic”,即可轻松启用该能力。

根据谷歌的规划,这项技术能力还将逐步向面向普通用户的产品推广。未来,该功能将推送至Gemini应用全部Flash、Flash-Lite模型用户。在接下来的数月内,智能体视频理解还将赋能YouTube视频页面的“Ask YouTube”功能,依托Gemini模型提供更贴合视频画面内容的问答结果。

 
 
更多>同类内容
全站最新
热门内容