谷歌推出智能体视频理解功能,优化Gemini模型视频分析效能

  来源:环球网

  9 月 3 日消息,据 biggo 报道,谷歌近日宣布为 Gemini 3.7 Flash、3.6 Flash 以及 3.5 Flash‑Lite 模型新增智能体视频理解功能,在提升模型视频分析准确率的同时,显著降低视频分析的资源消耗与使用成本。该功能沿用 Gemini API 标准 Token 计费规则,不额外收取功能使用费。

  据介绍,以往模型处理视频多采用静态处理模式,按照固定帧率读取视频内容,默认帧率为 1FPS,开发者可通过应用程序接口进行参数调整。全新的智能体视频理解功能,将模型核心推理能力与原生视频工具相结合,能够从视频视觉帧、音频、转录文本当中,动态检索、扫描、核验目标片段。

  基准测试结果显示,搭载智能体视频理解能力的 Gemini 模型,最高可将视频分析成本降低 66%,Token 消耗量最高下降 88%,分析准确率最高提升7%。该技术优势在长视频处理场景中表现突出。传统静态处理模式下,开发者往往需要在高额 Token 开销与遗失关键视频细节二者之间权衡取舍,新技术可有效摆脱这一困境。谷歌方面表示,Gemini 3.7 Flash 搭配该新功能,综合表现最优,实现了分析质量与成本效率的良好平衡,处于视频理解任务准确率与成本的帕累托最优前沿。

  不同于固定帧率读取媒体流的静态处理方式,智能体视频理解赋予模型自主决策能力,可根据任务目标自主选择读取内容、播放速度,选取视频帧、音频、转录文本等信息模态,只提取任务所需片段与信号。以往需要开发者手动完成的筛选操作,如今可由模型通过智能循环调用内部工具完成,有效缩减开发工作量。

  该功能具备多项实用能力,支持亚秒级时刻检索,精准捕捉固定帧率下容易遗漏的状态变化与剪辑边界,助力高精度自动化视频编辑;可对时长数小时的长视频开展复杂内容检索,不用消耗海量 Token 资源;能够针对指定时间窗口调高采样帧率,完成快速运动画面、细微视觉异常的检测,还可以对时序下的重复动作、多类物体实现精准计数。

  目前,这项功能已经在 Google AI Studio、Gemini 企业智能体平台的 Gemini 应用程序接口上线,支持本地视频上传与 YouTube 视频解析,开发者只需在接口配置中将处理模式设置为“agentic”,即可开启该能力。

  按照谷歌规划,这项技术能力还将逐步向面向普通用户的产品落地。后续该功能将推送至 Gemini 应用全部 Flash、Flash‑Lite 模型用户;未来数月,智能体视频理解还将赋能 YouTube 视频页面的“Ask YouTube”功能,依托 Gemini 模型,输出更贴合视频画面内容的问答结果。(纯钧)