DeepMind · 2026年9月1日 · 1Cifer
谷歌让Gemini实现智能体式视频理解:数小时录像变成问题的答案
DeepMind展示了Gemini的智能体式视频理解:模型不只是「看」视频,而是像研究者一样处理它——来回快进、回到关键处、比对片段,并针对提出的问题组装答案。一小时的录像不再消耗人的一小时。
对企业来说,这解锁了一整层未被使用的数据。多数公司早已拥有视频:仓库和卖场的监控、例会和谈判的录像、培训材料。这些内容几乎从不被重看——时间成本太高。一个可以被问「货架什么时候空的」「那次会上我们向客户承诺了什么」的AI智能体,改变了视频档案的经济学。
给哈萨克斯坦公司的实际步骤是盘点:你手上已经在积累哪些视频,你想对它们提出什么问题。陈列检查、客诉纠纷复盘、产线不良原因排查——场景就摆在眼前,而入门门槛每次发布都在降低。


