展开目录
#Google#Gemini#Workspace#AI图像#视频理解#大模型

Google 双响炮:Pics 硬刚 Canva 把图像设计搬进 Workspace,Agentic Video 让视频分析省 88% token

9 月 1 日 Google 连发两弹:Pics 图像生成与编辑工具正式 GA,正面硬刚 Canva/Adobe Express,深度嵌入 Docs/Slides/Drive;Gemini 3.7 Flash 等三款模型同步上线 Agentic Video Understanding——模型自己决定“怎么看”视频,token 最高省 88%、成本降 66%、准确率反升 7%。

预计阅读 8 分钟

一句话总结

Anthropic、OpenAI 先后引爆 9 月发布会后,Google 在 9 月 1 日连发两弹反击:Google Pics 把“提示词即设计”的专业级 AI 图像创作直接搬进 Workspace,正面硬刚 Canva 与 Adobe Express;同时 Gemini Agentic Video Understanding 上线——模型不再傻乎乎按 1 FPS 抽帧,而是自己决定“看哪里、看多快”,长视频分析 token 最高省 88%、成本降 66%、准确率反而提升约 7%。

数据来源

  • Google Workspace Updates / blog.google 官方公告(2026-09-01)
  • Google DeepMind《Introducing Agentic Video in Gemini》(2026-09-01)
  • TechCrunch / The Verge / TechRepublic / Engadget 报道(2026-09-01/02)
  • the-decoder / Android Authority / tbreak 数据分析(2026-09-02)

主角一:Google Pics ——“提示词即设计”的 Workspace 原生图像工具

5 月在 Google I/O 上亮相的 Pics,9 月 1 日起正式向企业客户与付费订阅用户分批开放(Rapid Release 9 月 1 日启动、Scheduled Release 9 月 15 日启动,各约 15 天内铺满)。它由 Google 的图像生成模型 Nano Banana 驱动,定位非常明确:让你不需要成为设计师,也能交付一张专业级图像——海报、社媒配图、营销素材,全在 Workspace 里完成。

Google Pics 六大核心功能:文生图、对象级编辑、图内文字处理、高清放大等

Pics 的差异化不在“能生成图”——ChatGPT、Gemini 都能——而在编辑的精细度与工作流的零迁移

  • 对象级点选编辑:悬停选中图中的某个物体,用文字描述局部修改,而不是整图重绘;
  • 图内文字处理:直接编辑、重排甚至翻译图片里的文字元素(海报上的英文一键变中文);
  • 多版本生成:一次提示给出多个候选,挑到满意为止;
  • 高清放大到 2K/4K + 按 Web/社媒/印刷/数字预设裁剪 + 完整版本历史随时回退。

更关键的是集成:在 Docs 或 Slides 里选中一张图片,单击即可调出 Pics 的完整编辑工具,不用切换应用;Drive 的“一键打开任意图片编辑”也在数周内跟进。所有创作自动同步,支持多人协作与链接分享。可用范围:Workspace Business Standard/Plus、Enterprise Standard/Plus,以及 Google AI Pro/Ultra/Pro for Education 订阅(Business Starter 不含)。

轻设计战场的三方对比

Google Pics vs Canva vs Adobe Express 三方定位对比

Canva 靠模板与素材市场生态取胜,Adobe Express 背靠专业设计资产,而 Pics 的打法是深度工作流 + 提示词即设计——Google 明摆着要抢“做个海报、发个社媒”这类高频轻设计场景,让企业不再为这点小事订阅第三方工具。对企业 IT 而言有个提醒:Pics 对合格组织默认开启,上线前最好先过一遍内容治理策略。

主角二:Gemini Agentic Video Understanding——视频分析的成本拐点

如果说 Pics 是“产品层”的进攻,Agentic Video Understanding 就是“能力层”的换代。9 月 1 日起,Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite 三款模型同步支持该能力。

过去模型看视频是“静态处理”:按固定 1 FPS 把整段视频抽帧,全部送进模型。10 分钟的教程还好,90 分钟的讲座、多小时的监控录像就成了 token 黑洞——要么烧钱,要么牺牲细节。Agentic 模式的本质改变是:模型自己决定怎么看

静态 1FPS 抽帧 vs Agentic 视频理解:模型自主决定看哪里、看多快

Gemini 把核心推理与原生视频工具结合,像一个“有目的”的观看者:先粗扫定位,再对可疑或关键时间窗动态升 FPS 重采样,全程自主决定用视频帧、音频还是字幕——只取它回答问题真正需要的素材。

Agentic Video 效果数据:token 省 88%、成本降 66%、准确率提升及支持模型

官方口径的收益在长视频上最显著:token 消耗最高降 88%、分析成本最高降 66%,而准确率不降反升约 7%——因为跳过了无关帧,模型反而更聚焦。在 LongVideoBench 上综合质量第一,Google 自家 1H-VideoQA 评估中得分约 90%,高于 GPT-5.6 Terra、Claude Opus 5 与 Grok 4.6(Google 图表口径,供参考)。

由此解锁的场景相当实用:

  • 亚秒级时刻检索:剪辑点、状态变化这类 1 FPS 必然漏掉的瞬间,现在能精确抓住——自动化视频剪辑成为可能;
  • 长视频大海捞针:在多小时的素材里回答复杂问题,不再需要烧掉数百万 token;
  • 异常检测:对可疑时间窗自动升帧率重采样,快速运动与细微伪影都逃不掉;
  • 动作与物体计数:跨时间精确统计重复动作与目标物体。

开发者今天就能用:这是 Gemini API 的一个请求级参数processing: agentic,按请求 opt-in,默认仍是静态处理),AI Studio 与 Gemini Enterprise Agent Platform 已支持,标注为 Generative AI Preview、无额外功能费用。随后该能力将进入 Gemini App(Flash/Flash-Lite),数月内还会落地 YouTube 观看页的 “Ask” 问答。

为什么重要

  1. Google 的武器是“存量工作流”。Pics 不跟 Canva 比模板数量,而是让 30 亿 Workspace 用户“不离开文档就能出图”——把 AI 能力缝进每天打开的应用里,这是 Canva 们很难复制的护城河。
  2. 视频理解成本降了一个数量级,“看懂视频”才真正规模化。88% 的 token 削减意味着视频分析从“演示级”变成“产品级”——质检、安防、内容审核、教育录播检索都会因此受益。
  3. “Agentic”成为多模态的新默认方向。继 Agentic Vision(图像)之后,视频也走上“模型自主采样”路线:省 token 不是靠压缩,而是靠选择——只处理重要的部分,这一思路大概率会被所有多模态厂商跟进。

总结

  • Google Pics:Nano Banana 驱动、对象级编辑 + 图内文字翻译、深度嵌入 Docs/Slides/Drive,9 月 1 日起对 Business Standard+ 与企业版、AI Pro/Ultra 用户分批开放,桌面端先行;
  • Agentic Video Understanding:Gemini 3.7/3.6 Flash 与 3.5 Flash-Lite 支持,模型自主决定观看策略,长视频 token 省 88%、成本降 66%、准确率 +7%,API 参数 processing: agentic 即刻可用;
  • 两弹合一的信号很清晰:OpenAI 卷模型,Google 卷工作流——把能力塞进用户已经离不开的软件里,可能是更隐蔽也更持久的护城河。

Related

相关文章

延伸阅读

查看全部 →
AI安全

阿莫代伊发文《We Must Pace the Frontier》:Anthropic 单方面承诺「嵌入式评估员」,Altman 说同意,Musk 说 Dario 是对的

2026 年 9 月,Anthropic CEO 达里奥·阿莫代伊发表长文《We Must Pace the Frontier》,首次把「放慢前沿能力进步」提为具体方案:三步走——嵌入式第三方评估员、民主国家内部协调、全球协调,Anthropic 单方面承诺第一步。两件事让他改主意:递归自我改进加速,以及 OpenAI-Hugging Face 的 Agent 蜂群越界事件。Sam Altman 表示同意,Elon Musk 说「Dario 是对的」,也有记者批评这是「监管俘获」。

OpenAI

GPT-6 Astra 需求爆表:OpenAI 暂停 200 美元 Pro 新订阅,Altman 说 2026 年不上市

9 月 3 日发布的 GPT-6 Astra 需求「前所未有」,OpenAI 在 9 月 10 日暂停了 200 美元 ChatGPT Pro 的新订阅——Go、Plus 与 API 不受影响。三天后,Sam Altman 又说「考虑到安全方面正在发生的一切,现在上市是不明智的时机」,被追问是否指 2026 年时回答「不是 2026,对」。一个模型,同时顶住了 OpenAI 的产能与 IPO 时间表。

DeepSeek

DeepSeek-V4.1-Flash 发布:552B 参数只激活 8B,KV 缓存砍到 1/4,Agent 账单降了七成

9 月 10 日,DeepSeek 上线 DeepSeek-V4.1-Flash:552B 参数的 MoE 新架构,输入侧只激活 8B、输出侧 16B,KV 缓存压到上一代的 1/4(HBM)与 1/8(SSD),缓存命中低至 0.003 美元/百万 token。峰值输入价格从 V4-Pro 的 1.32 美元降到 0.30 美元,并发从 500 提到 2,500,官方称已全面超越 V4-Pro。