论文研究 3个月前 更新于 1小时前 92

I/O 2026

谷歌在 I/O 2026 大会上发布了两个新模型:Gemini Omni(支持从任意输入创建内容,起始于视频生成,强化了世界理解和多模态编辑)和 Gemini 3.5 Flash(首个结合前沿智能与行动能力的模型系列)。 推出 Agent 优先的开发平台 Google Antigravity,标志 AI 工具从辅助写作转向帮助行动的代理(Agents),声称“任何人都可以成为构建者”。 在搜索、Gemini 应用及购物场景中全面解锁 Agent 体验,包括 Search 中的信息代理、Gemini 应用的 Daily Brief 以及智能购物车 Universal Cart。 扩大 Gemin

95
热度
88
质量
92
影响力

深度分析

TL;DR

  • 谷歌在 I/O 2026 大会上发布了两个新模型:Gemini Omni(支持从任意输入创建内容,起始于视频生成,强化了世界理解和多模态编辑)和 Gemini 3.5 Flash(首个结合前沿智能与行动能力的模型系列)。
  • 推出 Agent 优先的开发平台 Google Antigravity,标志 AI 工具从辅助写作转向帮助行动的代理(Agents),声称“任何人都可以成为构建者”。
  • 在搜索、Gemini 应用及购物场景中全面解锁 Agent 体验,包括 Search 中的信息代理、Gemini 应用的 Daily Brief 以及智能购物车 Universal Cart。
  • 扩大 Gemini 跨产品部署,涵盖 Google Pics、智能眼镜(今年秋季发布)及 YouTube 的 Ask 功能。
  • 发布 $100/月 的 Google AI Ultra 订阅计划,并扩展 SynthID 和 C2PA 水印技术以标识 AI 生成内容。

为什么值得看

此资讯揭示了 AI 行业从“对话式助手”向“执行式代理(Agentic AI)”转变的关键节点,展示了如何将多模态生成能力与实际行动链路结合。对于开发者而言,Antigravity 平台和增强的 Gemini API 提供了新的构建范式,而针对科学、设计、购物等垂直领域的 Agent 落地案例则为产品策略提供了具体参考。

关键数据

  • $100:这是新推出的 Google AI Ultra 订阅计划的价格指标。
  • 20 年:Project Genie 连接的 Google Street View 图像数据的时间跨度,用于创建基于现实的世界模拟。
  • 1 年:AI Mode 在美国启动后的时间节点,数据显示用户正在从关键词搜索转向自然语言交互。
  • Fall 2026:智能眼镜(Intelligent eyewear)计划发布的特定时间季度。

技术解析

  • Gemini Omni 多模态生成架构:该模型不仅限于文本生成,而是支持“从任意输入创建任何内容”,起步于视频生成。其核心优势在于“世界理解”(World Understanding)和自然语言驱动的编辑能力,实现了多模态输入到多模态输出的闭环。
  • Gemini 3.5 的行动导向设计:作为最新模型家族的一员,Gemini 3.5 Flash 专门设计用于执行复杂的代理工作流(Agentic Workflows),将前沿智能(Frontier Intelligence)与执行动作(Action)相结合,旨在解决复杂任务中的规划与执行问题。
  • Project Genie 与 Street View 融合:Google DeepMind 的技术方案将基于物理的模拟技术与长达近 20 年的街景数据结合,允许用户创建锚定在真实世界地理位置上的新模拟世界,增强了模拟环境的现实感和定位准确性。
  • Agentic Commerce 基础设施:通过 Universal Cart(通用购物车)和 Search 中的 Information Agents,谷歌构建了智能购物基础设施。系统不仅搜索商品,还通过代理自动管理购物车、比较价格并执行购买逻辑,体现了端到端的交易代理能力。

行业启示

  • 从 Copilot 到 Agent 的战略转移:谷歌明确将开发平台(Antigravity)和产品体验(Universal Cart, Daily Brief)定义为“Agent-first”,这意味着未来的竞争壁垒将从模型智力转移到 Agent 的执行可靠性、权限管理和工作流编排能力上。
  • 多模态生成的编辑化趋势:Gemini Omni 强调“自然语言编辑”而非单纯生成,暗示未来创意工具的核心价值将从“生成”转向“可编辑的生成”,降低试错成本,提升专业创作的迭代效率。
  • 可信 AI 基础设施的重要性:随着 AI 生成内容(尤其是视频和图像)的泛滥,谷歌扩展 SynthID 和 C2PA 水印表明,内容溯源和真实性验证将成为 AI 产品合规和用户体验的标配基础设施,企业需提前布局相关技术栈。

常见问题

Q: Gemini 3.5 Flash 和之前的模型在功能上有什么主要区别?
A: Gemini 3.5 Flash 是谷歌最新模型家族中的首个产品,其核心区别在于“结合前沿智能与行动”,专门构建用于执行复杂的代理工作流,而不仅仅是生成内容或回答问题。

Q: 新的 Google Antigravity 平台对开发者意味着什么?
A: Antigravity 是一个 Agent 优先的开发平台,它超越了传统的代码辅助工具,允许开发者构建能够自主行动的 AI 代理。同时,AI Studio 增加了对 Android 的原生支持,使开发者能更便捷地在移动设备上开发和部署代理应用。

Q: 智能眼镜何时可用,主要支持哪些 AI 功能?
A: 谷歌智能眼镜计划在今年秋季(Fall)发布。主要功能包括无需拿出手机即可获取导航路线、发送短信和拍摄照片,这些功能均由内置的 AI 代理支持。

免责声明:以上内容由 AI 生成,仅供参考。

✉️ 免费订阅

每天接收最值得关注的 AI 信号

加入 1000+ 创始人、投资人和技术从业者。每天早上直达邮箱:精选 AI 动态、深度分析、值得关注的二阶变量。

无垃圾邮件,随时退订。