人工智能

忘掉版本号——谷歌最新的人工智能核心在于效率高于一切

谷歌发布 Gemini 3.6 Flash 和 3.5 Flash Lite,优先考虑效率和速度,同时推迟了 3.5 Pro 旗舰产品并预告了 Gemini 4。
忘掉版本号——谷歌最新的人工智能核心在于效率高于一切

虽然科技界通常在等待智能的下一次巨大飞跃,但谷歌最近的举动表明,该行业目前正处于一个精炼循环中。该公司最近宣布了 Gemini 3.6 Flash 和一款专门的网络安全模型,同时承认其备受期待的 3.5 Pro 模型仍留在实验室中。这种模式揭示了人工智能军备竞赛的转变。几个月来,叙事重点一直在于哪台机器能像人类一样思考。现在,首要任务是哪台机器能像廉价、不知疲倦的实习生一样思考。

谷歌在 Gemini 3.5 Flash 首次亮相仅几个月后就决定弃用它,这很不寻常。通常,软件版本在被替换前至少会持续一年。然而,3.5 Flash 未能达到谷歌在 5 月 I/O 大会上设定的预期,尤其是在编程方面。突然转向 Gemini 3.6 Flash 是一种纠正措施。它应对了开发者需要的是今天就能可靠运行的工具,而不是明年可能有效的承诺这一现实。

云端的隐形数学

要理解为什么 0.1 个版本的提升很重要,看看运行这些系统的成本。人工智能模型以称为 Token 的块处理信息。每当你要求聊天机器人写邮件或开发者要求其修复漏洞时,它都会消耗这些 Token。对于大公司来说,这些成本每月累计可达数百万美元。这就是“Flash”品牌发挥作用的地方。

Gemini 3.6 Flash 的效率比其前代产品高出约 17%。在实际应用中,这意味着它使用更少的计算资源来提供相同的答案。对于普通用户来说,这转化为 Gemini 应用中更快的响应速度。对于企业来说,这意味着更低的账单。输出 Token 的价格已从每百万个 9 美元降至 7.50 美元。虽然这听起来变化很小,但对于每小时运行数千个自动化任务的公司来说,这是一个显著的利润提升。

从大局来看,这种效率实现了工程师所说的代理工作流(agentic workflows)。在这些系统中,人工智能不仅是回答问题,还会执行一系列步骤来完成工作,例如预订机票或整理电子表格。每一步都要花钱。通过减少每一步的 Token 数量,谷歌使这些自动化助手对大众市场更具可行性。

编程收益与电脑操作

谷歌声称 Gemini 3.6 Flash 是更好的编程助手。该公司使用名为 DeepSWE 的基准测试来衡量人工智能解决现实世界软件问题的能力。之前的模型得分为 37%,而新的 3.6 版本达到了 49%。对于一个小版本更新来说,这是一个明显的飞跃。这表明谷歌正在微调模型理解逻辑和语法的方式,而不一定使模型变得更大或更慢。

另一个补充是在 API 中标准包含“电脑操作”(computer use)功能。这允许人工智能像人类一样与计算机界面交互,移动光标并点击按钮来操作应用。衡量这一能力的 OSWorld 测试得分从 78.4% 提升到了 83%。虽然这还不能完美替代人工操作,但它标志着人工智能在处理我们每天使用的杂乱、未优化的软件方面变得越来越出色。

为什么你的搜索结果可能感觉不同

在发布 3.6 版本的同时,谷歌还推出了 Gemini 3.5 Flash Lite。这是他们目前阵容中最小、最快的模型。它每秒处理 350 个 Token,对于大多数基于文本的任务来说几乎是瞬时的。谷歌已经将该模型集成到谷歌搜索(Google Search)的 AI Overviews(人工智能概览)中。

对于普通人来说,这是最切实的改变。当你搜索“如何修理漏水的水龙头”并在页面顶部看到人工智能生成的摘要时,速度是最重要的因素。如果摘要需要五秒钟才能加载,你很可能会直接划过。通过使用 Flash Lite 模型,谷歌确保这些摘要的出现速度几乎与传统的蓝色链接一样快。该模型在性能上大致相当于一年前的顶级人工智能模型,但其价格低廉,足以同时为数十亿人提供服务。

网络安全保险库

其中一个更专业的发布是 Gemini 3.5 Flash Cyber。该模型专门针对发现软件代码中的漏洞并提出修复建议进行了调整。根据内部测试,它的表现几乎与 Claude Mythos 等大型模型一样好,但保持了小型系统的速度。但是,你无法下载它或在标准的 Gemini 应用中使用它。

谷歌将该模型视为一种“两用”技术。在错误的人手中,擅长寻找安全漏洞的人工智能是黑客的强大工具。由于这种风险,谷歌将该模型锁在门后。目前,它仅通过名为 CodeMender 的工具提供给受信任的合作伙伴和政府。这种谨慎的做法反映了行业中一种日益增长的趋势,即最强大的专用工具受到限制,以防止广泛的数字破坏。

缺失的旗舰与通往 Gemini 4 之路

此次公告中最明显的遗漏是 Gemini 3.5 Pro。谷歌最初承诺该模型将于 6 月发布,以与 GPT 5.6 和 Claude Fable 等重量级产品竞争。那个截止日期已经过去,但并未发布。该公司现在表示,3.5 Pro 正在与选定的合作伙伴进行测试,并将在“准备就绪时”发布。行业报告显示,延迟源于该模型在复杂的编程任务中无法击败竞争对手。

即使谷歌仍在努力完成 3.5 代产品,它也已经开始预训练 Gemini 4。预训练是构建人工智能中最昂贵且最耗时的部分。它涉及向系统输入来自互联网的数万亿个数据点,以构建其基础知识。通过现在宣布 Gemini 4,谷歌正在向投资者发出信号,表明它没有落后,即使其当前的发布计划有些混乱。

比较新的 Gemini 阵容

模型 主要用例 关键统计数据 API 价格 (每1M输入/输出)
Gemini 3.6 Flash 通用任务、编程、应用 比 3.5 效率高 17% $1.50 / $7.50
Gemini 3.5 Flash Lite 搜索、简单聊天、速度 每秒 350 个 Token $0.30 / $2.50
Gemini 3.5 Flash Cyber 安全审计 限量试点发布 不公开
Gemini 3.1 Flash Lite 旧版高速任务 旧架构 $0.25 / $1.50

这对你意味着什么

从消费者的角度来看,这些更新意味着人工智能正成为基础设施中隐形的一部分,而不是一个华丽的新玩具。你会更频繁地在搜索结果中看到人工智能摘要,因为现在谷歌提供这些摘要的成本更低、速度更快。如果你是一名开发者,你的成本刚刚下降,你的自动化工具在编写代码时应该会犯更少的错误。

最终,“Pro”模型的延迟和发布“3.6”版本的仓促表明,大规模、一夜之间的突破时代已经放缓。我们现在处于优化时代。科技公司不再仅仅试图构建世界上最聪明的大脑,而是试图构建最高效的大脑。作为用户,你应该少关注版本号,多关注这些工具如何集成到你的日常工作流中。最具颠覆性的人工智能不是那个通过图灵测试的模型,而是那个足够快、足够便宜,可以用于每一次搜索和每一封电子邮件的模型。

来源:Google DeepMind Technical Blog, OSWorld Benchmark Reports, DeepSWE Coding Performance Data.

bg
bg
bg

另一边见

我们的端到端加密电子邮件和云存储解决方案提供了最强大的安全通信手段,确保您的数据安全和隐私。

/ 创建免费账户