人工智能

忘掉关于大规模云端 AI 的炒作——IBM 希望您的数据留在本地

IBM 发布了用于本地企业部署的 Granite 4.2 模型,专注于代理能力和推理,无需依赖云端。
忘掉关于大规模云端 AI 的炒作——IBM 希望您的数据留在本地

科技行业花费大部分时间说服你,人工智能需要位于遥远沙漠中的大规模、无形的超级计算机。这种叙事暗示,如果你想让机器思考,就必须租用万亿级公司拥有的服务器时间。这种设置迫使每一个提示词和每一份敏感文件都要跨越互联网,存储在别人的硬件上。IBM 随着 Granite 4.2 系列的发布正走上一条不同的道路。这些模型不一定要存在于云端;它们存在于您的硬件上。

Granite 4.2 代表了对于厌倦了波动的 API 成本和隐私风险的企业和开发人员来说,向本地、可预测计算的转变。通过将这些模型作为开放权重模型发布,IBM 允许用户下载整个包并在自己的服务器甚至高端工作站上运行。这种方法将 AI 视为更像是一个只在办公室内工作的勤奋实习生,而不是神秘的神谕。

走进 Granite 4.2 系列

新版本包括三种不同的尺寸:3B、8B 和 30B 参数。在大语言模型的世界里,参数数量通常表示数字大脑的复杂程度。3B 模型足够小,可以在具有不错速度的现代笔记本电脑上运行。8B 模型是目前大多数开发者的黄金平衡点,在智能和硬件要求之间取得了平衡。30B 模型是主力,专为需要高精度处理复杂任务的企业服务器而设计。

该系列中的每个模型都采用仅解码器(decoder-only)架构。这是一个标准的设计选择,重点在于预测序列的下一部分,这就是这些系统生成文本的方式。4.2 版本的一个重要补充是 128,000 token 的上下文窗口。透视来看,一本标准的小说大约有 60,000 到 90,000 个 token。这种规模的上下文窗口允许模型在单次会话中阅读并记住整个技术手册或大规模代码库。

模型尺寸 最佳用例 硬件要求(约)
Granite 4.2 3B 移动应用、简单聊天机器人、基础摘要 8GB 内存 / 消费级笔记本电脑
Granite 4.2 8B 编码辅助、详细分析、工具使用 16GB-24GB 显存 / 专业工作站
Granite 4.2 30B 复杂推理、企业工作流、大数据 64GB+ 显存 / 多 GPU 服务器

功能性推理的现实

IBM 将 Granite 4.2 描述为一个专注于推理的版本。在科技领域,推理是一个特定术语,描述模型使用思维链处理的能力。这不是意识或真正的理解。相反,模型将复杂问题分解为中间步骤,并将这些步骤的结果传递到下一步。这个过程模拟了人们如何通过在纸上展示解题过程来解决数学问题。

对于普通用户来说,这种对推理的关注转化为逻辑密集型任务中更高的准确性。如果你要求一个标准模型规划一个带有五个冲突约束的旅行路线,它可能会忽略其中两个以给你一个快速答案。像 Granite 4.2 这样专注于推理的模型更有可能在提供最终响应之前对照其他约束检查每个约束。代价是速度。这些模型通常需要更长的时间来生成响应,因为它们在幕后进行了更多的数学繁重工作。使用推理模型就像雇佣一名细致的审计员,而不是一名口若悬河的销售人员。

代理能力与工具使用

8B 和 30B 变体经过专门训练,具有了代理能力。这个术语指的是 AI 作为代理在现实世界中执行任务的能力。这些模型不仅仅是编写文本,还可以与外部工具交互。它们可以使用计算机终端、在网上搜索最新信息或执行代码片段来验证答案。

IBM 使用了一个特定的强化学习模块来教导这些模型如何有效地使用工具。虽然最小的 3B 模型在技术上可以使用工具,但它缺乏在较大同类模型中发现的专门训练。这使得 8B 和 30B 模型对于想要自动化重复性数字任务的开发者来说特别具有颠覆性。代理模型可以查看电子表格,识别缺失的数据点,在网上搜索以找到该数据,然后在无需人工干预的情况下更新文件。这一转变使 AI 从被动的聊天界面转变为工作流中的积极参与者。

为什么本地托管对您的预算至关重要

查看本地模型最根本的原因之一是云成本。像 OpenAI 和 Anthropic 这样的公司按 token 收费,这本质上是对 AI 阅读或编写的每个单词征税。对于小企业来说,这些成本是不稳定的且难以预测。如果某个特定项目突然需要 AI 分析数千份文档,每月账单可能会在毫无预警的情况下从数百美元跳升至数千美元。

本地模型改变了财务计算。一旦你拥有了硬件并下载了模型,生成一百万个单词的成本仅仅是运行服务器的电费。这种可预测性是 IBM 瞄准企业市场的主要原因。大型组织更喜欢稳定、固定的成本,而不是前沿云提供商波动的定价模型。当模型在您自己的芯片上运行时,月底不会出现意外费用。

模型路由器的兴起

随着像 Granite 4.2 这样的模型变得越来越普及,开发者越来越多地使用模型路由器。路由器就像一个数字交通警察。当用户提交提示词时,路由器会分析任务的难度。如果用户要求一个简单的摘要,路由器会将任务发送给微小的 3B 模型以节省电量和时间。如果用户要求进行复杂的架构审查,路由器会将其发送给 30B 模型。

这种分层方法允许组织平衡性能和效率。它防止了将庞大、耗电的模型用于较小模型在半时间内就能处理的任务所造成的浪费。通过使用 Granite 系列,开发者可以构建一个精简的系统,使合适的工具始终与工作相匹配。这种相互关联的模型生态系统正在成为专业 AI 部署的标准。

隐私与行业的无形支柱

对于许多行业来说,由于监管要求,云端是行不通的。医疗保健提供者、律师事务所和政府承包商通常处理法律上不能离开其安全网络的数据。在这些环境中,本地大语言模型是唯一可行的前进道路。Granite 4.2 为这些行业提供了一种使用现代 AI 的方式,而不会违反隐私法或泄露商业机密。

IBM 已将自己定位为这些行业的无形支柱提供商。他们不追求最亮眼的头条新闻,也不试图构建一个会写诗的聊天机器人。他们的重点是在企业数据中心可靠运行的可预测、可扩展的部署。这种务实精神是对围绕前沿模型的炒作日益增长的怀疑的回应,这些模型对于严肃的工业用途来说往往过于昂贵或过于不透明。

这对你意味着什么

如果你是一名个人开发者或对技术好奇的爱好者,Granite 4.2 的发布是投资本地硬件的一个信号。配备高端消费级 GPU 的计算机现在可以运行曾经是研究实验室专属领域的模型。您可以试验代理工作流和大规模数据分析,而无需担心按 token 收费的 API 费用或数据隐私。

对于企业主来说,这次发布是一个摆脱云订阅缓慢流失资金的机会。它允许您构建内部工具,使其对互联网中断和外部价格上涨具有韧性。您可以保持对自己数字基础设施的控制,而不是等待云提供商更新其服务条款。底线是,AI 正在成为一种本地实用程序,而不是远程服务。观察您今天的数字习惯可能会发现,您发送到云端的许多任务可以由您身边的模型更便宜、更安全地处理。

来源:IBM Research, Granite Model Documentation, IBM Newsroom.

bg
bg
bg

另一边见

我们的端到端加密电子邮件和云存储解决方案提供了最强大的安全通信手段,确保您的数据安全和隐私。

/ 创建免费账户