← 返回新闻列表
InfoQ AI 🗓️ 2026-07-22

最新动态:西部数据 Tim Rausch:AI不是只有GPU,数据最终还要回到存储系统

⚡ 一句话看懂:最新动态:西部数据 Tim Rausch:AI不是只有GPU,数据最终还要回到存储系统。来源:InfoQ AI。

在大模型产业的讨论中,GPU、HBM 和高速互联通常占据舞台中央,机械硬盘则常被视为远离计算核心的“冷数据仓库”。

但随着 AI 从模型训练走向大规模推理,这种判断正在变得过于简单。

7 月 19 日,在 2026 世界人工智能大会期间举行的一场分论坛上,西部数据开发工程高级副总裁 Tim Rausch 试图说明一个容易被忽略的事实:AI 不仅是计算系统,也是一套不断制造、复制、迁移和回收数据的系统。

模型规模越大、用户越多、生成内容越丰富,对存储容量和分层管理的要求反而越高。

这并不意味着 HDD 会取代 SSD,更不意味着所有 AI 数据都应该回到机械硬盘。

真正发生的变化是,HBM、DRAM、SSD 和 HDD 之间的边界正在重新划分。

AI 基础设施竞争的下一阶段,不只是购买更多 GPU,还包括如何把数据放在合适的介质上,并控制每 TB 数据在整个生命周期内的成本。

AI 推理结束后,数据并没有消失 一个 AI 模型的生命周期通常从数据摄取开始。

文本、图片、视频和其他训练资料首先被收集并保存,随后进入清洗、去重、偏差检查和标注等准备环节。

训练开始后,数据从大容量存储迁移至 SSD、内存和 GPU 附近,供计算集群高频读取。

但训练完成并不是数据生命周期的终点。

进入推理阶段后,系统还会产生用户提示词、上下文缓存、生成结果、调用日志、追踪记录、安全审计、合规信息、遥测数据和水印记录。

这些数据中的一部分只在内存中短暂停留,另一部分则需要长期保存。

Rausch 在演讲中演示了一个视频生成请求:让 AI 生成一段 8 秒、720p 的短片。

最终下载的视频大小只有 3.97MB,但按照其展示的系统估算,生成过程中约有 44GB 数据经过 GPU 处理,涉及约 40GB 模型权重、4GB 潜在张量以及解码后的原始帧。

更值得关注的是请求完成后的数据留存。

按照这一案例的估算,平台保存的编码输出、中间结果、推理追踪、请求日志、合规记录、会话信息和元数据合计约 509MB,约为最终下载文件的 130 倍。

这一比例显然不能直接外推到所有 AI 应用,不同平台对中间结果、日志和合规数据的保留策略差异很大。

但它揭示了一个普遍现象:用户看到的生成结果,只是 AI 数据足迹的一小部分。

生成内容还会被继续复制。

一段视频可能保存在生成平台、个人云盘、即时通信软件和社交网络中;平台还可能再次使用 AI 进行内容理解、审核、推荐、字幕生成或广告匹配。

每一次上传、转发和处理,都可能形成新的副本、索引、向量和日志。

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接