Technology · · 3 min read
英伟达利用人工智能改进复杂芯片供应分配
英伟达与 Palantir 搭建了一套结合优化技术、运营数据和专家判断的系统,用于指导其制造网络中的物料决策。
英伟达正在使用 Palantir Foundry、GPU 加速优化技术和一个开放权重语言模型,帮助在其制造网络中分配稀缺零部件。据英伟达技术博客 developer.nvidia.com 上的一篇文章介绍,这项工作旨在缩短将成品硅片转化为可运行的数据中心基础设施所需的时间。
英伟达将这一时长分为两个阶段进行衡量。第一阶段是从芯片离开晶圆厂到完整系统抵达数据中心地面的过程,即“芯片到机架时间”(time-to-rack)。第二阶段是“芯片到令牌时间”(time-to-token),从硬件抵达后开始,还包括其执行有用工作前所需的电力、冷却、网络和软件。文章介绍的项目主要着眼于缩短芯片到机架时间。
一个瓶颈不断变化的供应链
挑战的规模相当可观。英伟达表示,其 Grace Blackwell NVL72 平台依赖全球数百万个零部件和数千家供应商。数十家原始设备制造商和原始设计制造商参与最终系统的组装。
即便是一块计算托盘,其复杂程度也很高。每个机架包含 18 个托盘,而每个托盘包括两颗 Grace CPU、四颗 Blackwell GPU 和 32 组 HBM3e 内存堆栈。英伟达表示,正在为 Vera Rubin 开发的供应链规模是 Grace Blackwell 网络的两倍。
供应情况并非一成不变。CPU、GPU 和内存都可能在不同时间成为限制性部件,某个零部件本周还在拖延生产,下周可能就很容易获得。每个主要部件也都有各自的物料清单、供应商和交付时间表。制造工厂只有在所有必需物料到齐后才能开始组装,无论这些物料是由英伟达直接提供、来自英伟达持有的寄售库存,还是来自外部供应商。因此,先到的物料可能会闲置,而缺失的某一件物料则会耽搁整个生产过程。
英伟达会追踪物料在其控制之下的时间:从抵达制造地点开始,到作为子组件或成品的一部分离开为止。公司将这一指标称为“所有权时间”(Time of Ownership),简称 TOO。
物料分配每周审查一次,覆盖当前季度剩余时间,并延伸至下一个季度。近期决策通常已经确定,这意味着新信息对之后几周的影响最大。任务是确定哪些制造工厂应当获得有限的物料,以及应获得多少,同时还要考虑每个工厂的能力和产能。
将运营数据转化为决策
英伟达的供应链运营团队与 Palantir 合作,汇集了支撑这些决策的信息,并建立了一个共享视图。公司将这一成果称为“数字供应链智能指挥中心”(Digital Supply Chain Intelligence command centre)。它整合了预警、生产障碍和其他信号,而这些信息此前可能分散在不同系统中。
Palantir Foundry 提供底层运营环境。其 Ontology 将物料、工厂、供应商承诺、生产能力、分配情况和产出关联起来。它还能够容纳定性信息,以受治理的方式呈现供应链中涉及的各种关系,而不是把每一项都当作孤立的表格条目。
这种结构让规划人员能够测试不同的未来情景。他们可以研究内存供应减少所带来的后果,也可以评估网络在新增一个制造工厂后可能发生的变化。目标是不再只是得到一个经过计算的单一答案,而是理解围绕该答案的各种权衡。
英伟达 cuOpt 在文章中被描述为一个用于 GPU 加速决策优化的开源库,负责执行分配计算。它从 Ontology 获取数据,并返回一项分配建议。该问题被表述为一个混合整数线性规划,目标是缩短 TOO。
该软件还会识别限制结果的约束条件。这可以帮助规划人员判断,某项决策是否受特定地区的制造产能、内存供应或其他因素限制。由于计算速度很快,用户可以反复调整假设,研究潜在变化的影响。
记录专家掌握的知识
历史测试显示,单靠数值优化无法复现人类决策的完整依据。规划人员还会考虑合作伙伴往来通信、天气风险、地缘政治发展、供应商电话会议记录以及多年积累的经验。这些细节即使没有体现在求解器的结构化输入中,也可能影响某个工厂应获得多少物料。
因此,英伟达和 Palantir 设计了这套工作流程,不仅记录分配结果,还记录其背后的推理、预期结果以及最终实际发生的情况。公司表示,这会把此前较为非正式的专业知识转化为可供审查并用于训练模型的信息。
在评估了开放的 Nemotron 模型后,团队选定 Nemotron 3.5 Lightning 负责系统的执行部分。该模型采用混合专家架构,拥有 300 亿个参数,每次前向传播约激活 30 亿个参数。英伟达认为,这种相对紧凑的规模有利于打造专注型模型,使其能够以低于更大型通用系统的计算能力完成训练和部署。
该模型旨在估算生产风险、提出分配范围、识别支撑其建议的证据,并向供应链工作人员解释结果。英伟达表示,由于 Nemotron 是开放的,各组织可以在自己的计算环境中利用内部运营数据对其进行后训练。
过去的决策也提供了一种评估方法。系统可以仅使用当时可获得的信息重演一项历史决策,隐藏最终结果,并将模型的建议与规划人员的决策及实际结果进行比较。Palantir Autopilot 负责管理相关工作流程,包括从 Ontology 数据启动的任务、定制模型的监控,以及将源数据与模型版本和结果关联起来的数据血缘。