Technology · · 5 min read
NVIDIA utiliza la IA para mejorar la asignación de suministros de chips complejos
NVIDIA y Palantir han creado un sistema que combina optimización, datos operativos y criterio experto para orientar las decisiones sobre materiales en toda su red de fabricación.
NVIDIA está utilizando Palantir Foundry, optimización acelerada por GPU y un modelo lingüístico de pesos abiertos para ayudar a asignar componentes escasos en toda su red de fabricación. El objetivo es reducir el tiempo necesario para convertir el silicio terminado en infraestructura operativa para centros de datos, según una publicación del NVIDIA Technical Blog en developer.nvidia.com.
NVIDIA mide ese intervalo en dos etapas. La primera, time-to-rack, abarca el trayecto desde que un chip sale de una planta de fabricación hasta que un sistema terminado llega a la sala de un centro de datos. La segunda, time-to-token, comienza cuando llega el hardware e incluye la energía, la refrigeración, la conectividad de red y el software necesarios antes de que pueda realizar un trabajo útil. El proyecto descrito en la publicación se centra principalmente en acortar el time-to-rack.
Una cadena de suministro con cuellos de botella cambiantes
La escala del desafío es considerable. NVIDIA afirma que sus plataformas Grace Blackwell NVL72 dependen de millones de componentes y miles de proveedores en todo el mundo. Decenas de fabricantes de equipos originales y fabricantes de diseños originales participan en el ensamblaje de los sistemas finales.
Incluso una sola bandeja de cómputo es muy compleja. Cada rack contiene 18 bandejas, mientras que una bandeja incluye dos CPU Grace, cuatro GPU Blackwell y 32 pilas de memoria HBM3e. NVIDIA afirma que la cadena de suministro que se está desarrollando para Vera Rubin duplica el tamaño de la red de Grace Blackwell.
La disponibilidad no se mantiene constante. Las CPU, las GPU y la memoria pueden convertirse en el componente limitante en distintos momentos; la pieza que retrasa la producción una semana puede ser fácil de conseguir la siguiente. Cada componente principal también tiene su propia lista de materiales, proveedores y calendarios de entrega. Un centro de fabricación no puede comenzar un ensamblaje hasta que hayan llegado todos los elementos necesarios, tanto si esos materiales proceden directamente de NVIDIA como si provienen de existencias en consignación bajo control de NVIDIA o de proveedores externos. Por tanto, los materiales que llegan antes pueden permanecer inactivos mientras un elemento ausente retrasa todo el ensamblaje.
NVIDIA registra el tiempo durante el cual los materiales permanecen bajo su control entre su llegada a un centro de fabricación y su salida como parte de un subensamblaje o producto terminado. La empresa denomina a esta medida Time of Ownership, o TOO.
La asignación de materiales se revisa semanalmente y abarca el resto del trimestre en curso y el siguiente. Por lo general, las decisiones a corto plazo ya están comprometidas, por lo que la nueva información tiene su mayor efecto en las semanas posteriores. La tarea consiste en determinar qué centros de fabricación deben recibir materiales limitados y en qué cantidades, teniendo en cuenta las capacidades y la capacidad de producción de cada centro.
De los datos operativos a las decisiones
El equipo de operaciones de la cadena de suministro de NVIDIA colaboró con Palantir para reunir una visión compartida de la información que sustenta esas decisiones. La empresa se refiere al resultado como su centro de mando Digital Supply Chain Intelligence. Este reúne alertas, obstáculos de producción y otras señales que antes podían estar dispersas entre sistemas independientes.
Palantir Foundry proporciona el entorno operativo subyacente. Su Ontology vincula materiales, centros, compromisos de los proveedores, capacidad de producción, asignaciones y resultados. También admite información cualitativa, creando una representación gobernada de las relaciones que intervienen en la cadena de suministro, en lugar de tratar cada elemento como una entrada aislada de una tabla.
Esta estructura permite a los planificadores probar futuros alternativos. Pueden examinar las consecuencias de recibir menos memoria o evaluar cómo podría cambiar la red cuando otro centro de fabricación esté disponible. El objetivo es ir más allá de recibir una única respuesta calculada y comprender, en su lugar, las compensaciones que la rodean.
NVIDIA cuOpt, descrito en la publicación como una biblioteca de código abierto para la optimización de decisiones acelerada por GPU, realiza el cálculo de la asignación. Toma los datos de Ontology y devuelve una recomendación de asignación. El problema se formula como un programa lineal entero mixto cuyo objetivo es reducir el TOO.
El software también identifica las restricciones que limitan el resultado. Esto puede mostrar a los planificadores si una decisión está limitada por una capacidad de fabricación regional concreta, por la disponibilidad de memoria o por otro factor. Como el cálculo es rápido, los usuarios pueden ajustar repetidamente las hipótesis e investigar el efecto de posibles cambios.
Capturar lo que saben los expertos
Las pruebas históricas demostraron que la optimización numérica por sí sola no podía reproducir todos los fundamentos de las decisiones humanas. Los planificadores también tenían en cuenta la correspondencia con socios, los riesgos meteorológicos, los acontecimientos geopolíticos, las transcripciones de las llamadas con proveedores y la experiencia acumulada durante años. Esos detalles podían influir en la cantidad de material que debía recibir un centro incluso cuando no estaban representados en las entradas estructuradas del solucionador.
Por ello, NVIDIA y Palantir diseñaron el flujo de trabajo para registrar no solo una asignación, sino también el razonamiento que la sustentaba, el resultado previsto y lo que finalmente ocurrió. La empresa afirma que esto convierte conocimientos que antes eran informales en información que puede revisarse y utilizarse para entrenar un modelo.
Después de evaluar los modelos Nemotron abiertos, los equipos seleccionaron Nemotron 3.5 Lightning para la parte de ejecución del sistema. El modelo utiliza un diseño de mezcla de expertos, tiene 30.000 millones de parámetros y activa unos 3.000 millones durante cada pasada hacia adelante. NVIDIA presenta ese tamaño relativamente compacto como una ventaja para un modelo especializado que puede entrenarse y desplegarse con menos capacidad de cómputo que un sistema generalista más grande.
El modelo está diseñado para estimar el riesgo de producción, sugerir un rango de asignación, identificar las pruebas que respaldan su recomendación y explicar el resultado al personal de la cadena de suministro. Como Nemotron es abierto, NVIDIA afirma que las organizaciones pueden realizar un postentrenamiento en su propio entorno informático utilizando datos operativos internos.
Las decisiones anteriores también proporcionan un método de evaluación. El sistema puede reproducir una decisión histórica utilizando únicamente la información disponible en ese momento, ocultar el resultado final y comparar la recomendación del modelo con la decisión del planificador y con el resultado. Palantir Autopilot gestiona el flujo de trabajo asociado, incluidos los trabajos iniciados a partir de datos de Ontology, la supervisión del modelo personalizado y el linaje que vincula los datos de origen con las versiones del modelo y los resultados.