Technology · · 4 min read

NVIDIA использует ИИ для улучшения распределения сложных поставок чипов

NVIDIA и Palantir создали систему, которая объединяет оптимизацию, операционные данные и экспертные оценки, чтобы принимать решения о материалах по всей производственной сети компании.

NVIDIA использует Palantir Foundry, оптимизацию с ускорением на GPU и языковую модель с открытыми весами, чтобы распределять дефицитные компоненты по своей производственной сети. Эта работа призвана сократить время, необходимое для превращения готовых кремниевых чипов в работающую инфраструктуру центров обработки данных, говорится в публикации в техническом блоге NVIDIA на сайте developer.nvidia.com.

NVIDIA измеряет этот интервал в два этапа. Первый — time-to-rack, то есть время от выхода чипа с фабрики до поступления готовой системы на площадку центра обработки данных. Второй — time-to-token, который начинается после доставки оборудования и включает энергоснабжение, охлаждение, сетевую инфраструктуру и программное обеспечение, необходимые до начала выполнения полезной работы. Описанный в публикации проект главным образом сосредоточен на сокращении time-to-rack.

Цепочка поставок с меняющимися узкими местами

Масштаб задачи весьма значителен. NVIDIA сообщает, что ее платформы Grace Blackwell NVL72 зависят от миллионов компонентов и тысяч поставщиков по всему миру. В сборке конечных систем участвуют десятки производителей оригинального оборудования и производителей оригинального дизайна.

Даже один вычислительный лоток отличается высокой сложностью. Каждый шкаф содержит 18 лотков, а один лоток включает два процессора Grace, четыре GPU Blackwell и 32 стека памяти HBM3e. NVIDIA заявляет, что цепочка поставок, создаваемая для Vera Rubin, вдвое больше сети Grace Blackwell.

Доступность компонентов не остается постоянной. Процессоры, GPU и память могут становиться ограничивающим компонентом в разное время: деталь, задерживающая производство на одной неделе, на следующей может быть доступна без труда. У каждого крупного компонента также есть собственная ведомость материалов, поставщики и графики поставок. Производственная площадка не может начать сборку, пока не будут доставлены все необходимые позиции — независимо от того, поступают ли эти материалы непосредственно от NVIDIA, со склада консигнационных запасов NVIDIA или от внешних поставщиков. Поэтому поступившие раньше материалы могут простаивать, пока отсутствующая позиция задерживает всю сборку.

NVIDIA отслеживает время, в течение которого материалы находятся под ее контролем между прибытием на производственную площадку и отправкой в составе узла или готового изделия. Компания называет этот показатель Time of Ownership, или TOO.

Распределение материалов пересматривается еженедельно и охватывает оставшуюся часть текущего квартала и следующий квартал. Решения на ближайший период, как правило, уже приняты, поэтому новая информация сильнее всего влияет на последующие недели. Задача заключается в том, чтобы определить, какие производственные площадки должны получить ограниченные материалы и в каком количестве, с учетом возможностей и мощностей каждой площадки.

Превращение операционных данных в решения

Операционная команда NVIDIA по управлению цепочками поставок совместно с Palantir создала единое представление информации, лежащей в основе этих решений. Компания называет получившийся результат командным центром Digital Supply Chain Intelligence. Он объединяет предупреждения, препятствия для производства и другие сигналы, которые прежде могли быть распределены между отдельными системами.

Palantir Foundry предоставляет базовую операционную среду. Ее Ontology связывает материалы, площадки, обязательства поставщиков, производственные мощности, распределение и результаты. Она также учитывает качественную информацию, создавая управляемое представление взаимосвязей в цепочке поставок, а не рассматривая каждый элемент как изолированную запись в таблице.

Такая структура позволяет планировщикам проверять альтернативные сценарии. Они могут изучить последствия получения меньшего объема памяти или оценить, как может измениться сеть после ввода в эксплуатацию еще одной производственной площадки. Цель заключается в том, чтобы не просто получать один рассчитанный ответ, а понимать связанные с ним компромиссы.

NVIDIA cuOpt, описанная в публикации как библиотека с открытым исходным кодом для оптимизации принятия решений с ускорением на GPU, выполняет расчет распределения. Она получает данные из Ontology и выдает рекомендацию по распределению. Задача формулируется как смешанно-целочисленная линейная программа, целью которой является сокращение TOO.

Программа также определяет ограничения, сдерживающие результат. Это может показать планировщикам, ограничено ли решение конкретной региональной производственной мощностью, доступностью памяти или другим фактором. Поскольку расчет выполняется быстро, пользователи могут неоднократно менять предположения и исследовать эффект потенциальных изменений.

Фиксация экспертных знаний

Историческое тестирование показало, что одной численной оптимизации недостаточно для воспроизведения всей основы человеческих решений. Планировщики также учитывали переписку с партнерами, погодные риски, геополитические события, расшифровки разговоров с поставщиками и опыт, накопленный за годы работы. Эти детали могли влиять на объем материалов, который должна получить площадка, даже если они не были представлены в структурированных входных данных решающего алгоритма.

Поэтому NVIDIA и Palantir разработали рабочий процесс так, чтобы фиксировать не только распределение, но и лежащие в его основе рассуждения, ожидаемый результат и то, что в итоге произошло. Компания заявляет, что это превращает ранее неформализованные экспертные знания в информацию, которую можно анализировать и использовать для обучения модели.

После оценки открытых моделей Nemotron команды выбрали Nemotron 3.5 Lightning для исполнительной части системы. Модель использует архитектуру «смеси экспертов», имеет 30 миллиардов параметров и активирует около 3 миллиардов во время каждого прямого прохода. NVIDIA представляет этот относительно компактный масштаб как преимущество для специализированной модели, которую можно обучать и развертывать с меньшими вычислительными ресурсами, чем более крупную систему общего назначения.

Модель предназначена для оценки производственных рисков, предложения диапазона распределения, выявления подтверждающих рекомендацию данных и объяснения результата сотрудникам цепочки поставок. Поскольку Nemotron является открытой моделью, NVIDIA заявляет, что организации могут дообучать ее в собственной вычислительной среде, используя внутренние операционные данные.

Прошлые решения также предоставляют метод оценки. Система может воспроизвести исторический выбор, используя только доступную на тот момент информацию, скрыть фактический последующий результат и сравнить рекомендацию модели с решением планировщика и итогом. Palantir Autopilot управляет связанным рабочим процессом, включая задачи, запускаемые на основе данных Ontology, мониторинг настроенной модели и отслеживание происхождения данных, связывающее исходные данные с версиями модели и результатами.

artificial intelligencesupply chainsemiconductorsmanufacturingoptimizationnvidiapalantir

Continue reading

Read this in another language