Dezvoltarea aplicațiilor de inteligență artificială la scară mare impune cerințe tot mai complexe pentru infrastructura IT. Organizațiile care implementează modele AI avansate trebuie să gestioneze resurse GPU extinse, să asigure utilizarea eficientă a hardware-ului și să mențină controlul asupra datelor și infrastructurii. În acest context, serverele Supermicro cu Mirantis k0rdent AI, oferă o soluție integrată care combină serverele de înaltă performanță Supermicro cu platforma Mirantis k0rdent AI.

Combinația este concepută pentru implementarea infrastructurilor de sovereign AI și a cloudurilor GPU hibride, în care organizațiile pot rula atât aplicații tradiționale, cât și modele AI complexe pe aceeași platformă. Validarea acestei arhitecturi a demonstrat modul în care infrastructura bare-metal poate fi administrată și orchestrată prin instrumente cloud-native, reducând complexitatea implementării clusterelor AI.
Mirantis k0rdent AI este conceput ca un plan de control pentru administrarea infrastructurilor AI complexe. Platforma automatizează aprovizionarea infrastructurii, managementul ciclului de viață al resurselor și orchestrarea serviciilor necesare pentru rularea aplicațiilor AI.
Sistemul permite administrarea infrastructurii de la nivelul serverelor fizice până la nivelul aplicațiilor și al modelelor AI. Acest model este descris ca o abordare „metal-to-model”, în care infrastructura hardware, platforma cloud și aplicațiile AI sunt integrate într un flux operațional unificat.
Prin utilizarea automatizării și a operatorilor software specializați, platforma poate gestiona resurse GPU, rețele de mare viteză și infrastructuri Kubernetes fără a necesita configurări manuale complexe.
Un element central al soluției este integrarea serverelor Supermicro cu platforma k0rdent AI prin intermediul operatorului bare-metal. Acest mecanism conectează infrastructura fizică la platforma Kubernetes și permite administrarea nodurilor direct la nivel hardware.
Sistemul comunică cu controlerele de management ale serverelor prin protocolul Redfish și poate automatiza configurarea BIOS-ului, actualizările de firmware și configurarea subsistemelor de stocare. De asemenea, procesul de provisioning permite descoperirea automată a serverelor și instalarea sistemului de operare și a distribuției Kubernetes fără intervenție manuală.
Această abordare permite implementarea rapidă a clusterelor bare-metal pentru aplicații AI, eliminând nevoia de hypervisors sau configurări manuale.
În mediul de validare utilizat pentru această soluție, infrastructura a fost construită în jurul acceleratoarelor AMD Instinct MI325X. Aceste GPU-uri sunt optimizate pentru sarcini de lucru AI și pot fi integrate în clustere cu mai multe noduri pentru antrenarea și inferența modelelor de inteligență artificială.

Gestionarea resurselor GPU este realizată prin intermediul AMD GPU Operator, care automatizează instalarea și configurarea stack-ului ROCm și permite alocarea resurselor GPU în cadrul clusterului. Platforma verifică automat performanța și conectivitatea GPU-urilor, inclusiv lățimea de bandă între acceleratoare și accesul la memoria partajată.
În cadrul testelor de validare, fiecare nod GPU a fost configurat cu opt acceleratoare MI325X conectate prin Infinity Fabric pentru a asigura performanță maximă în aplicațiile AI.
Pentru a susține comunicarea între GPU-uri și nodurile clusterului, infrastructura utilizează componente de rețea de mare performanță. În arhitectura validată, rețeaua a fost construită în jurul adaptorului AMD Pensando Pollara 400, capabil de conectivitate de 400 GbE.

Operatorul AMD Network este responsabil pentru configurarea automată a acestor interfețe de rețea și pentru alocarea resurselor necesare comunicației între nodurile clusterului. Acest lucru este esențial pentru aplicațiile AI distribuite, în care performanța rețelei influențează direct viteza de antrenare a modelelor.
Testele de validare au fost realizate pe o infrastructură compusă din mai multe tipuri de noduri. Nodurile de control și management utilizează servere Supermicro AS-2124BT-HNTR cu procesoare AMD EPYC, iar nodurile GPU sunt bazate pe servere Supermicro AS-8126GS-TNMR echipate cu două procesoare AMD EPYC 9965 și opt acceleratoare AMD Instinct MI325X.
Această arhitectură permite separarea componentelor de control ale clusterului de nodurile destinate sarcinilor AI intensive. Platforma k0rdent coordonează comunicarea între aceste componente și gestionează ciclul de viață al clusterului.
Pentru evaluarea performanței infrastructurii, testele au utilizat modelul Llama-3.1-8B-Instruct în cadrul unui container optimizat ROCm pentru vLLM. Scopul testului a fost evaluarea performanței brute a GPU-urilor în operațiuni de calcul.
Rezultatele obținute au indicat performanțe apropiate de valorile teoretice ale hardware-ului, cu aproximativ 160 TFLOPs pentru calcule FP64 tensor și peste 82 TFLOPs pentru calcule vectoriale, confirmând că infrastructura poate susține sarcini AI intensive în condiții de producție.
Unul dintre obiectivele principale ale acestei integrări este reducerea complexității administrării infrastructurilor AI. Prin automatizarea proceselor de configurare și management, organizațiile pot implementa mai rapid clustere GPU și pot reduce erorile operaționale.
Platforma k0rdent permite administrarea aplicațiilor tradiționale, a mașinilor virtuale și a sarcinilor AI pe aceeași infrastructură. Astfel, organizațiile pot construi clouduri hibride GPU în care resursele hardware sunt utilizate pentru o gamă largă de aplicații.
În concluzie, integrarea platformei Mirantis k0rdent AI cu serverele Supermicro oferă o abordare unificată pentru implementarea infrastructurilor de sovereign AI și a cloudurilor GPU hibride.
Prin combinarea infrastructurii bare-metal cu instrumente cloud-native de orchestrare, această arhitectură permite gestionarea eficientă a resurselor GPU și implementarea rapidă a clusterelor AI. Rezultatul este o platformă care poate susține atât aplicații enterprise tradiționale, cât și modele de inteligență artificială de mare dimensiune într un mediu controlat și automatizat.