La R&D automobile européenne est en pleine accélération : les programmes d'électrification, les véhicules définis par logiciel, la validation ADAS/AV et les jumeaux numériques d'usine poussent tous les charges de travail de simulation et d'IA vers des clusters GPU/CPU plus grands avec des cycles d'itération plus serrés.
Le facteur limitant caché n’est plus la puissance de calcul. C’est le réseau—déplacer les gradients, les ensembles de données de capteurs, les maillages et les messages MPI assez rapidement pour que les équipes ne soient pas bloquées par la latence de queue, la congestion ou des performances imprévisibles sous charge.
C’est là que Cornelis Networks CN5000 intervient : une interconnexion de bout en bout spécialement conçue pour un trafic sans perte et sans congestion à 400G, avec des performances de latence MPI inférieures à la microseconde et une gestion de la congestion au niveau du réseau, basée sur l’architecture Omni-Path.
Et associé aux capacités de distribution et d'intégration de Hammer axées sur l'Europe, cela devient une voie pratique pour les organisations automobiles afin de déployer et de prendre en charge des réseaux haute performance au sein d'équipes d'ingénierie multi-sites.
Pourquoi l'innovation automobile dépend désormais du réseau
Les flux de travail d'ingénierie automobile sont de plus en plus couplés et itératifs :
À mesure que les clusters évoluent, une « bonne bande passante moyenne » ne suffit plus. Les équipes automobiles ont besoin de :
Le CN5000 en une minute
CN5000 est positionné comme un réseau d'extension sans perte et sans congestion pour l'IA et le HPC, conçu pour maintenir des performances stables à mesure que vous grandissez.
En un coup d'œil :
Routage multipath Routage adaptatif à grain fin (FGAR) et contrôle de flux sensible à l'incast mentionnés dans le cadre de l'approche de gestion de la congestion
Avec plus de 240 ingénieurs et technologues dédiés à faire progresser l'innovation réseau, Cornelis et Hammer se concentrent sur l'amélioration de l'efficacité des centres de données. Notre portefeuille complet de SuperNIC et de commutateurs s'appuie sur notre héritage en tant qu'inventeurs d'Omni-Path, une architecture conçue pour offrir des performances réseau de la plus haute qualité à l'ère de la mise à l'échelle et un ensemble de fonctionnalités fondamentales pour Ultra Ethernet. Nous apportons des performances de premier plan, notamment une latence ultra-faible, des taux de messages élevés et des performances applicatives optimisées.
Exemple d'impact client :
Amélioration du débit de simulation aérodynamique pour les équipes automobiles et mécaniques, offrant jusqu'à 2× d'augmentation du débit d'itération de conception tout en réduisant la dépendance aux prototypes physiques coûteux et aux essais en soufflerie.
CN5000 vs InfiniBand vs Ethernet RoCEv2 (comparaison axée sur l'automobile)
|
Ce que vous comparez |
Cornelis Networks CN5000 (Omni-Path) |
InfiniBand NDR 400 (par exemple, Quantum-2) |
Ethernet 400G avec RoCEv2 |
|
Intention principale |
Fabric scale-out conçu spécifiquement pour l'IA + le HPC avec un objectif de conception sans perte et sans congestion. |
Fabric HPC/IA avec routage adaptatif et contrôle de congestion dans le cadre de la valeur de la plateforme. |
Ethernet standard ouvert adapté à l'IA/HPC à faible latence utilisant des techniques “sans perte” (souvent PFC + ECN + contrôle de congestion de bout en bout tel que DCQCN). |
|
Classe de vitesse de liaison |
400G par port (options Switch et SuperNIC). |
400 Gb/s par port (NDR 400). |
Généralement Ethernet 400G ; RoCEv2 utilisé pour RDMA (dépend de la conception/fournisseur). |
|
Densité de ports de commutateur 1U (exemple) |
48 × 400G Switch ; 38,4 T en duplex intégral. |
Souvent 64 × 400 Gb/s dans 1U (selon le modèle). |
Varie considérablement ; le comportement dépend fortement de l'ASIC/fournisseur et de vos choix de QoS/buffer/ECMP/télémétrie et de réglage. |
|
Approche de congestion / sans perte (haut niveau) |
Credit-based flow control, link-level retransmissions, fabric-level congestion management, multipath routing—aimed at predictable performance and reduced tail latency. |
Contrôle de la congestion au niveau de la plateforme, QoS/voies virtuelles, routage adaptatif ; peut inclure des fonctionnalités d'accélération dans le réseau (spécifiques à la plateforme). |
“Ethernet sans perte” utilise généralement PFC pour éviter les pertes, plus ECN pour marquer la congestion et signaler la réduction de débit ; le succès opérationnel dépend de la discipline de configuration. |
|
Points de vigilance opérationnels |
Traitez-le comme un système de bout en bout (Switch + SuperNIC + logiciel) pour vous aligner sur l'architecture prévue. |
Choix solide lorsque l'écosystème/les outils IB et les flux de travail existants sont bien établis. |
Les résultats RoCEv2 dépendent fortement d'une conception correcte de PFC/ECN et d'une discipline opérationnelle continue ; des erreurs de configuration peuvent créer un comportement sévère de congestion/latence. |
Ce que “Sans perte, sans congestion” signifie dans les résultats d'ingénierie quotidiens
Délai d'exécution du solveur plus rapide -
Dans les grandes simulations MPI, le temps d'exécution peut être dominé par les phases de communication (échange de halo, réductions, synchronisation). Le CN5000 met l'accent sur l'optimisation du débit de messages et de la latence, ainsi que sur la gestion de la congestion—visant des performances prévisibles sous charge.
Meilleure efficacité d'entraînement de l'IA distribuée (piles ADAS/AV et autonomie)
Le CN5000 se positionne comme une infrastructure conçue pour l'entraînement et l'inférence de l'IA qui maintient le débit sous charge en minimisant les événements de congestion et la latence de queue.
Où vous le ressentirez : utilisation GPU plus élevée (moins de temps d'attente sur les collectifs), temps d'étape plus stables, délai d'entraînement amélioré pour de nouveaux domaines de capteurs ou variantes de modèles.
Contrôle pratique grâce à la télémétrie (pas de conjectures)
Lorsque plusieurs équipes partagent la même plateforme, les schémas de trafic peuvent changer d'heure en heure. Le CN5000 met en évidence la télémétrie et la visibilité en temps réel pour prendre en charge une gestion du trafic adaptée à la charge de travail.
Où vous le ressentirez : résolution plus rapide des causes des variations de performance et planification de capacité plus claire, en particulier dans les clusters à usage mixte.
Conception du CN5000 dans de véritables clusters HPC et IA automobiles
Traitez la congestion comme le cas normal, et non comme un cas limite
Les plateformes automobiles sont presque toujours à usage mixte : CAE le matin, formation l'après-midi, pipelines de jumeaux numériques en arrière-plan, et tout le monde pousse “une exécution de plus” avant une étape. Le CN5000 met en avant la gestion de la congestion au niveau du tissu, le contrôle de flux adapté aux incasts et le routage adaptatif pour maintenir les performances sous charge.
Gardez votre histoire “sans perte” de bout en bout
Cornelis présente la “transmission sans perte et sans congestion” comme une propriété architecturale du CN5000 (Switch + SuperNIC + routage/contrôle de flux). En pratique : spécifiez-le comme un système, validez-le comme un système.
Vous voulez en savoir plus ?