Articles sur l'IA

Permettre des avancées majeures en physique et en sciences de la vie en Europe grâce aux solutions de calcul haute performance de Cornelis et Hammer

Article rédigé par Hammer Enterprise | 27 mars 2026 à 15h29

Les communautés européennes de physique et de sciences de la vie s'apprêtent à entrer dans une nouvelle ère du calcul à très grande échelle : systèmes exascale, IA à mille milliards de paramètres, instruments gourmands en données et flux de travail combinant simulation, analyse et IA. Voici la dure réalité, souvent admise seulement après un premier test à grande échelle : le goulot d'étranglement, c'est le réseau, et non les GPU, le stockage ou même le CPU.

C’est là que Cornelis CN5000 Omni-Path® et la conception et la mise en œuvre de la solution HPC de Hammer se rejoignent : une architecture conçue pour rester prévisible sous forte charge, associée à une approche qui aide les organisations européennes à concevoir, valider, déployer et prendre en charge l’architecture adaptée à leurs applications.

Qu’est-ce qui a changé dans le calcul scientifique européen et pourquoi l’infrastructure est plus importante que jamais ?

La physique et les sciences de la vie sont toutes deux confrontées à des points de tension similaires :

    • Collectifs MPI à grande échelle (allreduce/alltoall), sensibles à la latence de queue
    • De nombreux petits messages où le débit de messages est aussi important que la bande passante
    • Trafic entrant et intermittent (courant dans les processus de formation, de reconstruction et d'analyse de l'IA)
    • Simulation à forte composante de synchronisation où les fluctuations se traduisent par un gaspillage de temps de calcul

Lorsqu'une interconnexion est congestionnée ou introduit des délais importants, on observe des effondrements d'utilisation : des accélérateurs coûteux restent inactifs, attendant que le prochain lot ou le prochain groupe soit terminé.

Le CN5000 en termes simples : ce que c’est et ce qu’il est conçu pour réparer

Cornelis CN5000 Omni-Path est une plateforme réseau évolutive destinée aux environnements d'IA et de HPC où un débit élevé et des performances stables sont requis, même lorsque le système est fortement sollicité.

Quelques points pratiques importants pour les équipes HPC :

    • Commutation de 400G par port (les commutateurs CN5000 sont généralement désignés comme des commutateurs de classe 400G à 48 ports, offrant une bande passante agrégée très élevée par commutateur)
    • Capacité de traitement de paquets très élevée (essentielle pour le trafic HPC à petits messages)
    • Une conception axée sur l'évitement des chutes de performance grâce à un comportement sans perte, une gestion de la congestion du réseau, un routage multipath et un contrôle de flux robuste

L'idée principale : maintenir une communication prévisible lorsque le cluster est rempli de tâches réelles, et pas seulement lors de l'exécution de tests idéalisés sur une infrastructure calme.

Où Hammer intervient pour transformer les capacités du CN5000 en une solution européenne déployable

CN5000 est la technologie textile. La valeur ajoutée de Hammer réside dans sa capacité à la mettre en œuvre concrètement, en conciliant les objectifs de performance avec les contraintes d'approvisionnement, les délais, les normes du site et l'état de préparation opérationnelle.

En pratique, cela signifie généralement :

    • Traduire les besoins des applications (MPI, formation en IA, analyse de pipelines) en une architecture évolutive
    • -Valider les performances avec les tests appropriés (et pas seulement les benchmarks par défaut du fournisseur)
    • Fournir une solution intégrée :
      • Commutation
      • Câblage
      • connectivité de l'hôte
      • Configuration
      • Assistance au déploiement
    • Aider les équipes à devenir opérationnelles :
      • Surveillance
      • Contrôle des changements
      • Stratégie des pièces de rechange
      • Modèles de soutien du deuxième jour

Tableau comparatif : CN5000 vs approches d’interconnexion HPC/IA courantes

Le choix de la « meilleure » interconnexion dépend de la charge de travail, de l'échelle et des préférences opérationnelles. Le tableau ci-dessous propose une comparaison pratique, au niveau de l'architecture, que vous pouvez utiliser lors des premières discussions de conception.

Critère

Cornelis CN5000 Omni-Path

InfiniBand (générations modernes)

Ethernet (RoCE / Ethernet haute performance)

Objectif de conception principal

IA + HPC à montée en charge avec des temps d'exécution prévisibles sous charge

Extension horizontale HPC/IA, largement adoptée dans le HPC haut de gamme

Centre de données étendu + IA/HPC où l'harmonisation des normes et l'utilisation d'outils communs sont essentielles

Comportementen situation de congestion

Conçu pour minimiser l'impact de la congestion et maintenir des performances stables (conception sans perte de signal)

Des options performantes selon la configuration et le contrôle de la congestion

Peut être excellent, mais a tendance à être plus sensible à un réglage précis (PFC/ECN, mise en mémoire tampon, QoS)

sensibilité de la latence de la queue

Généralement optimisé pour une faible latence et un débit de messages élevé

Généralement très performant pour les faibles latences et les applications collectives

Peut être compétitif, mais la latence de queue peut se dégrader en cas de mauvaise configuration ou de surcharge

Complexité opérationnelle

Outils et modèles axés sur le calcul haute performance ; généralement, une approche plus « structurée »

Écosystème mature ; modèles opérationnels robustes dans le calcul haute performance

Bien connu des équipes réseau, le « RoCE de niveau HPC » exige généralement une discipline de conception rigoureuse

Écosystème et intégration

Conçu pour les architectures HPC/IA ; l’intégration dépend des choix de plateforme

Soutien très étendu de l'écosystème HPC

Écosystème de fournisseurs/outils le plus vaste dans l'ensemble

Point idéal typique

Collectifs restreints, HPC à haut débit de messages, clusters mixtes IA/HPC où la prévisibilité est la priorité

Déploiements HPC/IA de très grande envergure avec des pratiques IB établies

Sites adoptant une approche standardisée sur Ethernet, des charges de travail mixtes ou recherchant un modèle opérationnel de réseau unifié

Risque courant en cas de mauvais choix

Validation insuffisante (ne pas tester précocement les modèles de charge de travail réels)

Planification des coûts et de la disponibilité ; les choix de conception ont une importance à grande échelle

« C’est de l’Ethernet, tout ira bien », se dit-on, jusqu’à l’apparition de tempêtes PFC, de failles QoS ou de voisins bruyants

Pour résumer, une règle simple et directe : le calcul haute performance et l’intelligence artificielle scientifique n’ont pas seulement besoin de connexions rapides ; ils ont besoin d’une infrastructure qui reste stable lorsque tout le monde communique en même temps.

Un plan pratique : déployer le CN5000 pour la physique et les sciences de la vie en Europe

1) Commencez par le profil de communication (et non par le nombre de ports)

Posez des questions comme :

    • Sommes-nous dominés par le collectif (allreduce/alltoall) ?
    • Sommes-nous limités par le débit de messages (beaucoup de petits messages) ?
    • Observe-t-on des chutes de performance lorsque le système est fortement sollicité ?
    • Les GPU sont-ils en attente de synchronisation ?

Cela détermine s'il faut optimiser la bande passante, la latence, le comportement en queue de peloton ou adopter une approche équilibrée.

2) Concevoir pour des étapes de mise à l'échelle progressives, et non pour une seule étape

De nombreuses organisations européennes se développent par étapes :

    • preuve de valeur à l'échelle du module ou du rack
    • Production multi-rack
    • Croissance multi-clusters ou fédérée

La conception d'une infrastructure CN5000 doit refléter cela dès le premier jour, notamment en ce qui concerne la topologie, la stratégie de câblage, les ports d'extension et les limites opérationnelles.

3) Valider avec des données scientifiques réelles . Ne vous contentez pas de micro-analyses. Incluez :

    • Collectifs MPI à l'échelle prévue
    • Mini-applications et noyaux représentatifs
    • Tests de communication pour l'entraînement de l'IA (étapes collectives importantes)
    • Tests de charge à locataires mixtes si vous utilisez une infrastructure partagée

L’objectif est de repérer rapidement les succès obtenus en laboratoire par rapport aux succès concrets en production, tant que les modifications restent peu coûteuses.4) Mettre en œuvre rapidement (car c’est dès le deuxième jour que les projets réussissent ou échouent).

Planifier :

  • Télémétrie et tableaux de bord (latence, signaux de congestion, erreurs de liaison, points chauds)
  • Gestion des changements (micrologiciel, dérive de configuration, déploiement contrôlé)
  • Planification des pièces de rechange et de la résilience

C’est là que l’approche de Hammer en matière de livraison et de support peut combler le fossé entre une infrastructure rapide et un service facile à gérer.

Modèles d'architecture de référence pour les laboratoires et instituts de recherche européens

Voici trois modèles courants qui fonctionnent bien lors de la conception d'environnements autour de CN5000 pour la physique et les sciences de la vie

Modèle A : « Capsule scientifique » pour une adoption rapide

    • 1 à 2 racks de calcul (CPU ou GPU)
    • Commutation de feuille dédiée CN5000
    • Des limites d'entrée/sortie claires pour le stockage et le réseau du campus dans son ensemble
    • Idéal pour démontrer les gains réels en termes de charge de travail et pour former les équipes opérationnelles

Modèle B : Cluster de production mixte IA + HPC

    • Partitions ou files d'attente logiques distinctes pour :
      • formation en IA
      • Simulation
      • pipelines de données
    • Tissu conçu pour éviter les nuisances sonores pour les voisins pendant les entraînements intensifs
    • L'accent est mis sur des collectifs prévisibles et des délais d'exécution des tâches stables

Modèle C : Croissance multi-clusters avec services partagés

    • Plusieurs clusters soutenus par CN5000 (par exemple, imagerie des sciences de la vie, simulation physique)
    • Services partagés :
      • Authentification
      • Politique de planification
      • Surveillance
      • Stockage
    • La stratégie de fabrication est axée sur la reproductibilité : « Nous pouvons déployer à nouveau ce système en toute confiance. »

Il n'existe pas de conception « correcte » unique ; l'important est d'aligner la topologie et le modèle opérationnel sur le fonctionnement réel de votre organisation.

Gouvernance des données, sécurité et collaboration à travers l'Europe

La physique et les sciences de la vie se situent souvent aux antipodes du spectre de la gouvernance des données : des données expérimentales relativement ouvertes dans certains domaines de la physique, aux données humaines hautement sensibles dans certains secteurs des sciences de la vie. La conception moderne des réseaux de calcul haute performance doit tenir compte de cette réalité.

Lors du déploiement d'une infrastructure basée sur CN5000 dans des environnements européens, il est essentiel de prévoir une infrastructure adaptée

    • Segmentation par conception (projets, locataires, ensembles de données réglementés)
    • Contrôle des modifications auditable (qui a modifié quoi, quand et pourquoi)
    • Des limites claires sont définies pour le stockage et les réseaux externes (minimiser les chemins de données inattendus)
    • Préparation à la collaboration (prise en charge des modèles d'accès fédérés, le cas échéant)

Rien de tout cela n'est spectaculaire, mais c'est souvent ce qui fait la différence entre « un cluster rapide » et « une plateforme sur laquelle l'organisation peut compter pour les cinq prochaines années ».

Cas d'utilisation courants où la livraison CN5000 + Hammer peut faire la différence

Formation en IA pour les modèles scientifiques

    • Les collectifs, les points de synchronisation et les motifs d'éclatement dominent
    • La prévisibilité sous charge est ce qui améliore le délai d'obtention des résultats

Simulation à grande échelle avec points de synchronisation

    • La latence et la gigue de queue peuvent avoir un impact considérable sur la simulation de physique étroitement couplée
    • La capacité de débit de messages et la stabilité du comportement sont importantes

Pipelines d'imagerie, de reconstruction et multi-omiques

    • Les flux de travail combinent des étapes gourmandes en bande passante et des réorganisations nécessitant d'importantes communications
    • Souvent exécutés simultanément par plusieurs équipes

FAQ : Comment CN5000 Omni-Path aide-t-il dans les clusters HPC + IA réels ?

Comment Cornelis CN5000 Omni-Path améliore-t-il les performances HPC et IA dans les clusters réels ?

Dans les clusters de production, le débit n'est souvent pas le facteur limitant ; ce sont la congestion et la latence résiduelle qui le sont. Le CN5000 est conçu pour garantir une communication prévisible même en cas de forte charge, évitant ainsi les chutes de performance lorsque de nombreux locataires ou de nombreux nœuds communiquent simultanément.

Concrètement, cela découle d'une conception Omni-Path qui met l'accent sur :

    • Comportement sans perte grâce à un contrôle de flux basé sur le crédit (pour éviter les spirales de perte/retransmission sous pression).
    • Routage adaptatif précis / multipath pour contourner les points chauds transitoires.
    • Gestion active de la congestion (souvent décrite comme une régulation/un ralentissement en fonction des informations de commutation) pour réduire les effets de queue.

Résultat net : moins de blocages lors des phases collectives et de synchronisation, et une meilleure utilisation de l'accélérateur lorsque le réseau est sollicité.

Quels types de charges de travail bénéficient le plus du CN5000 en physique et en sciences de la vie ?

Le CN5000 a tendance à donner les meilleurs résultats lorsque la gigue et la latence de queue dominent les résultats, en particulier :

    • Collectifs MPI serrés (par exemple, allreduce/alltoall) à l'échelle
    • Applications à débit de messages élevé avec de nombreux petits messages
    • Simulations nécessitant une synchronisation importante, où quelques processus lents ralentissent le pas de temps
    • Trafic irrégulier ou fortement incast observé dans l'entraînement d'IA multi-nœuds, les pipelines de reconstruction et les analyses impliquant un brassage important de données

Si votre profilage révèle une augmentation du temps passé dans les collectifs, les barrières ou les échanges de halo à mesure que vous vous développez, c'est le type de problème que CN5000 est conçu pour résoudre.

Pourquoi le réseau devient-il le facteur limitant avant les GPU ou le stockage à grande échelle ?

À mesure que les clusters s'agrandissent, le temps de traitement consacré à la coordination (gradients, réductions, échanges, barrières) augmente. En cas de congestion ou de délais importants, les nœuds et GPU les plus rapides se retrouvent à attendre les communications les plus lentes. Le taux d'utilisation peut alors s'effondrer, même si la « bande passante maximale » semble prometteuse sur le papier.

Que signifie « sans perte » en pratique ? Concrètement, « sans perte » signifie éviter que la perte de paquets et les retransmissions n’amplifient la congestion et ne créent des pics de latence. Ces pics se traduisent par des ralentissements collectifs et des temps d’exécution des tâches imprévisibles.

Le CN5000 est conçu pour une transmission sans perte et sans congestion, utilisant un contrôle de flux basé sur le crédit et un routage adaptatif afin de maintenir la stabilité sous charge mixte.

En quoi le CN5000 diffère-t-il de l'InfiniBand ou de l'Ethernet haute performance (RoCE) ?

De manière générale :

    • CN5000 (Omni-Path) : Conçu comme une architecture évolutive de bout en bout optimisée pour des performances prévisibles sous charge, tirant parti d'un comportement sans perte, d'un routage adaptatif et d'un contrôle de la congestion comme objectifs de conception de premier ordre.
    • InfiniBand : largement déployé dans le calcul haute performance (HPC) haut de gamme, avec un écosystème riche et des pratiques opérationnelles éprouvées (excellentes performances, large prise en charge des fournisseurs).
    • RoCE / Ethernet haute performance : Fonctionnellement familier et capable de performances élevées, mais nécessite généralement une discipline autour de la conception PFC/ECN, de la mise en mémoire tampon, de la QoS et du contrôle des voisins bruyants pour éviter les surprises de latence de queue à grande échelle.

Il convient également de préciser clairement : les « avantages complets » du CN5000 sont généralement décrits comme provenant d’une solution Omni-Path de bout en bout (commutateurs + cartes réseau) plutôt que d’un mélange hétéroclite dans le chemin de données.

Que fournit concrètement Hammer dans un projet HPC basé sur CN5000 ?

Hammer transforme l'interconnexion en un système utilisable au quotidien, couvrant généralement :

    • Exigences → conception du réseau : (topologie, objectifs de sursouscription, plan de croissance, stratégie de câblage)
    • Validation : plans de test reflétant les charges de travail réelles (et non de simples micro-benchmarks de laboratoire)
    • Conception et déploiement : commutateurs, optiques/câbles, connectivité hôte, modèles de configuration, assistance à la migration
    • Opérations : attentes en matière de surveillance/télémétrie, gestion des changements, stratégie relative aux pièces de rechange et manuels d'exploitation du support

Comment valider une infrastructure CN5000 avant de procéder à son déploiement complet ?

Une validation pratique avant déploiement comprend généralement :

    • Tests collectifs MPI à l'échelle prévue (et pas seulement sur un seul rack)
    • Mini-applications / noyaux représentatifs de votre base d'utilisateurs réelle
    • Tests de communication IA mettant l'accent sur les étapes fortement collectives (et les schémas de chevauchement)
    • Tests de résistance à locataires mixtes pour mettre en évidence les effets des voisins bruyants et les comportements à long terme

L’objectif : repérer les cas où les « victoires discrètes en laboratoire » ne se traduisent pas en production, tant que les modifications de topologie et de politique sont encore peu coûteuses.

Comment concevoir un réseau CN5000 pour une croissance progressive sur les sites de recherche européens ?

De nombreux programmes évoluent par phases (pod → multi-rack → multi-cluster/fédération). Voici quelques pratiques de conception courantes pour une croissance sans accroc :

    • Choisissez une topologie avec une voie d'extension claire (ports réservés à la croissance, câblage prévisible)
    • Définir les limites opérationnelles dès le début (locataires/partitions/files d'attente, attentes en matière de QoS)
    • Planifiez la manière dont vous gérerez le contrôle des changements et le « rayon d'action » lors de l'ajout de racks ou de sites

De cette façon, la mise à l'échelle n'introduit pas accidentellement de nouveaux points chauds ou de comportements de voisinage bruyants

Comment les déploiements CN5000 peuvent-ils soutenir la gouvernance et la sécurité des données à travers l'Europe ?

Dans les environnements réglementés des sciences de la vie, le réseau fait partie du plan de contrôle de la gouvernance. Les schémas typiques comprennent :

    • Segmentation par projet/locataire (afin que les ensembles de données réglementés ne présentent pas de chemins inattendus)
    • Configuration auditable et contrôle des modifications alignés sur votre modèle de sécurité
    • Définissez clairement les limites du stockage et des réseaux externes afin d'éviter les fuites de données accidentelles
    • Lorsque la collaboration est nécessaire, privilégier des modèles d'accès fédérés délibérés plutôt que le peering ad hoc

Principaux enseignements pour les responsables de la recherche européenne

    • Le réseau est un facteur de plus en plus déterminant pour les performances réelles en physique et en sciences de la vie, notamment pour les charges de travail mixtes IA + HPC.
    • Le Cornelis CN5000 vise des performances prévisibles à grande échelle, où le comportement de congestion et la latence de queue dominent souvent le temps d'exécution des tâches.
    • Hammer contribue à traduire cette capacité en une solution européenne opérationnelle :
      • Conçu
      • Validé
      • Déployé

Fonctionnant comme un service – et non comme un simple assemblage de composants haute performance. Contactez nos experts dès aujourd'hui pour découvrir les solutions Cornelis Networks

 

Vous voulez en savoir plus ?