Modules optiques 400G dans les réseaux modernes
Dec 17, 2025|
LeModule optique 400Greprésente à la fois un triomphe du pragmatisme technique et une source de problèmes opérationnels constants. À la base, il fait quelque chose de simple : transmettre 400 milliards de bits par seconde à travers le verre en utilisant la lumière. L'implémentation s'étend sur plusieurs facteurs de forme, schémas de modulation, configurations de longueur d'onde et interprétations des fournisseurs de ce que signifie réellement « compatible ». La modulation PAM4 a amené l'industrie à ce seuil de vitesse en codant deux bits par symbole au lieu d'un, doublant ainsi le débit sans doubler le débit en bauds.-mais cette décision entraîne des conséquences qui se répercutent sur chaque couche de la pile de déploiement, depuis le silicium DSP brûlant 12 watts à l'intérieur du module jusqu'aux moteurs FEC sur la plate-forme hôte qui se démènent pour corriger les erreurs de bits élevées que PAM4 produit intrinsèquement.

La guerre des facteurs de forme que personne n'a gagnée
QSFP-DD et OSFP sont sortis du processus de normalisation comme deux frères et sœurs qui ne parvenaient à s'entendre sur rien, sauf sur le fait qu'ils voulaient tous les deux 400 G. L'industrie avait besoin de huit voies électriques à 50 Gbit/s chacune, et deux consortiums différents ont décidé de résoudre ce problème de deux manières différentes.
QSFP-DD a remporté l'argument de compatibilité. Il s'adapte aux cages QSFP28 existantes si vous louchez assez fort et que la deuxième rangée de broches ne vous dérange pas. La rétrocompatibilité est importante lorsque vous disposez de dizaines de milliers de ports déployés et d'un directeur financier qui pose des questions pointues sur les actifs bloqués.
OSFP a gagné l'argument thermique. Le boîtier légèrement plus grand et le dissipateur thermique intégré signifient que vous pouvez réellement dissiper les 15-20 watts consommés par ces modules sans cuire les ports adjacents. J'ai vu des cartes de ligne où les ports QSFP-DD d'angle fonctionnent systématiquement 8 degrés plus chauds que ceux du milieu, car la conception du flux d'air supposait des enveloppes de puissance de 100G.
Ni l’un ni l’autre n’a vraiment gagné. La plupart des hyperscalers ont opté pour QSFP-DD pour simplifier l'inventaire. La plupart des déploiements de télécommunications ont opté pour OSFP car leurs modules cohérents avaient besoin d'une marge thermique. Tous les autres ont choisi ce que leur fournisseur de commutateurs avait expédié et sont passés à autre chose.
La variante QSFP112 mérite d'être mentionnée car elle confond tout le monde. Quatre voies à 100 G chacune-même agrégat de 400 G, moins de voies, des SerDes plus récents. Cela est important pour la connectivité NIC lorsque vous souhaitez que le serveur-liaisons-TOR sans la complexité de la boîte de vitesses DSP. Cela importe moins que ce que prétendent les fournisseurs ailleurs.
PAM4 a tout changé (et cassé quelques choses)
Voici ce que personne n'explique correctement lorsqu'il vous vend du 400G : la signalisation PAM4 échange l'immunité au bruit contre l'efficacité de la bande passante, et ce compromis n'est pas gratuit.
Le codage NRZ utilisait deux niveaux de signal. Haut ou bas. Un ou zéro. Votre récepteur avait juste besoin de faire la distinction entre ces deux états, et le diagramme oculaire vous donnait des marges confortables. PAM4 utilise quatre niveaux -00, 01, 10, 11-, ce qui signifie que votre récepteur doit désormais faire la distinction entre trois franchissements de seuil avec un tiers de séparation de tension. La pénalité théorique de 9,54 dB SNR n’est pas du tout théorique. Il apparaît chaque jour dans vos compteurs pré-FEC BER.
Le DSP à l'intérieur d'un module 400G fait un travail héroïque pour compenser cela. L'égalisation de flux-, l'égalisation de retour de décision, l'horloge et la récupération de données- fonctionnent tous à 53,125 GBauds par voie. Quand ça marche, c'est invisible. Lorsque cela ne fonctionne pas, vous obtenez des rafales d'erreurs corrigibles ponctuées par des erreurs occasionnelles non corrigibles, et bonne chance pour déterminer si le problème vient de votre module, de votre fibre, de votre hôte ou du rayonnement de fond cosmique.

L'année dernière, j'ai passé deux semaines à rechercher une erreur intermittente sur une liaison DR4 qui s'est avérée être un bug du micrologiciel DSP qui ne se manifestait que lorsque la température ambiante dépassait 31 degrés. Le fournisseur a reconnu le problème trois mois après l'ouverture du dossier. La mise à jour du micrologiciel qui a corrigé le problème a également rompu l'interopérabilité avec l'une de nos anciennes plates-formes de commutation.
La situation du FEC aggrave ce problème. KP4 FEC-RS(544,514) pour les amateurs de standards-peut corriger jusqu'à 15 erreurs de symboles par mot de code, ce qui semble généreux jusqu'à ce que vous réalisiez à quelle fréquence vous en avez besoin. Exécuter 400G sans FEC n’est pas seulement déconseillé ; c'est impossible pour la plupart des cas d'utilisation. Le gain de codage vous rapporte environ 7 dB de marge, que PAM4 consomme rapidement.
Variantes de longueur d'onde : plus qu'une simple portée
Les spécifications de portée ne racontent qu’une partie de l’histoire.
Le 400G-SR8 utilise des VCSEL de 850 nm sur huit fibres parallèles, ciblant 100 mètres sur OM4. C'est bon marché. C'est multimode. Il nécessite un connecteur MPO-16 avec huit fibres TX et huit fibres RX. Dans un rack ou entre des racks adjacents, cela fonctionne très bien. Au moment où quelqu'un demande s'il faut l'exécuter « juste un peu plus loin », rappelez-lui que la dispersion modale à 850 nm ne négocie pas.
Le 400G-DR4 fonctionne à 1 310 nm sur quatre fibres monomodes parallèles-d'une longueur nominale de 500 mètres. Le connecteur MPO-12 utilise les huit fibres externes et en laisse quatre inutilisées-un fait qui déroute les installateurs de câbles environ une fois par déploiement. DR4 est devenu le cheval de bataille pour la connectivité des feuilles-épines dans les usines monomodes, car 500 mètres couvrent la plupart des géométries des centres de données avec de l'espace disponible.
400G-FR4 utilise des longueurs d'onde CWDM4 (1 271, 1 291, 1 311, 1 331 nm) multiplexées sur une seule paire de fibres via LC duplex. Deux kilomètres atteignent. C'est là que le 400G commence à sembler économique pour les interconnexions de campus, car vous ne tirez pas de lignes réseau MPO à huit -fibres entre les bâtiments.
400G-LR4 étend la même approche CWDM4 jusqu'à 10 kilomètres avec une puissance de lancement plus élevée et de meilleurs récepteurs. La hausse des prix du FR4 au LR4 surprend encore les directions achats qui n'ont pas mis à jour leur modèle mental de tarification 100G-LR4.
L'éléphant cohérent
Le 400G-ZR mérite sa propre section car il représente une technologie fondamentalement différente habillée dans le même facteur de forme.
Tout ce que j'ai décrit jusqu'à présent utilise une optique de détection directe-. La lumière entre, la photodiode la convertit, le DSP la nettoie. Une optique cohérente code les informations en amplitude et en phase sur deux polarisations simultanément, puis utilise un oscillateur local et un traitement numérique sophistiqué du signal pour tout récupérer au niveau du récepteur. Le résultat : 400 Gbit/s sur 120+ kilomètres de fibre non amplifiée dans un module enfichable.
La norme OIF 400ZR spécifie une modulation 16QAM à 60 GBaud avec double polarisation. Le FEC concaténé (décision douce-Hamming interne, décision dure-escalier extérieur) fournit environ 10,8 dB de gain de codage net. Le tout consomme 15-20 watts et génère une chaleur qui ferait pleurer un module QSFP-DD.
J'ai vu des modules ZR installés dans des commutateurs qui n'étaient pas conçus pour cette charge thermique. Le châssis du commutateur a signalé des températures normales car ses capteurs d'admission mesuraient l'air frais. Le module a signalé une température de 73 degrés car il était pris en sandwich entre deux autres modules ZR avec un débit d'air inadéquat. Le lien fonctionnait-à peine-avec des corrections FEC élevées que personne n'a remarquées jusqu'à ce que le BER pré-FEC dépasse le seuil et que les paquets commencent à chuter.
Les variantes ZR+ et MZR poussent la portée plus loin au détriment de l'interopérabilité. Les améliorations spécifiques au fournisseur concernant la puissance de lancement, la sensibilité du récepteur et les algorithmes FEC peuvent étendre les liaisons au-delà de 400 km, mais vous achetez une solution plutôt qu'un produit.

La-question des tiers
J'ai eu cette conversation environ six cents fois.
"Pouvons-nous utiliser des optiques 400G tierces- ?"
Techniquement oui. Les spécifications MSA existent précisément pour permettre l'interopérabilité multi-fournisseurs. Un QSFP-DD conforme du fabricant X doit se comporter de manière identique à celui du fabricant Y. Les normes IEEE définissent les paramètres optiques et électriques. CMIS (Common Management Interface Spécification) standardise la façon dont l'hôte communique avec le module.
En pratique, cela dépend.
Les mécanismes d'authentification de Cisco ont évolué de l'approche brutale « erreur -désactivation du port » des anciennes plates-formes à une vérification plus sophistiquée du fournisseur qui enregistre les avertissements mais ne désactive pas nécessairement les fonctionnalités. La commande d'émetteur-récepteur-non prise en charge par le service reste la trappe de secours. Arista a tendance à être plus permissif mais refusera de prendre en charge les problèmes pouvant provenir de modules tiers-. La position de Juniper varie selon la plate-forme et la version du logiciel, ce qui nécessite de consulter leurs matrices de compatibilité.
J'utilise des optiques tierces-dans des environnements de laboratoire sans hésitation. Pour les chemins de production transportant du trafic payant à 2 heures du matin en cas de panne ? Je veux pouvoir appeler le TAC et leur demander de m'aider réellement au lieu de me tourner immédiatement vers "remplacer par des émetteurs-récepteurs pris en charge".
Le calcul des coûts modifie ce calcul pour les hyperscalers qui achètent des modules par dizaines de milliers et emploient des ingénieurs en optique capables de caractériser et de qualifier les fournisseurs de manière indépendante. La situation est différente pour les entreprises qui achètent des centaines de modules via des canaux de distribution disposant de ressources techniques limitées.
Réalité thermique
Un module 400 G QSFP-DD consomme entre 10 et 15 watts selon la variante et le fournisseur. Un module ZR cohérent 400G consomme 15-20 watts. Un module QSFP 800 G -DD800-déjà déployé dans les clusters d'IA consomme entre 18 et 25 watts.
Mettez-en 64 dans un commutateur 2RU et vous obtenez 640 watts uniquement grâce à l'optique avant de prendre en compte l'ASIC du commutateur, la mémoire, les ventilateurs et les alimentations. Le problème de conception thermique est passé de « adéquat » à « critique » en une seule génération.
J'ai observé une caméra thermique balayer un-switch spine 400G entièrement chargé lors d'un test de qualification. Les modules les plus populaires n’étaient pas ceux auxquels on s’attendait. Les positions de coin, sous le vent de l'échappement ASIC, étaient plus chaudes que les modules centraux de la plaque frontale qui recevaient de l'air frais. Les relevés de température standard du DDM ont montré un écart de 17 degrés entre des ports censés être identiques.
Les spécifications du module promettent un fonctionnement de 0 degré à 70 degrés, mais les courbes de performances ne sont pas les mêmes à 70 degrés qu'à 25 degrés. Le courant de seuil du laser augmente. L'efficacité de la pente diminue. Dérives de longueur d'onde-et pour les systèmes CWDM4 et DWDM, la dérive de longueur d'onde signifie une diaphonie avec les canaux adjacents.
Les systèmes-refroidis par air approchent de leurs limites. Le refroidissement liquide des commutateurs reste exotique mais de plus en plus nécessaire pour les clusters AI/ML où GPU et optiques rivalisent pour le même budget thermique.

Tester les réalités
Les normes IEEE définissent les points de conformité. Ils ne garantissent pas que votre lien spécifique fonctionnera.
TDECQ (Transmitter and Dispersion Eye Closure Quaternary) est l'équivalent PAM4 de l'OMA (Optical Modulation Amplitude) mais plus compliqué. Il tente de caractériser la qualité de l'émetteur de manière à prédire les performances du récepteur. La mesure nécessite des récepteurs de référence et des transformations mathématiques qui varient selon les fournisseurs d'équipements de test, ce qui provoque des débats interminables au sein des comités de normalisation.
Les tests pré-FEC BER sont plus importants que jamais. L'"empreinte digitale" de vos erreurs binaires-aléatoires ou en rafales, uniformément distribuées ou concentrées dans des symboles PAM4 spécifiques-détermine si votre FEC peut réellement les corriger. Les vraies erreurs aléatoires fonctionnent bien avec les codes Reed-Solomon. Les erreurs en rafale dues à des problèmes de récupération d'horloge ou à un mauvais comportement du DSP peuvent submerger le FEC même lorsque le BER brut semble acceptable.
J'ai appris à exiger des statistiques pré-FEC pour chaque lien 400 G, et pas seulement après-FEC. Un lien affichant 0,00 post-FEC BER lors de l'exécution du pré-FEC BER à 2×10⁻⁴ a fière allure jusqu'à ce que vous réalisiez qu'il n'y a presque plus de marge. Ajoutez un connecteur légèrement sale ou un laser vieillissant, et ce lien basculera par-dessus la falaise FEC sans avertissement.
Contamination du connecteur
A 400G, le problème de contamination devient aigu. L'œil modulé a moins de marge. Les particules qui auraient été invisibles à des vitesses inférieures s’atténuent désormais suffisamment pour avoir de l’importance.
Les cœurs de fibre monomode-ont un diamètre de 9 micromètres. Un connecteur MTP/MPO-12 transporte huit chemins de fibre actifs (quatre TX, quatre RX) plus quatre inutilisés. Chaque cycle d’accouplement risque d’être contaminé. Chaque extrémité contaminée risque une perte d’insertion qui ronge votre budget de liaison.
La discipline de nettoyage requise n'est pas-négociable mais est rarement suivie de manière cohérente. Nettoyants en un -clic, lingettes sèches présentant des problèmes d'électricité statique, nettoyage humide avec de l'alcool isopropylique qui doit être essuyé immédiatement plutôt que de s'évaporer-chaque méthode a des adeptes et des critiques. Ce sur quoi tout le monde est d'accord : inspectez avec un fibroscope avant de vous connecter, et s'il est sale, nettoyez-le et inspectez à nouveau.
J'ai vu une équipe de déploiement passer un après-midi entier à dépanner une liaison 400G-DR4 intermittente. Échanges de modules multiples. Revues de configuration. Finalement, j'ai sorti le champ d'inspection et j'ai trouvé des débris de construction sur l'adaptateur de cloison que personne n'avait pensé à vérifier. Vingt secondes d'utilisation d'un outil de nettoyage ont permis de résoudre ce que quatre heures de dépannage n'ont pas pu résoudre.

Ce que tout cela signifie pour la planification
Si vous déployez aujourd'hui une nouvelle structure de centre de données, 400 G constitue la référence pour la couche dorsale et, de plus en plus, pour les liaisons montantes-feuilles. Le coût par bit a chuté à tel point que la dérivation 4 × 100G à partir d'un module 400G est souvent moins chère que les modules 100G individuels. DR4 pour tout ce qui dépasse 30 mètres à l'intérieur d'un bâtiment. FR4 pour les interconnexions des campus. LR4 ou ZR si vous accédez entre des sites.
Si vous êtes une entreprise envisageant votre premier déploiement 400G, les plates-formes de commutation ont mûri, la chaîne d'approvisionnement des modules s'est stabilisée et la tarification ne nécessite plus l'approbation de la direction sur chaque bon de commande. Commencez par une actualisation-de la colonne vertébrale, prouvez que votre infrastructure de câblage peut gérer une tolérance de contamination plus stricte et comprenez que vos outils de gestion doivent commencer à collecter des statistiques FEC avant que vous en ayez réellement besoin.
Si vous êtes un hyperscaler et que vous lisez ceci, vous avez déjà dépassé les 400 G pour les clusters GPU et vous vous demandez comment le 1,6 T sera réellement déployé. Bonne chance avec les problèmes thermiques ; Je lirai vos articles dans deux ans.
Les modules eux-mêmes sont devenus remarquablement fiables. Les problèmes existent partout ailleurs : connecteurs contaminés, modes FEC mal configurés, conceptions thermiques qui assumaient les enveloppes de puissance d'hier et organisations d'assistance qui apprennent encore à résoudre les problèmes d'intégrité du signal PAM4. Les principes fondamentaux peu glamour-nettoyer vos connecteurs, mesurer vos températures, comprendre votre budget FEC- comptent plus que les débats sur les fiches techniques.


