Charles Tech
Actualité

NVIDIA Nemotron 3.5 Lightning : 4 fois plus rapide pour les agents IA locaux

Charles Gouin-Peyrot

· · 3 min de lecture

NVIDIA Nemotron 3.5 Lightning : 4 fois plus rapide pour les agents IA locaux

NVIDIA complète sa gamme Nemotron 3 avec un nouveau modèle à poids ouverts : Nemotron 3.5 Lightning. Construit sur une architecture Mixture-of-Experts (MoE) à 30 milliards de paramètres, il cible les agents IA destinés à fonctionner en continu, directement sur le matériel de l'utilisateur.

Ce positionnement local et personnalisable répond à une demande croissante des développeurs et des entreprises qui cherchent à maîtriser leurs coûts d'inférence sans dépendre exclusivement du cloud.

Des performances supérieures dans sa catégorie

Selon les données de NVIDIA, Nemotron 3.5 Lightning génère des tokens jusqu'à quatre fois plus rapidement que les modèles ouverts comparables. Le temps d'exécution global est réduit de 30 % par rapport à ses concurrents de même gabarit.

Le modèle est disponible dans deux formats principaux : NVFP4 et GGUF. Il peut s'exécuter sur les PC équipés de GPU NVIDIA RTX, sur les systèmes NVIDIA DGX Spark, sur les configurations OEM GB10 et sur les cartes NVIDIA Jetson. Pour des besoins plus intensifs, il monte en charge vers les stations de travail RTX PRO, les systèmes DGX Station et GB300, ainsi que vers les data centers et environnements cloud.

Des partenaires comme Acer, ASUS, Dell Technologies, HP, Lenovo et MSI proposent des systèmes NVIDIA Blackwell compatibles avec ce déploiement.

Un modèle ouvert conçu pour être affiné

Les poids ouverts de Nemotron 3.5 Lightning permettent aux développeurs d'entraîner le modèle sur leurs propres données. L'objectif est de l'adapter à des tâches précises : adopter un style rédactionnel particulier, acquérir une terminologie sectorielle ou respecter des conventions de code spécifiques.

Des assistants personnalisés peuvent ainsi être construits autour de ces modèles affinés, qu'il s'agisse d'un agent de gestion d'e-mails et de calendrier, d'un assistant pour la maison connectée ou d'un outil de développement travaillant sur une base de code locale.

NVIDIA a collaboré avec vLLM, Ollama, llama.cpp et LM Studio pour garantir une intégration fluide. Unsloth propose également une prise en charge dès le lancement, avec des versions optimisées et quantifiées accessibles via Unsloth Studio.

NeMo Switchyard pour réduire les coûts d'inférence en entreprise

En parallèle du modèle, NVIDIA publie NeMo Switchyard, une bibliothèque de routage open source disponible sur GitHub. Son rôle est d'orienter chaque étape d'un workflow agent vers le modèle le plus adapté selon trois critères : précision, rapidité et coût.

Les benchmarks internes de NVIDIA indiquent que ce système de routage permet de conserver un niveau de résultat proche des modèles les plus avancés, tout en ramenant le coût d'exécution à environ un tiers de celui d'Opus 4.8 utilisé seul. Cette approche s'adresse aux entreprises qui souhaitent limiter leurs dépenses en tokens sans dégrader la qualité de leurs agents IA.

Disponibilité

Nemotron 3.5 Lightning est accessible via plusieurs canaux : la plateforme OpenRouter, le portail build.nvidia.com sous forme de microservice NVIDIA NIM, et un réseau de partenaires cloud incluant des plateformes de post-entraînement et d'inférence.

Ce lancement illustre la volonté de NVIDIA de proposer des modèles performants hors des infrastructures cloud traditionnelles, en misant sur la personnalisation locale et le contrôle des coûts comme arguments centraux face à la concurrence.

L'auteur

Charles Gouin-Peyrot

Journaliste tech et testeur indépendant, je décrypte la tech grand public. Spécialisé dans le hardware, l'audio et la maison connectée, je mets ma rigueur technique et mon expérience de formateur au service de mes tests. Mon objectif est simple : dépasser les fiches techniques pour vous livrer des analyses transparentes, impartiales et ancrées dans un usage 100 % réel.

Voir tous ses articles