NVIDIA rachète Groq pour 20 Md$ : la fin du GPU roi de l’inférence

— Agentia Academy

NVIDIA rachète Groq pour 20 Md$ : la fin du GPU roi de l’inférence

Le 2 juillet 2026, NVIDIA a signé le plus gros deal de son histoire pour absorber une architecture qu’il ne pouvait pas produire lui-même. La semaine boucle un signal clair : l’infrastructure IA se fragmente, l’État entre au capital des frontier labs, et l’open source recolle sur les benchmarks qui comptent.

.news-article { max-width: 760px; margin: 0 auto; line-height: 1.65; color: #1c1c1c; font-family: "Urbanist", -apple-system, BlinkMacSystemFont, "Segoe UI", "Helvetica Neue", Arial, sans-serif; -webkit-font-smoothing: antialiased; -moz-osx-font-smoothing: grayscale; } .news-article h1, .news-article h2, .news-article h3 { font-family: "Urbanist", -apple-system, BlinkMacSystemFont, "Segoe UI", "Helvetica Neue", Arial, sans-serif; font-weight: 700; color: #1a1a1a; } .news-article h1 { font-size: 2.1rem; line-height: 1.2; margin: 0 0 1.2rem; letter-spacing: -0.01em; } .news-article h2 { font-size: 1.45rem; margin: 2.4rem 0 0.8rem; letter-spacing: -0.005em; } .news-article p { margin: 0 0 1rem; } .news-article .aa-lede { font-size: 1.18rem; color: #2a2a2a; font-style: italic; margin-bottom: 1.8rem; } .news-article .aa-tldr { background: #faf6ef; border-left: 4px solid #6b4a1f; padding: 1.1rem 1.3rem; margin: 1.5rem 0 2rem; border-radius: 4px; } .news-article .aa-tldr ul { margin: 0.6rem 0 0; padding-left: 1.2rem; } .news-article .aa-tldr li { margin-bottom: 0.35rem; } /* Widget Deals */ .news-article .aa-deals-widget { margin: 2rem 0; border: 1px solid #e6dccb; border-radius: 8px; overflow: hidden; background: #fffdf8; } .news-article .aa-deals-filters { display: flex; flex-wrap: wrap; gap: 0.5rem; padding: 1rem; background: #f6efe2; border-bottom: 1px solid #e6dccb; } .news-article .aa-deals-filter { background: #fff; color: #4a3520; border: 1px solid #d4c6ad; padding: 0.45rem 0.95rem; border-radius: 999px; font-size: 0.88rem; font-weight: 500; cursor: pointer; transition: all 0.15s ease; font-family: inherit; } .news-article .aa-deals-filter:hover { background: #f3e9d3; border-color: #b69968; } .news-article .aa-deals-filter--active { background: #6b4a1f; color: #fff; border-color: #6b4a1f; } .news-article .aa-deals-widget table { width: 100%; border-collapse: collapse; font-size: 0.92rem; } .news-article .aa-deals-widget thead { background: #f6efe2; } .news-article .aa-deals-widget th { text-align: left; padding: 0.75rem 1rem; font-weight: 600; color: #4a3520; border-bottom: 1px solid #e6dccb; } .news-article .aa-deals-widget td { padding: 0.75rem 1rem; border-bottom: 1px solid #f0e8d6; vertical-align: top; } .news-article .aa-deals-widget tbody tr:last-child td { border-bottom: 0; } .news-article .aa-deals-widget tbody tr:hover { background: #faf6ef; } /* Badges */ .news-article .aa-badge { display: inline-block; padding: 0.18rem 0.55rem; border-radius: 4px; font-size: 0.78rem; font-weight: 600; line-height: 1.4; margin-right: 0.35rem; vertical-align: middle; } .news-article .aa-badge--funding { background: #fde8d2; color: #8a4b14; } .news-article .aa-badge--acquisition { background: #f4dcdc; color: #8a2a2a; } .news-article .aa-badge--partnership { background: #dde9f4; color: #1f4a7a; } .news-article .aa-badge--product { background: #e1ecd9; color: #2f5a1f; } .news-article .aa-badge--success { background: #d9eada; color: #1f5a2f; } .news-article .aa-badge--warning { background: #fbeccb; color: #7a5a14; } /* Quiz */ .news-article .aa-quiz { margin: 1.4rem 0; padding: 1.2rem 1.4rem; background: #fffdf8; border: 1px solid #e6dccb; border-left: 4px solid #b69968; border-radius: 6px; } .news-article .aa-quiz-question { font-weight: 600; margin: 0 0 0.9rem; color: #2a2a2a; } .news-article .aa-quiz-choice { display: block; width: 100%; text-align: left; background: #fff; color: #2a2a2a; border: 1px solid #d4c6ad; padding: 0.7rem 1rem; margin-bottom: 0.5rem; border-radius: 6px; font-size: 0.95rem; cursor: pointer; transition: all 0.15s ease; font-family: inherit; } .news-article .aa-quiz-choice:hover { background: #f6efe2; border-color: #b69968; } .news-article .aa-quiz-feedback { margin-top: 0.6rem; font-size: 0.9rem; color: #6b4a1f; font-style: italic; min-height: 1px; } /* Callouts */ .news-article [class^="aa-callout-"] { padding: 1rem 1.2rem; margin: 1.5rem 0; border-radius: 6px; border-left: 4px solid; } .news-article .aa-callout-info { background: #eaf2fb; border-color: #2a6bbf; color: #1c3a66; } .news-article .aa-callout-tip { background: #fdf3e0; border-color: #c97a1a; color: #6b3a0a; } .news-article .aa-callout-warning { background: #fbeccb; border-color: #b88012; color: #6b4a0a; } .news-article .aa-callout-success { background: #e1f0e3; border-color: #2f7a3a; color: #1c4a25; } /* Embed placeholder */ .news-article .aa-embed { margin: 1.5rem 0; padding: 1rem; background: #f6efe2; border: 1px dashed #b69968; border-radius: 6px; text-align: center; font-size: 0.85rem; color: #6b4a1f; } .news-article .aa-embed::before { content: "Embed video"; font-weight: 600; }

NVIDIA rachète Groq pour 20 Md
#160;: la fin du GPU roi de l’inférence

Le 2 juillet 2026, NVIDIA a signé le plus gros deal de son histoire pour absorber une architecture qu’il ne pouvait pas produire lui-même. La semaine boucle un signal clair : l’infrastructure IA se fragmente, l’État entre au capital des frontier labs, et l’open source recolle sur les benchmarks qui comptent.

Le résumé en 30 secondes
  • NVIDIA absorbe les actifs et l’IP de Groq pour 20 Md
    #160;: un tournant stratégique pour l’inférence temps réel.
  • Anthropic redéploie Claude Fable 5 mondialement après trois semaines de suspension par le gouvernement US.
  • Sam Altman propose 5% du capital d’OpenAI (42,6 Md$) au gouvernement fédéral américain.
  • Google DeepMind reprend la tête des benchmarks science avec Gemini 2.5 Pro Deep Think (82,4% GPQA Diamond).
  • Meta licencie 8 000 personnes, en réaffecte 7 000 vers ses équipes IA.
DateActeurOpérationMontant / Détail
2 juillet 2026NVIDIA + GroqRachat actifs, IP, équipes seniors20 Md$ cash
1er juillet 2026AnthropicRedéploiement Claude Fable 5 mondialQuota 50% jusqu’au 7 juillet
Juin 2026OpenAI + CerebrasAchat compute inférence20 Md$ sur 5 ans
Juillet 2026Together AISérie C800 M$ – valo 8,3 Md$
Juillet 2026BasetenSérie F1,5 Md$ – valo 13 Md$
Juillet 2026Shield AISérie G (package 2,25 Md$)1,5 Md$ – valo 12,7 Md$
Juillet 2026Quantum SystemsSérie D (defense tech)1,2 Md$
Juin 2026Cognition + WindsurfRebranding en Devin DesktopMontant non communiqué
Juin 2026MiniMax / Moonshot / Z.aiReleases M3, K2.7 Code, GLM-5.2Open-weight, licences permissives

La semaine où NVIDIA a admis ses limites

Le 2 juillet 2026, NVIDIA a annoncé le plus gros deal de son histoire : 20 Md$ cash pour absorber les actifs, la propriété intellectuelle et les équipes seniors de Groq. Jonathan Ross, fondateur, et Sunny Madra, président, rejoignent NVIDIA ; Simon Edwards, CFO historique, prend la tête d’un Groq juridiquement indépendant mais lié par un accord de licence non-exclusif.

La lecture officielle : NVIDIA sécurise sa dominance sur l’inférence en temps réel. La lecture moins commode : le GPU généraliste plafonne pour l’inférence single-token à faible latence, marché estimé à deux tiers du compute IA dépensé en 2026. Le LPU (Language Processing Unit) de Groq, avec sa SRAM on-chip et son ordonnancement statique, apporte une architecture que NVIDIA ne peut pas produire en interne à horizon 18 mois sans casser sa roadmap Blackwell.

Le prix est révélateur. 20 Md$, c’est exactement le montant qu’OpenAI a signé en avril avec Cerebras pour de l’achat compute, et exactement la valorisation que le marché commence à attribuer aux acteurs spécialisés sur l’inférence. Deux ans après le pic « tout NVIDIA », l’infrastructure IA se fragmente en deux couches distinctes : entraînement et inférence batch d’un côté, inférence temps réel de l’autre.

Claude Fable 5 revient : quand l’État régule le déploiement d’un modèle

Le 1er juillet, Anthropic a redéployé Claude Fable 5 sur l’ensemble de ses surfaces — Claude.ai, Claude Platform, Claude Code, Claude Cowork — après trois semaines de suspension imposée par le gouvernement américain. La cause : une technique de contournement identifiée dans le domaine cybersécurité qui exposait le modèle à des usages sensibles. Le nouveau classifieur bloque plus de 99% de cette technique en test.

Les requêtes flaggées cybersécurité ou biologie sont désormais routées automatiquement vers Claude Opus 4.8, positionné comme modèle plus contenu. Le précédent est structurant : c’est la première fois qu’un frontier lab occidental voit un modèle en production suspendu par un régulateur pour raison de sécurité opérationnelle plutôt que de licence export au sens strict.

Anthropic gère la transition avec un quota temporaire : Fable 5 est inclus pour 50% des limites hebdomadaires jusqu’au 7 juillet 2026, puis bascule en usage credits. Ce que ça change concrètement pour les équipes produit qui construisent sur Fable 5 : anticiper une gouvernance en temps réel du modèle, avec des passages Opus 4.8 non-négociables sur certains prompts. La stabilité API n’est plus garantie par la seule roadmap du lab — le régulateur devient un input direct.

OpenAI propose 5% de son capital à Washington

Sam Altman aurait pitché à Donald Trump, Howard Lutnick et Scott Bessent une structure inédite : l’attribution d’environ 5% du capital d’OpenAI au gouvernement fédéral américain, valorisé à 42,6 Md$ au dernier tour privé connu. L’objectif affiché est double : partager les gains économiques de la transition IA avec le contribuable, et réduire les frictions réglementaires sur la fiscalité, l’export contrôlé et l’accès aux marchés publics.

La proposition n’est pas encore formalisée mais fait bouger le marché. Elle établit une valorisation implicite de 852 Md$ pour OpenAI, cohérente avec la trajectoire du dernier tour de table. Côté gouvernance, elle pose une question inédite : quel siège au board pour un investisseur souverain domestique dans un frontier lab, et quels droits de veto sur les déploiements internationaux ?

Le contexte pousse dans cette direction. OpenAI et Anthropic ont concentré à eux seuls 217 Md$ sur les 510 Md$ investis dans la tech mondiale au premier semestre 2026, soit 43% du volume global. Une telle concentration rend la question de la redistribution politiquement inflammable. Le pitch d’Altman anticipe le débat plutôt qu’il ne le subit — et pourrait devenir un modèle imité par d’autres frontier labs, y compris en Europe si Bruxelles s’en empare.

Gemini 2.5 Pro Deep Think reprend la tête des benchmarks science

Google DeepMind a activé le mode Deep Think par défaut sur Gemini 2.5 Pro le 30 juin 2026. Le modèle affiche 82,4% sur GPQA Diamond et 89,8% sur MMLU-Pro, dépassant sur ces deux benchmarks GPT-5.5 d’OpenAI et Claude Fable 5 d’Anthropic. Sur les tâches de raisonnement scientifique multi-étapes, Google reprend un écart mesurable pour la première fois depuis février 2026.

La différenciation stratégique est claire. Deep Think n’est pas un modèle isolé, c’est un mode automatiquement invoqué par Gemini App et Workspace pour les workflows lourds — analyse de littérature scientifique, résolution mathématique symbolique, revue de code cross-repo. Le coût compute est absorbé par l’écosystème Google Cloud, avec un pricing agressif sur Gemini for Business.

La question opérationnelle pour les équipes tech : Gemini 2.5 Pro Deep Think redevient un candidat sérieux dans le comparatif frontier, aux côtés de Claude Opus 4.8 et GPT-5.5. Les benchmarks ne suffisent pas à trancher — la latence, la disponibilité effective de la fenêtre contextuelle en usage réel, et l’intégration outillage restent les critères qui font la différence en production. Google a rattrapé sur l’axe science pure. Il reste à voir si l’usage suit sur l’axe agentique, où Claude Code et OpenAI Codex gardent une avance mesurable.

Meta licencie 8 000 personnes et en réaffecte 7 000 à l’IA

Meta a annoncé début juillet 2026 la suppression d’environ 8 000 postes, soit près de 10% de ses effectifs, dans le cadre d’une restructuration centrée IA. En parallèle, environ 7 000 employés sont réaffectés vers des équipes travaillant sur Llama, la modélisation multimodale et la publicité agentique. Le bilan net est proche de zéro en tête de compte, mais la géographie des compétences change radicalement.

La grille de lecture. Depuis mars 2026, Mark Zuckerberg a recruté ou courtisé une dizaine de chercheurs seniors venus d’OpenAI, Google DeepMind et Anthropic, avec des packages annuels documentsés au-delà de 100 M$ pour les profils les plus rares. Ces recrutements sont compensés par des sorties massives sur les couches applicatives héritées, notamment Reality Labs et certaines équipes ads non-agentiques.

Le signal envoyé au marché de l’emploi tech est net. Sur les 24 prochains mois, deux dynamiques opposent : des postes qui vont disparaître ou fondre — ingénierie produit non-agentique, middle management sans exposition modèle, analytics classique. Et des postes qui vont exploser — recherche modèle, MLOps agentique, red teaming, product engineering avec compétence prompting profonde. Meta n’est pas un cas isolé : Alphabet a annoncé un plan comparable en avril, Microsoft laisse fuiter des chiffres proches pour l’automne 2026.

Open source : MiniMax, Kimi et GLM compressent l’écart

L’écosystème open-weight a produit trois releases majeures entre le 1er et le 15 juin 2026. MiniMax M3, premier open-weight combinant coding frontier, contexte de 1 million de tokens et multimodalité native, prend la tête du classement SWE-Bench Pro open-weight à 59,0%. Kimi K2.7 Code de Moonshot AI et GLM-5.2 de Z.ai suivent la semaine du 12 juin avec des benchmarks quasi-équivalents et des licences permissives type MIT ou Apache 2.0.

La compression avec les modèles propriétaires est désormais mesurable. L’écart sur les benchmarks quotidiens — SWE-Bench Verified, GPQA Diamond, MMLU-Pro — est passé sous les 5 points de pourcentage pour la première fois. Le coût d’inférence des open-weight est 4 à 10 fois inférieur à celui des frontier propriétaires équivalents, une fois hébergés sur vLLM ou Together AI.

Pour un CTO qui construit aujourd’hui, l’équation change. Un stack Ollama sur Apple Silicon avec backend MLX, un LM Studio devenu gratuit commercial depuis juillet 2025, et un MiniMax M3 en local sur workstation permettent de traiter du code review et de la génération documentaire sans payer d’API. Pour la production multi-utilisateur, vLLM plus MiniMax M3 sur GPU H200 offre un ratio prix-performance qui met sous pression les tarifs Anthropic et OpenAI sur les tâches de complexité moyenne. La question n’est plus « les open-weight sont-ils utilisables ? » mais « où plaçons-nous la frontière propriétaire vs open ? ».

Testez votre lecture de la semaine

Combien NVIDIA a-t-il payé pour racheter les actifs clés de Groq ?

Quel modèle Anthropic a été redéployé mondialement le 1er juillet 2026 après suspension par le gouvernement US ?

Quelle part du capital d’OpenAI serait proposée au gouvernement fédéral américain selon la proposition d’Altman ?

Quel score Gemini 2.5 Pro Deep Think obtient-il sur GPQA Diamond ?

Quel modèle open-weight prend la tête du SWE-Bench Pro à 59,0% en juin 2026 ?

À retenir pour la semaine prochaine : surveillez le 7 juillet la bascule Fable 5 en usage credits chez Anthropic, la réaction des concurrents inférence après le deal NVIDIA-Groq (attendez-vous à un mouvement chez SambaNova ou Tenstorrent), et les benchmarks agentiques post-Deep Think chez Google.

← Toutes les actualités IA · Nos formations IA