OpenAI à 730 Md$, Sonnet 5 à 2 dollars, NVIDIA verrouille l’inférence : le paysage IA se recompose en sept jours
Le début juillet 2026 concentre une série de décisions qui vont peser toute l’année : un tour de table qui redessine la carte du capital, un mid-tier agentique qui casse les prix, un accord de licence qui verrouille l’inférence, et une deadline réglementaire européenne qui se rapproche pour de bon.
- Anthropic a lancé Claude Sonnet 5 le 30 juin 2026, prix d’introduction 2 $/M input et 10 $/M output jusqu’au 31 août.
- OpenAI a bouclé un tour de 110 Md$ à une valorisation de 730 Md$, dans un marché déjà extrêmement concentré.
- NVIDIA a formalisé l’intégration Groq (deal 20 Md$) et présente le rack Groq 3 LPX combiné à Vera Rubin NVL72.
- Les modèles open-weight chinois (Qwen 3, DeepSeek R1, Kimi K2.7, GLM-5.2, MiniMax M3) tiennent le rythme des laboratoires propriétaires.
- Le règlement européen AI Act entre en pleine application le 2 août 2026 sur la transparence et les pouvoirs de sanction GPAI.
Sonnet 5 casse les prix du mid-tier agentique
Le 30 juin 2026, Anthropic a sorti Claude Sonnet 5, un modèle mid-tier dont l’objectif assumé est de descendre au plus près des performances de Opus 4.8 tout en restant sur un ticket de facturation d’usage massif. Prix d’introduction jusqu’au 31 août 2026 : 2 $ le million de tokens en input, 10 $ en output. Après le 1er septembre, la grille rebascule sur 3 $ / 15 $, ce qui reste compétitif dans le segment agentique long-horizon.
Le point souvent tu dans les communiqués : le nouveau tokenizer utilisé par Sonnet 5 produit environ 30% de tokens en plus pour un même texte que la génération précédente. Sur des workloads réels, la facture "cost-neutral" annoncée ne l’est donc pas vraiment. Pour un opérateur qui déplace son trafic depuis Sonnet 4.6, l’économie réelle dépend du ratio input/output et du type de contenu (le code et les langues non anglaises encaissent plus de surcoût token).
Angle stratégique : Sonnet 5 est aussi le modèle par défaut des plans gratuits et Pro, ce qui verrouille le funnel utilisateur grand public au moment où Google déploie Gemini 2.5 Pro avec Deep Think et où Grok Voice Agent Builder entre en beta. La bataille du mid-tier se joue autant sur le tarif API que sur la retention consumer.
OpenAI vaut désormais 730 milliards : nouvelle physique du capital
Début juillet 2026, OpenAI a finalisé un tour primaire de 110 Md$ à une valorisation post-money de 730 Md$. Le chiffre le place au niveau des plus grosses capitalisations tech mondiales, sans passer par une cotation publique. Pour donner l’échelle : Ford et General Motors cumulés pesaient environ 180 Md$ à la même date. En parallèle, plusieurs sources rapportent qu’OpenAI aurait discuté d’un ticket equity vers l’État américain, dans la continuité du rapprochement Washington-industrie observé sur les puces.
Le marché du capital-risque IA en 2026 a déjà absorbé 510 Md$ d’investissements primaires au premier semestre (données Crunchbase), avec une extrême concentration sur une poignée de labs et d’infrastructures. Cette semaine a vu Together AI ajouter 800 M$ (valo 8,3 Md$), 8090 Solutions 135 M$ mené par Salesforce, Twelve Labs 100 M$, LeapXpert 180 M$. La grille est claire : modèles frontier + neoclouds d’inférence + agents verticaux monopolisent l’attention.
La conséquence pratique pour un fondateur non-frontier : si votre pitch ne parle pas de "category ownership" ou de revenu entreprise rapide, le ticket devient dur à décrocher. Le marché est ouvert, mais trié.
NVIDIA + Groq : 35× le débit par mégawatt et une mainmise sur l’inférence
L’accord de licence technologique NVIDIA-Groq, signé en décembre 2025 pour un montant global cité à 20 Md$, se traduit désormais en produits. NVIDIA a présenté lors du GTC le rack Groq 3 LPX, un serveur emporté par 128 LPU (Language Processing Units) Groq 3. Couplé au rack Vera Rubin NVL72, NVIDIA annonce 35× de throughput par mégawatt et jusqu’à 10× d’opportunité de revenu vs la génération Blackwell. Le fondateur de Groq Jonathan Ross et son président Sunny Madra ont été embauchés dans le cadre de l’opération.
Côté AMD, le contrat pluri-annuel avec Meta annoncé en février 2026 prévoit jusqu’à 6 gigawatts d’accélérateurs Instinct. C’est l’un des plus gros deals non-NVIDIA de l’histoire des hyperscalers et c’est le seul contre-poids échelle qui reste vraiment crédible face à NVIDIA. Meta prépare aussi la mise en location de sa propre capacité de compute IA, une trajectoire qui rapproche l’hyperscaler du métier de neocloud.
Traduit en langage cloud : la fenêtre 2026-2027 sera celle où le prix marginal de l’inférence peut baisser de plusieurs ordres de grandeur, si les gains hardware annoncés se vérifient en production réelle et non seulement sur benchmarks vendor.
Open-weight chinois : Qwen, DeepSeek, Kimi et GLM tiennent le rythme
Le classement open-source au 1er juillet 2026 met Qwen 3 235B-A22B en première position sur le raisonnement et le code, DeepSeek R1 second sur le math avancé, Llama 4 Scout troisième sur le long contexte. Depuis avril, plusieurs modèles frontier open-weight ont ship : DeepSeek V4 Pro (24 avril, licence MIT, contexte 1M, SWE-bench Verified 80,6%), Kimi K2.6 (20 avril, MIT, SWE-bench Pro 58,6%), Qwen 3.7 Max (20 mai, GPQA Diamond 92,4), Mistral Large 3 (Apache 2.0, sans cap MAU).
MiniMax M3 (1er juin) reste le premier open-weight à combiner performance code frontier, contexte 1M et multimodalité native, avec 59% annoncé sur SWE-Bench Pro. Kimi K2.7 Code et GLM-5.2 (Z.ai) ont ship la semaine du 12-13 juin. Le message : la Chine dicte le tempo open-weight, Mistral tient le pavillon européen avec une nouvelle release annoncée pour l’été, les US restent surtout présents côté propriétaire.
Côté outillage, GitHub Copilot CLI a intégré Kimi K2.7 Code le 1er juillet dans la version v1.0.68. C’est la première fois qu’un modèle chinois de premier plan atterrit officiellement dans l’outillage Microsoft, un signal géopolitique qui compte plus que la mise à jour technique.
AI Act : 2 août 2026, la deadline réelle
Le 2 août 2026 reste la date à laquelle la Commission européenne acquiert son pouvoir de sanction sur les fournisseurs de GPAI, celle où les obligations de transparence de l’Article 50 s’activent sur la plupart des systèmes IA, et celle où les autorités nationales de surveillance peuvent enquêter et sanctionner. L’accord politique du 7 mai (l’AI Act Omnibus) a reporté les obligations Annex III pour les systèmes autonomes à haut risque de 16 mois, jusqu’à décembre 2027. Pas la transparence.
La publication officielle de l’Omnibus au Journal officiel de l’Union européenne est attendue en juillet, avant la deadline. En parallèle, le régime simplifié PME est étendu aux entreprises jusqu’à 750 salariés et 150 M€ de chiffre d’affaires, avec sandbox réglementaire et documentation standardisée.
Pour les fondateurs européens qui déploient un modèle fondation ou un produit orienté consommateur, le calendrier tient en une phrase : quatre semaines pour finaliser la documentation de transparence, la politique d’usage et l’évaluation de risque. Pas huit, pas seize.
Outils dev et agents : Cursor durcit, Grok lance le voice, Perplexity lève
Cursor Teams a généralisé le 1er juillet son tier Premium à 120 $ par siège et par mois, avec 5× d’usage et 3× le coût d’un siège Standard. Les sièges Standard voient désormais leur usage splité en deux pools : Composer / Auto (modèles Cursor first-party comme Composer 2.5) et Third-Party API (Claude, GPT, Gemini). Signal : l’IDE agentique ne peut plus absorber les runs 24/7 sur un flat fee.
xAI a annoncé le 5 juillet la fin du développement de Grok Imagine (image et vidéo) et lancé en beta Voice Agent Builder, un no-code pour déployer des agents vocaux en production. Grok Build ajoute un mode autonome long-horizon déclenchable via une commande /goal. Perplexity a levé 200 M$ en juin à une valorisation proche de 20 Md$ pour Comet, son navigateur agentique : la stratégie assumée est de capter le point d’entrée où un utilisateur démarre une tâche et où l’agent finit la transaction.
La photo de la semaine est nette : la couche modèle se banalise, la couche interaction (IDE, navigateur, voix) devient le nouveau front. Ceux qui contrôlent le contexte d’usage capturent la valeur, pas ceux qui optimisent d’un point le benchmark.
Testez votre lecture de la semaine
À quel prix Anthropic a lancé Claude Sonnet 5 en tarif d’introduction jusqu’au 31 août 2026 ?
Quelle est la valorisation post-money du tour de table OpenAI bouclé début juillet 2026 ?
Que promet le rack NVIDIA Groq 3 LPX couplé à Vera Rubin NVL72, en throughput par mégawatt ?
Quel modèle chinois open-weight a été intégré dans GitHub Copilot CLI v1.0.68 le 1er juillet 2026 ?
Quelle est la deadline réelle d’activation des obligations de transparence GPAI dans l’AI Act européen ?