Grok 4.5 débarque et joue « Opus-class » à moitié prix : la semaine où quatre labos ont rebattu la carte
En dix jours, SpaceXAI, Anthropic, OpenAI et Mistral ont chacun sorti un modèle majeur ou réorganisé leur offre. Le marché frontier n’a jamais eu autant d’acteurs crédibles simultanément, et la variable qui bouge le plus n’est plus la qualité brute : c’est le prix par million de tokens.
- SpaceXAI (ex-xAI) a publié Grok 4.5 le 8 juillet 2026 : 1,5 T de paramètres, 500 K de contexte, ~80 tokens/s, tarifé 2 $ / 6 $ par million de tokens.
- Anthropic Sonnet 5 (fin juin) se positionne à 2 $ / 10 $ jusqu’au 31 août, avec des perfs proches d’Opus 4.8.
- OpenAI a dévoilé GPT-Live (voix full-duplex) et envisagerait de décaler son IPO à 2027, malgré une valorisation privée de 852 Md$ en mars.
- Côté open source, Mistral Leanstral 1.5 mise sur la preuve formelle Lean 4, Kimi K2.7 Code gagne 21,8 % sur son bench interne.
- La spec MCP 2026-07-28 est en release candidate et redessine le protocole des agents.
Grok 4.5 : SpaceXAI joue la carte prix × vitesse
Le 8 juillet 2026, SpaceXAI — nouveau nom de xAI depuis le rachat par SpaceX en février — a publié Grok 4.5, un modèle que Elon Musk décrit publiquement comme « Opus-class, mais plus rapide, plus économe en tokens et moins cher ». Les chiffres : 1,5 T de paramètres sur une architecture V9, une fenêtre de contexte de 500 000 tokens, un débit de ~80 tokens par seconde à l’inférence, et un tarif de 2 $ / 6 $ par million de tokens (input / output). Produit Pas d’UE au lancement
Le modèle est arrivé simultanément sur Grok Build, l’API SpaceXAI et l’éditeur Cursor — qui a fourni des données d’entraînement en échange de l’accès privé. Musk a lui-même nuancé le « Opus-class » en précisant que le modèle est « roughly comparable to Opus 4.7, but much faster ». Traduction : pas de saut qualitatif face à la génération précédente d’Anthropic, mais un rapport prix / débit très agressif. L’absence de disponibilité dans l’Union Européenne au jour du lancement (cible interne : mi-juillet) rappelle que la fragmentation réglementaire est devenue un paramètre de go-to-market à part entière. Pour les développeurs qui optimisent des agents laténce-critiques, 80 tokens/s à 6 $ le million d’output tokens change les calculs de rentabilité.
Anthropic densifie le milieu de gamme avec Sonnet 5
Sorti le 30 juin, Sonnet 5 (nom de code Fennec) atteint des performances proches d’Opus 4.8 sur les principaux benchmarks agentiques, avec un tarif promotionnel de 2 $ / 10 $ par million de tokens jusqu’au 31 août 2026. Anthropic met en avant l’usage autonome d’outils — browsers, terminals, systèmes de fichiers — comme axe de différenciation, plutôt que la pure taille de contexte. Produit
La deuxième nouvelle vient du calendrier réglementaire : le 1er juillet, Anthropic a restauré l’accès global à Fable 5 et Mythos 5, après la levée des export controls américains déclenchée mi-juin par des inquiétudes sur des jailbreaks. Anthropic présente les classifiers cybersécurité ajoutés dans la foulée comme « the strongest safeguards » disponibles, sans exiger de vérification d’identité pour l’accès. Côté sectoriel, Anthropic pousse aussi Claude Science, une application dédiée aux workflows de recherche — découverte de médicaments, biologie computationnelle — avec une promesse de taux d’hallucination réduit sur les requêtes biochimiques. La lecture d’ensemble : pendant que la concurrence pousse le sommet, Anthropic occupe méthodiquement le milieu de gamme à forte marge et les verticales à ticket élevé.
OpenAI : GPT-Live, un exploit math et une IPO qui recule
OpenAI a introduit GPT-Live, un système d’interaction vocal full-duplex capable d’écouter, raisonner et parler en parallèle, avec traduction live, recherche web pendant la conversation et délégation de sous-tâches à d’autres agents. Le produit vise les cas d’usage support client, tutorat et interprétariat, où la latence bout-en-bout était jusqu’ici l’obstacle principal. En parallèle, l’entreprise a communiqué sur GPT-5.6 Sol Ultra qui aurait résolu la Cycle Double Cover Conjecture — problème ouvert de théorie des graphes depuis les années 1970 — en moins d’une heure avec 64 sous-agents parallel. La communauté math attend une vérification indépendante avant conclusion. Produit IPO décalée
Côté finance, le calendrier ralentit. Reuters, puis le New York Times et Forbes le 25 juin, rapportent qu’OpenAI envisage de repousser son IPO à 2027 — initialement visée Q4 2026, potentiellement dès septembre. La valorisation privée (852 Md$ en mars 2026, avec une cible IPO possible à 1 000 Md$) reste spectaculaire, mais les projections publiées font état de 14 Md$ de pertes en 2026 et jusqu’à 115 Md$ de pertes cumulées d’ici 2029, avec une profitabilité attendue seulement dans les années 2030. Le début décevant du titre SpaceX en Bourse et la volatilité du secteur tech public ont pesé sur la décision. Autrement dit : valorisation privée n’est pas valeur publique, et la pression concurrentielle de Google et Anthropic sur les marchés clés d’OpenAI n’aide pas la narration de croissance.
Open source : Mistral prouve, Kimi accélère, DeepSeek allume les MoE
La semaine a produit trois signaux forts en open weights. D’abord Mistral avec Leanstral 1.5, qui va au-delà de la génération de code en fournissant une preuve mathématique Lean 4 que le software se comporte comme spécifié. Les benchmarks internes montrent une avance nette en vérification formelle, un territoire jusqu’ici occupé par des acteurs spécialisés. Ensuite, Moonshot a livré Kimi K2.7 Code le 12 juin, avec un gain de 21,8 % sur Kimi Code Bench v2 par rapport à K2.6, et une variante HighSpeed environ 6 fois plus rapide à l’inférence. Enfin, DeepSeek V4 Flash est un modèle Mixture-of-Experts à 284 Md de paramètres au total, dont 13 Md activés par token, avec une fenêtre de contexte de 1 000 000 tokens. Open source
Le scénario s’affine : en juillet 2026, Qwen 3 235B-A22B tient la première place généraliste, DeepSeek R1 domine le raisonnement math approfondi, Llama 4 Scout garde la couronne du contexte long avec 10 M de tokens. Les trois se comparent désormais à GPT-4 sur code et math tout en restant gratuits à déployer. Le vrai enjeu 2026 n’est plus « open vs propriétaire » mais « quel labo ouvert livre le meilleur triplet coût, qualité, licence ». Cette diversité bénéficie directement aux runtimes locaux : Ollama a basculé sur MLX pour Apple Silicon depuis mars 2026, et les benchmarks Red Hat de juin 2026 montrent que vLLM atteint environ 2,3 fois le débit d’Ollama sur 8 utilisateurs concurrents en serving multi-user.
Infrastructure : le duo NVIDIA-Groq consolide, Cursor arrive sur iOS
Le deal NVIDIA-Groq (20 Md$, signé en décembre 2025 avec transfert d’IP et hires clés dont le fondateur Jonathan Ross) a donné naissance au LPU Groq 3, lancé publiquement à GTC 2026. Le rack Groq 3 LPX combine 128 LPUs, et couplé au rack Vera Rubin NVL72, NVIDIA revendique un débit par mégawatt 35 fois supérieur et une opportunité de revenu multipliée par 10 sur les workloads d’inférence. Groq de son côté lève environ 650 M$ en interne depuis mai 2026 pour pivoter vers l’inférence-as-a-service. Partenariat
Côté développeurs, Cursor a lancé une application iOS en beta publique : contrôle d’agents always-on depuis mobile, saisie vocale, notifications push. Le geste dit la même chose que Windsurf 2.0 (rebrandé Devin Desktop après le rachat par Cognition en juin) et Claude Code : la boucle « plusieurs agents autonomes qui bossent en parallèle sur ton repo pendant que tu regardes » est devenue le standard. Le développeur passe de compositeur d’instructions à gestionnaire de flotte. Cette convergence a un coût caché : la lecture des diffs, l’arbitrage entre versions concurrentes et le coût de l’inférence multiplié par le nombre d’agents. C’est aussi pour ça que la latence de Grok 4.5 (80 tokens/s) est plus qu’un chiffre marketing.
Réglementation : le compte à rebours du 2 août 2026
Le 2 août 2026 reste la date-clé pour l’EU AI Act : les obligations de transparence pour les modèles d’usage général entrent en application. En parallèle, l’accord provisoire du 7 mai 2026 (Conseil, Parlement, Commission) sur le Digital Omnibus a repoussé les obligations Annex III à usage à haut risque du 2 août 2026 au 2 décembre 2027 — 16 mois de délai supplémentaire. L’obligation de marquer en machine-readable les contenus synthétiques déjà mis sur le marché avant le 2 août 2026 est repoussée de 4 mois, au 2 décembre 2026. Un plan d’action cybersécurité et IA a été publié en juillet pour coordonner l’action des États membres face aux modèles frontier. Warning
Aux États-Unis, le cadre reste patchwork. La Maison-Blanche a publié en mars 2026 un cadre recommandant au Congrès une préemption large des lois d’État sous standard light-touch, mais la préemption n’est pas actuellement du droit établi et les tentatives législatives ont répétitivement calé. Les États gardent en 2026 leur mille-feuille de lois — accountability algorithmique, transparence, biométrie, règles sectorielles. Pour un éditeur SaaS qui vend en Europe et aux États-Unis, la logique régulatoire de 2026 n’est plus « quel régime respecter » mais « combien de régimes appliquer par marché ». Le décalage de 16 mois sur Annex III détend l’échéance mais ne change pas la direction.
Testez votre lecture de la semaine
À quel prix par million de tokens (input / output) Grok 4.5 est-il facturé au lancement ?
Quelle date-clé déclenche l’entrée en application des obligations de transparence de l’EU AI Act pour les modèles d’usage général ?
Quel labo a livré en juillet 2026 un modèle orienté vérification formelle en Lean 4 ?
De combien Kimi K2.7 Code progresse-t-il par rapport à K2.6 sur Kimi Code Bench v2 ?
Quelle est la valorisation privée d’OpenAI après son round de mars 2026 ?