Fable 5 rallumé, GPT-5.6 en preview, Sonnet 5 à 2 #160;: sept jours qui rebattent les cartes de l’IA
La première semaine de juillet 2026 a condensé en cinq jours ce que le marché digite habituellement en un trimestre : retour d’un modèle bloqué par Washington, preview d’une nouvelle famille GPT, prix d’attaque agressifs, IPO qui dépasse 100 Md$ et paquet réglementaire européen. Le point complet, chiffres vérifiés, sans favoritisme labo.
- Anthropic Fable 5 est de nouveau accessible depuis le 1er juillet 2026 et reprend la tête du SWE-Bench Pro à 80,3%.
- OpenAI a ouvert la preview limitée de GPT-5.6 (Sol, Terra, Luna) le 26 juin 2026, prix API à partir de 1 $/6 $ par million de tokens.
- Anthropic Sonnet 5 se cale à 2 $ input / 10 $ output jusqu’au 31 août 2026, en dessous du Terra d’OpenAI.
- Cerebras a fini son IPO en mai à 106 Md$ de valorisation et encaisse un engagement d’achat OpenAI supérieur à 20 Md$.
- Le Conseil de l’UE a validé le paquet de simplification de l’AI Act le 29 juin 2026, avec de nouvelles interdictions dures et des seuils PME élargis.
Fable 5 rebranché le 1er juillet 2026 : la souveraineté des modèles devient un sujet DSI
Fable 5 avait été retiré du marché hors des États-Unis le 12 juin 2026 sur ordre d’export control. Le 1er juillet 2026, Anthropic l’a réactivé à l’international, avec un étage de classifieurs cybersécurité pour désamorcer un nouveau blocage. Le modèle reprend immédiatement le sommet du SWE-Bench Pro à 80,3%, meilleur score public toutes catégories confondues.
L’épisode dure moins de trois semaines mais il installe une idée simple : un modèle frontier peut être éteint puis rallumé par une décision administrative à Washington. Pour une DSI européenne qui a câblé sa chaîne agent sur un seul fournisseur, c’est un risque exploitation, pas seulement un risque contractuel. La logique multi-modèle (routeur qui bascule sur Sonnet, Gemini, Mistral ou un open-weight local en fallback) passe du « nice to have » au sujet comité stratégique.
La séquence explique aussi pourquoi les modèles à poids ouverts (Kimi K2.6, DeepSeek V4 Pro, Qwen 3.7 Max, Llama 4 Scout) gagnent en poids dans les cahiers des charges, même quand leurs benchmarks bruts restent légèrement en retrait. Ils ne peuvent pas être éteints par un tiers.
OpenAI passe GPT-5.6 en preview limitée le 26 juin 2026
Le 26 juin 2026, OpenAI a publié la preview de sa famille GPT-5.6 sous trois noms : Sol, Terra, Luna. La grille tarifaire annoncée est de 5 $/30 $ pour Sol, 2,5 $/15 $ pour Terra et 1 $/6 $ pour Luna par million de tokens input/output. L’accès reste réservé à des partenaires API et Codex sélectionnés au 7 juillet 2026, et ne passera pas par ChatGPT pendant la phase preview.
Le positionnement des trois SKU est explicite. Luna se cale contre les modèles économiques (Haiku, Flash, Mistral Small). Terra vise le milieu de gamme premium et cherche à concurrencer Sonnet 5, Gemini 3.1 Pro et Fable 5 sur des workloads réels de production. Sol est un modèle lourd, orienté biologie, sécurité et raisonnement long, avec un « ultra mode » annoncé. Fox News rapporte que Sol reste, en preview, fermé à certains partenaires administration américaine.
Le message industriel envoyé par cette matrice est clair : OpenAI abandonne définitivement le modèle unique gigantesque pour un catalogue segmenté. C’est la même trajectoire qu’Anthropic (Fable/Opus/Sonnet/Haiku) et que Google (Pro/Flash/Nano). Pour un acheteur, le vrai travail devient l’orchestration : pousser Luna sur 80% des appels, Terra sur 15%, Sol seulement quand la tâche le justifie.
Sonnet 5 à 2 $ et Claude Science Workbench : Anthropic joue la spécialisation
Anthropic a placé Sonnet 5 à 2 $ input / 10 $ output par million de tokens, tarif d’appel valable jusqu’au 31 août 2026. Le modèle est présenté comme atteignant des performances proches d’Opus 4.8. La lecture évidente est un cadrage direct sur Terra d’OpenAI (2,5 $/15 $) et sur Gemini 3.1 Pro. Sur trois mois, le coût marginal d’un pipeline agent Sonnet chute de façon significative pour les équipes qui font tourner plusieurs millions de tokens par jour.
En parallèle, Anthropic a annoncé Claude Science Workbench, une extension qui branche Opus 4.8 sur plus de 60 bases scientifiques : génomique, protéomique, chéminformatique, essais cliniques, littérature médicale. La cible est explicite : pharma, biotech, agrochimie, hospitalière-universitaire. C’est le premier livrable concret d’une stratégie de verticalisation par domaine, plutôt que la course à l’IA généraliste toujours plus grosse.
Cette combinaison (prix agressifs en milieu de gamme, spécialisation lourde en haut de gamme) est à observer, parce qu’elle donne un modèle économique lisible pour les autres labos. Mistral suit déjà ce chemin avec Vibe Work Mode et Code Mode. Google le fait avec Gemini for Enterprise et NanoBanana. La couche « boutique » du marché est en train de se dessiner autour des cas d’usage métier plutôt qu’autour des benchmarks bruts.
Mistral Vibe et l’arrière-plan open source : Kimi, DeepSeek, Qwen, Llama
Mistral a confirmé début juillet 2026 l’early access à un nouveau modèle open-weight de type Mixture-of-Experts, décrit par Arthur Mensch comme « fat but sparse ». L’ARR de la maison grimpe au-dessus de 400 M$ début 2026 avec un objectif au-dessus du milliard en fin d’année. Vibe (ex-Le Chat, renommé fin mai 2026) fusionne un Work Mode long-running et un Code Mode qui produit des pull requests directement, avec extension VS Code et CLI.
Dans l’arrière-plan, les modèles à poids ouverts continuent de rattraper. DeepSeek V4 Pro, sorti le 24 avril 2026 sous licence MIT, culmine à 80,6% sur SWE-bench Verified avec 1 M de contexte. Kimi K2.6 (Moonshot), sorti le 20 avril 2026 sous MIT, atteint 58,6% sur SWE-Bench Pro. Qwen 3.7 Max, sorti le 20 mai 2026, dépasse 92% sur GPQA Diamond. Llama 4 Scout offre toujours 10 M de tokens de contexte, ce qu’aucun modèle propriétaire n’égale.
Concrètement, un pipeline « 100% souverain » basé sur Ollama, vLLM ou LM Studio, tournant DeepSeek V4 Pro ou Kimi K2.6 sur station de travail correctement équipée, devient une option opérationnelle pour un cabinet d’avocats, une DSI publique ou une PME industrielle qui refuse de sortir du code ou des données RH d’Europe. Cline, extension open source pour VS Code, est le connecteur qui rend ce montage accessible sans code custom.
Infra : Cerebras à 106 Md$, NVIDIA cadenasse via Groq
Cerebras a bouclé en mai 2026 la plus grosse IPO tech de l’année aux États-Unis. Le titre a pricé à 185 $, ouvert à environ 350 $ (soit +89%) et clôturé sur une capitalisation entièrement diluée proche de 106 Md$. En parallèle, en avril 2026, OpenAI s’est engagé à acheter plus de 20 Md$ de chips Cerebras sur plusieurs années, verrouillant une partie de la capacité d’inférence en dehors du périmètre NVIDIA. Oracle a confirmé en mars 2026 utiliser du Cerebras aux côtés de NVIDIA et AMD dans son offre cloud.
Face à ce mouvement, NVIDIA a racheté en décembre 2025 les actifs clés de Groq pour environ 20 Md$, réintégré leur techno d’inférence dans le sillage de son architecture Groq 3 LPX présentée à GTC, et vend désormais un ensemble « sept puces, cinq racks, un supercomputer ». Le message : passer du GPU d’entraînement au système complet d’inférence continue, faible latence, pour la charge entreprise.
Côté hyperscalers, AWS, Azure et GCP continuent d’investir dans leurs propres silicons (Trainium, Maia, TPU v6). La conclusion est robuste : la couche matérielle est en train de s’éclater sur cinq à sept fournisseurs crédibles, alors qu’elle était quasi-monopolistique il y a dix-huit mois. Toute modélisation de coût d’inférence sur douze mois doit intégrer cette dispersion.
EU AI Act simplifié le 29 juin 2026 : nouvelles interdictions, seuils PME à 750 salariés
Le Conseil de l’Union européenne a donné son feu vert final le 29 juin 2026 au paquet de simplification de l’AI Act, après l’aval du Parlement européen le 16 juin 2026. Le texte ajoute une interdiction dure de génération d’images intimes non consenties et de contenus pédopornographiques générés par IA, applicable dès décembre 2026. Il réduit également de six à trois mois la période de grâce pour la transparence des contenus artificiellement générés, avec une nouvelle deadline au 2 décembre 2026.
Sur l’autre versant, Bruxelles desserre. Les sandboxes IA nationaux ont maintenant jusqu’au 2 août 2027 pour être en place. Le périmètre du régime simplifié PME est élargi jusqu’à 750 salariés et 150 M€ de chiffre d’affaires annuel, avec des guides simplifiés, des amendes réduites et un accès facilité aux sandboxes.
Le signal politique est double. Bruxelles resserre là où l’opinion publique demande de la protection (deepfake sexuelle, mineurs) et desserre là où le marché menace de délocaliser (compliance des scale-ups). Pour une ETI française entre 200 et 700 salariés, la fenêtre de tir 2026–2027 est significativement plus favorable qu’il y a six mois. Reste que le futur régime transparence entre en vigueur en août 2026, ce qui laisse peu de temps pour mettre les tags synthetic-content en place.
Testez votre lecture de la semaine
À quel prix Anthropic positionne-t-il Sonnet 5 en tarif d’appel jusqu’au 31 août 2026 ?
Quel modèle règne actuellement sur SWE-Bench Pro après son retour en service ?
Quelle valorisation Cerebras affiche-t-il post-IPO en mai 2026 ?
Quelle nouvelle interdiction dure ajoute la version simplifiée de l’EU AI Act ?
À combien s’élève l’engagement d’achat de chips OpenAI auprès de Cerebras ?