AMD Helios entre en volume, Grok 4.6 accélère, l'AI Act mord : la semaine où la carte s'est redessinée
Trois secousses en sept jours. AMD livre en volume son rack Helios face au NVL72 de NVIDIA. xAI passe en mode release toutes les deux semaines avec un Grok 4.6 à 1,5 T de paramètres. Bruxelles bascule l'AI Act en enforcement effectif. Le paysage IA d'août 2026 est plus fragmenté qu'il y a un mois.
- AMD confirme le 22 août 2026 le shipping en volume de son rack-scale Helios (Instinct MI455X + Epyc 9006 + ROCm) vers plusieurs hyperscalers.
- xAI sort Grok 4.6 (1,5 T de paramètres) mi-août avec une cadence assumée de 2 à 3 semaines par release ; Grok 4.7 (2,1 T) suit dans quelques semaines.
- L'AI Act européen est en enforcement depuis le 2 août 2026 : transparence, deepfakes labellisés, sanctions jusqu'à 15 M€ ou 3% du CA mondial.
- Jeff Dean quitte Google après 27 ans ; Gemini 3.5 Pro a raté trois deadlines de sortie ces derniers mois.
- 12 modèles LLM sortis en août 2026, dont Qwen 3.8 Max (Alibaba, 2 août) et GLM-5.2 Turbo (Z.AI, 17 août), tous deux open-weights.
AMD Helios livre en volume : le monopole rack de NVIDIA prend sa première fissure
Le 22 août 2026, AMD a confirmé que son système rack-scale Helios est en shipping volume vers plusieurs hyperscalers. L'architecture combine les GPU Instinct MI455X, les CPU Epyc 9006 de sixième génération, la fabric Pensando et la pile logicielle ROCm dans un rack intégré single-vendor. C'est la première fois qu'un concurrent propose une réponse frontale au NVL72 de NVIDIA, dont la plateforme Vera Rubin est confirmée en production complète depuis début août.
La question technique est presque secondaire. Ce qui compte, c'est que les hyperscalers disposent enfin d'une seconde source crédible au niveau du rack, pas seulement au niveau du GPU. AWS, Azure et GCP négocient leurs commandes 2027 sur cette base : jusqu'ici, sortir de NVIDIA imposait de recomposer le stack (réseau, logiciel, orchestration). Helios livre le tout en un seul bon de commande. Le narratif "NVIDIA intouchable" n'est pas cassé, il est simplement moins évident.
Le marché a réagi en conséquence : la thèse "trois-way race NVIDIA-AMD-Microsoft Maia" est désormais dominante chez les analystes hardware, alors qu'il y a trois mois elle passait pour spéculative. Reste que le vrai signal viendra des earnings calls Q3, quand on saura si les commandes MI455X représentent 5%, 15% ou 25% de la capex 2027 des trois plus gros acheteurs.
xAI passe en cadence guerrière : Grok 4.6 sort mi-août, 4.7 dans quelques semaines
Elon Musk a revealed mi-août 2026 la sortie de Grok 4.6, un modèle de 1,5 T de paramètres avec des améliorations sur le supervised fine-tuning et le reinforcement learning. La release a fait bondir SpaceX en bourse, dans un couplage capitalistique désormais assumé entre les deux entités. Grok 4.7, annoncé pour quelques semaines plus tard, est prévu à 2,1 T de paramètres, présenté comme "meilleur en tout sauf légèrement plus lent à servir".
Le point structurant, ce n'est pas Grok 4.6 lui-même. C'est le fait que xAI a réorganisé ses équipes d'ingénierie pour tenir un cycle de release toutes les 2 à 3 semaines, avec un mandat explicite de matcher Anthropic à chaque itération. Cette stratégie d'attrition par la fréquence, testée par OpenAI en 2024-2025, devient un standard de guerre chez les labs frontière.
Pour les utilisateurs, l'effet est ambivalent. D'un côté, l'accès à des modèles de plus en plus capables sans attendre 6 mois. De l'autre, un turnover qui rend l'évaluation, la mise en production et la stabilisation d'agents beaucoup plus coûteuse : le modèle sur lequel vous benchez lundi n'est plus le default de vendredi. Grok 4.5, sorti le 8 juillet 2026 en partenariat avec Cursor pour les workflows finance et juridique, aura eu six semaines de vie utile.
L'AI Act européen est enforcé depuis le 2 août : ce qui change vraiment
Depuis le 2 août 2026, l'AI Office et les autorités nationales appliquent effectivement l'AI Act européen. Trois blocs d'obligations sont concernés. Un : les chatbots et systèmes interactifs doivent identifier qu'ils sont des IA. Deux : les deepfakes et contenus AI-generated doivent être labellisés, avec un marquage machine-readable pour permettre la détection automatique. Trois : les règles sur les modèles GPAI (General-Purpose AI) sont opposables aux fournisseurs, y compris hors UE dès lors qu'ils servent le marché européen.
Les sanctions sont sérieuses : jusqu'à 15 M€ ou 3% du chiffre d'affaires mondial, le plus élevé des deux. La Commission a par ailleurs publié un AI Omnibus qui reporte les règles high-risk au 2 décembre 2027, et à août 2028 pour les systèmes embarqués dans des produits déjà régulés. Cette respiration a été négociée pour éviter un effet cliff sur les industriels.
Pour les équipes produit, la charge n'est pas symbolique. Chaque chatbot B2B, chaque outil marketing générant du visuel, chaque agent conversationnel doit être audité pour les nouvelles obligations. Les fournisseurs GPAI (OpenAI, Anthropic, Google, Mistral, Meta) publient déjà des templates de compliance. Les intégrateurs européens, eux, découvrent qu'ils sont co-responsables du respect des règles côté déploiement. Le calendrier réel d'application se jouera sur les trois prochains cycles trimestriels.
Google DeepMind traverse une crise de leadership pendant que Gemini 3.7 Flash sort
Le 10 août 2026, Jeff Dean a quitté Google après presque 27 ans, en tant qu'employé numéro 30 de l'entreprise. Le départ intervient dans un contexte tendu : Gemini 3.5 Pro a raté trois deadlines de sortie ces derniers mois, plusieurs seniors ont claqué la porte, et une friction publique autour de contrats défense controversés a fragilisé le moral interne. Le récit "Google a perdu son avance" refait surface chez les insiders.
Paradoxalement, DeepMind a sorti dans la foulée Gemini 3.7 Flash, seulement trois semaines après la 3.6 Flash. Le positionnement affiché est "le workhorse le plus intelligent pour le code et les agents", avec un pricing agressif visible via les intégrations partenaires : 0,375 $ par million de tokens en input, 1,875 $ en output sur le Router de Perplexity. Ce couloir low-cost + haute cadence est la stratégie visible pour reconquérir les développeurs.
La question qui reste ouverte : peut-on faire de la recherche de rupture (Gemini Pro next-gen, agentique long-horizon) et servir un pipeline produit trimestriel dans la même équipe ? Le départ de Dean suggère que la culture DeepMind d'origine, "science-first", est incompatible avec les cycles de release produits que Google impose maintenant. La réorganisation des prochains mois sera lue à cette aune.
OpenAI rationalise sa gamme, teste la publicité, retire ses vieux modèles
OpenAI accélère sur deux fronts. Côté produit, GPT-5.6 Sol devient le default pour Plus et Pro, avec un slider d'effort qui laisse l'utilisateur arbitrer entre latence et qualité, remplaçant GPT-5.5 Instant. GPT-5.6 Luna est étendu aux free users. Un mode Ultrafast est en preview à 14x la vitesse standard. L'ancien GPT-5.3 Instant a reçu un update pour réduire les phrases "teaser" et améliorer le ton de suivi.
Côté cleanup, l'o3 est retiré de ChatGPT le 26 août 2026 au terme d'une période de sunset de 90 jours. Le GPT officiel DALL-E est retiré de ChatGPT le 30 août 2026. Le standalone ChatGPT Atlas browser a cessé de fonctionner le 9 août 2026, les fonctions d'agentic browsing étant migrées dans l'app desktop et une extension Chrome. Cette purge simplifie la matrice pour les développeurs, mais casse aussi des workflows.
Nouvelle plus discrète mais structurante : OpenAI teste des annonces publicitaires dans ChatGPT. C'est la première tentative sérieuse d'un frontier lab de monétiser autre chose que l'abonnement et l'API. Si le test tient, il redéfinit le business model du secteur. Les concurrents (Anthropic, Google, Meta AI) observent : la publicité dans un LLM engage la responsabilité éditoriale d'une manière que ni Search ni Feed ne préparent.
Open source chinois : Qwen 3.8 Max et GLM-5.2 Turbo saturent le mois d'août
LLM Gateway comptabilise 12 nouveaux modèles sortis en août 2026, issus de 7 fournisseurs distincts. Le plus récent est GLM-5.2 Turbo de Z.AI, publié le 17 août 2026. Le 2 août, Alibaba a sorti Qwen 3.8 Max, en Apache 2.0 (comme toute la famille Qwen 3.x), au niveau de GPT-5.6 sur les benchmarks de code et de raisonnement chinois/CJK. À côté, DeepSeek V3 continue d'être cité comme référence de coût d'entraînement, à environ 6 M$ pour une qualité proche du GPT-4.
Le signal n'est plus "la Chine rattrape". C'est "la Chine sort au même rythme, avec des licences plus permissives, et pour un tiers du coût par token servi". Pour les runtimes locaux (Ollama, LM Studio, vLLM, MLX, llama.cpp), c'est une manne : chaque release open-weights nourrit l'inference on-device et le déploiement sur infra privée. Mistral maintient son propre couloir Apache 2.0 avec Mistral 7B et Mistral Large, mais la densité de sorties chinoises rend la comparaison difficile pour les DSI européens.
La conséquence stratégique est que le stack "modèle propriétaire frontier + API cloud" n'est plus le seul chemin sérieux. Une entreprise peut désormais tenir un déploiement 100% open-weights sur Qwen 3.8 Max ou DeepSeek R1, servi via vLLM sur infra AMD Helios ou NVIDIA H200. Ce n'est plus un scénario de conférence, c'est un choix d'architecture réel en Q4 2026.
Testez votre lecture de la semaine
Quel est le nombre de paramètres annoncé pour Grok 4.6 par xAI en août 2026 ?
Depuis quelle date les obligations de transparence de l'AI Act sont-elles enforcées par la Commission européenne ?
Quelle est la sanction maximale prévue par l'AI Act européen pour non-respect des obligations ?
Quel composant NE fait PAS partie du rack Helios d'AMD annoncé le 22 août 2026 ?
Quel modèle open-weights a été publié par Z.AI le 17 août 2026 ?