Kimi K3 arrive demain en open weights. Et Washington menace Moonshot de sanctions.
Une semaine où le plus gros modèle open weight de l’histoire (2 800 milliards de paramètres) devient un incident diplomatique, où Black Forest Labs unifie image, vidéo, audio et robotique dans un seul réseau, et où Google sort trois modèles Flash le même jour. La cadence est le nouveau moat.
- Le 22 juillet 2026, Michael Kratsios (Maison-Blanche) accuse Moonshot d’avoir « distillé » Anthropic Fable 5 pour construire Kimi K3, et d’avoir utilisé des serveurs Nvidia GB300 basés en Thaïlande ; le Trésor évoque des sanctions.
- Les poids ouverts de Kimi K3 (2 800 Md de paramètres, MoE sparse, 1 M de contexte) sortent le 27 juillet, soit demain.
- Black Forest Labs sort FLUX 3 le 23 juillet : un modèle unique pour image, vidéo (20 secondes avec audio synchronisé natif) et prédiction d’actions robotiques.
- Google balance Gemini 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber en une seule annonce le 21 juillet.
- AMD s’allie à Cerebras pour attaquer le duopole Nvidia+Groq sur l’inférence.
Le week-end où Kimi K3 arrive et Washington sort l’artillerie
Moonshot AI a publié Kimi K3 le 16 juillet 2026 : 2 800 milliards de paramètres, architecture LatentMoE (Mixture of Experts sparse, 16 experts actifs sur 896 par token), fenêtre de contexte d’un million de tokens, vision native. C’est numéricalement le plus gros modèle à poids ouverts jamais annoncé. Sur Frontend Code Arena, K3 caracole en tête à 1 679 points, devant Claude Fable 5. Les benchmarks internes le donnent au-dessus de Claude Opus 4.8 max et GPT-5.5 high, en dessous de Fable 5 et GPT-5.6 Sol. Le poids Release arrive demain, 27 juillet.
Six jours après le lancement, le 22 juillet, Michael Kratsios (OSTP) accuse Moonshot d’avoir monté une plateforme interne pour interroger Fable 5 à grande échelle via des accès multiples masqués, et d’utiliser des serveurs Nvidia GB300 basés en Thaïlande — matériel Blackwell interdit à l’export vers la Chine. Le secrétaire au Trésor Scott Bessent enfile la menace de sanctions et de blacklistage export dans la foulée. C’est le premier vrai clash post-AI Act qui mélange propriété intellectuelle, contrôles à l’export et politique industrielle. Le calendrier est inconfortable pour tout le monde : la sortie des poids demain va rendre l’audit indépendant possible — et donc la controverse plus tranchable.
Ce que la distillation reproche à Moonshot — et pourquoi c’est arithmétiquement tendu
La distillation, techniquement, c’est entraîner un modèle élève à imiter les sorties d’un modèle maître plus fort. Fait à petite échelle et publiquement, c’est légal et courant. Fait à l’échelle industrielle avec des accès API multiples camouflés, c’est du vol de modèle sous l’angle des Terms of Service — potentiellement du vol de secrets commerciaux.
Le problème, c’est le calendrier. Anthropic Fable 5 n’a été ouvert au grand public que le 1er juillet 2026 (après une suspension liée aux contrôles d’export en juin). Kimi K3 est sorti 15 jours plus tard. Pour distiller un modèle frontier dans un MoE de 2 800 Md de paramètres, il faut typiquement plusieurs mois de génération de données synthétiques, de pré-entraînement, de mise au point RLHF. Trois semaines, même avec un cluster monstrueux, c’est court. Deux hypothèses tiennent debout : soit Moonshot avait un accès pré-public à Fable (test/partenariat), soit la distillation cible en réalité Opus 4.8 et GPT-5.5, disponibles depuis bien plus longtemps. Kratsios n’a pas montré les preuves, seulement l’accusation. À suivre.
FLUX 3 : le multimodal unifié devient la norme
Black Forest Labs a lancé FLUX 3 le 23 juillet 2026 Multimodal. Le pitch est simple : un seul modèle, une seule architecture, entraînée sur images, vidéos et audios ensemble. En sortie : image (avec rendu texte lisible et multilingue), vidéo texte-vers-vidéo jusqu’à 20 secondes avec audio synchronisé natif, édition d’image, et — c’est la vraie surprise — prédiction d’actions robotiques via un module baptisé FLUX-mimic.
C’est la fin du schéma où on empile un modèle image, un modèle TTS, un modèle vidéo, puis on colle tout à la main. FLUX 3 apprend les corrélations entre modalités pendant l’entraînement : le son colle à l’impact, le mouvement respecte la physique, la scène reste cohérente. Le déploiement est phasé : FLUX 3 Video est en early access API et poids privés pour partenaires, FLUX 3 Action réservé à quelques labos robotiques, FLUX 3 Image sort dans les prochaines semaines, et une version FLUX 3 Dev en open weight est promise pour fin 2026. Le positionnement attaque frontalement Sora 3 (OpenAI) et Veo 4 (Google), avec un argument différenciant : l’audio natif dans le même réseau, pas en post-processing.
Google, OpenAI, Alibaba : la cadence est le nouveau moat
Google DeepMind a annoncé trois modèles le 21 juillet en une seule communication : Gemini 3.6 Flash (généraliste rapide), Gemini 3.5 Flash-Lite (encore moins cher, pour l’inférence de masse), et Gemini 3.5 Flash Cyber (spécialisé sécurité offensive et défensive). La lecture est transparente : couvrir chaque point de prix contre GPT-5.6 Luna/Terra/Sol (respectivement 1 $, 2,5 $ et 5 $ le million de tokens input) et écraser Mistral et DeepSeek sur l’inférence bon marché.
OpenAI, en parallèle, a lancé une plateforme d’agents entreprise et annoncé un nouveau data center dont l’investissement dépasserait 30 Md$. Le groupe a aussi racheté Northslope, sa 2e acquisition « applied AI » de l’année, pour renforcer ses équipes d’ingénieurs forward-deployed qui vont construire les systèmes chez le client. Alibaba, de son côté, publie du Qwen chaque semaine : Qwen-Audio-3.0-TTS Flash et Plus le 20 juillet, Qwen-Image-3.0 le 21 juillet. La cadence hebdo devient un signal en soi : elle témoigne de la maturité du pipeline de release, du batching des expériences, et de la capacité à encaisser des bugs post-launch sans casser la réputation. Un labo qui n’arrive plus à sortir mensuellement dit quelque chose sur sa structure interne.
AMD + Cerebras contre Nvidia + Groq : le duopole inférence est cassé
Le 23 juillet 2026, Lisa Su a annoncé sur scène au Advancing AI un partenariat AMD-Cerebras Alliance. Cerebras intègre son wafer scale engine dans le portfolio AMD, ce qui bouche le trou laissé par le rachat de Groq par Nvidia pour 20 Md$ en décembre 2025. Cerebras revendique des sorties de plus de 2 000 tokens par seconde en inférence, grâce à sa SRAM on-chip qui évite le va-et-vient mémoire des GPU classiques.
Pour un CTO qui choisit son fournisseur d’inférence en 2026, la carte se redessine. Nvidia domine l’entraînement (Vera Rubin, GB300) et pousse Groq 3 sur l’inférence via des racks LPX. En face, AMD+Cerebras propose une alternative unique sur la latence extrême, avec un discours « pas de vendor lock-in NVLink ». Baseten et Fireworks AI, qui viennent de lever 1,5 Md$ chacun sur cette thématique, sont les grands bénéficiaires indirects : plus il y a d’options de silicium, plus leur rôle d’abstraction devient précieux. Together AI ferme la boucle avec ses 800 M$ post-valo à 8,3 Md$, sur le créneau « infer sur open source, quel que soit le hardware ». Le marché de l’inférence n’est plus une chasse gardée.
Ce que ça change pour vous cette semaine
Trois angles concrets. D’abord, si vous construisez avec des modèles open weight, mettez en garde vos utilisateurs européens : depuis le 10 juillet, la disclosure chatbot est enforceable en UE, et le 2 août 2026 marque l’application du reste des dispositions AI Act. Les amendes peuvent monter à 20 M€ ou 4 % du CA mondial pour un mauvais traitement des données personnelles.
Ensuite, si vous n’avez pas encore testé un modèle chinois open source dans votre stack (Qwen, DeepSeek, Kimi, GLM, MiniMax), la semaine du 27 juillet est un bon moment : les poids K3 vont être expérimentés partout, les retours seront rapides. Ne fondez pas votre production dessus sans due diligence légale sur la controverse en cours. Enfin, si vous facturez de l’inférence en refacturation, redécoupez votre offre : les prix Google/OpenAI/Groq bougent chaque semaine, votre marge se ferme silencieusement si vous ne rebattez pas les cartes chaque mois.
Testez votre lecture de la semaine
Combien de paramètres compte Kimi K3 — et quelle est son architecture ?
Quelle est la principale accusation de la Maison-Blanche contre Moonshot le 22 juillet 2026 ?
Quelle nouveauté techniquement significative FLUX 3 apporte-t-il ?
Combien de modèles Google a-t-il annoncé le 21 juillet 2026 dans une seule communication ?
Quel partenariat annoncé le 23 juillet 2026 vise directement le duopole Nvidia+Groq sur l’inférence ?