Kimi K3 fait basculer l'open source en Chine et quatre autres secousses IA de la semaine
Moonshot dépose 2 800 milliards de paramètres en licence ouverte, Bruxelles allume ses amendes, Meta ferme le robinet gratuit. Sept jours qui redessinent la carte du pouvoir IA.
- Moonshot a lancé Kimi K3 le 16 juillet 2026 : 2,8 trillions de paramètres MoE, contexte 1 million de tokens, poids ouverts le 27 juillet.
- L'EU AI Act est entré en exécution le 10 juillet 2026 : amendes rétroactives possibles à partir du 2 août.
- Meta a lancé Muse Spark 1.1 et sa Meta Model API payante le 9 juillet 2026 : 1,25 $/4,25 $ par million de tokens.
- Groq lève 650 M$ pour construire 200 MW de capacité d'inference d'ici fin 2027.
- Claude Code v2.1.211, Cursor 3.11 et ChatGPT Work durcissent la guerre des agents développeur.
Kimi K3 : la Chine reprend la couronne de l'open-weight
Moonshot AI a publié Kimi K3 le 16 juillet 2026. Le modèle affiche 2 800 milliards de paramètres MoE, avec seulement 16 experts actifs sur 896 par token, un contexte de 1 million de tokens, le reasoning activé par défaut, et gère nativement texte, image et vidéo. C'est le plus gros modèle open-weight jamais annoncé, loin devant Llama 4 Scout et devant DeepSeek V4. Sur le classement indépendant Artificial Analysis, K3 passe devant Claude Opus 4.8 mais reste derrière GPT-5.6 Sol et Claude Fable 5.
Deux dates comptent. Le modèle est déjà accessible via l'app Kimi et l'API `kimi-k3` depuis le 16 juillet, facturé 3 $ en entrée et 15 $ en sortie par million de tokens. Les poids, eux, ne tombent que le 27 juillet — c'est la partie qui autorise l'auto-hébergement et la modification. Moonshot recommande au minimum 64 accélérateurs pour un serving décent. Pour référence, le 1T K2.7 Code demande déjà environ 577 Go de VRAM en INT4 ; K3 à 2 800 Md paramètres exige un serveur multi-GPU de très haut de gamme ou un build quantisé agressif.
Ce qui compte n'est pas le benchmark mais le signal géopolitique. Depuis Llama 4, aucun labo américain n'a livré de modèle en licence ouverte à la frontière. Le podium open-weight est désormais 100 % chinois : Kimi K3, GLM-5.2 de Zhipu (744 Md paramètres, 91,2 % sur GPQA Diamond), DeepSeek V4, Qwen3.6. Pour un CTO qui veut un stack souverain sans dépendre d'une API frontier, la réponse s'écrit en mandarin.
EU AI Act : compte à rebours du 2 août
L'EU AI Act est officiellement entré en exécution le 10 juillet 2026. Les règles de transparence chatbot sont vivantes et opposables. Le Digital Omnibus adopté la veille, le 9 juillet, a consolidé le calendrier et confirmé le report de plusieurs obligations « haut risque » que la Commission jugeait ingérables en l'état. Il installe aussi le cadre procédural que les autorités nationales devront utiliser.
La date à noter est le 2 août 2026. À partir de cette échéance, la Commission peut infliger des amendes aux fournisseurs de modèles fondationaux — OpenAI, Anthropic, Google, Meta, Mistral, xAI — et ces amendes peuvent être rétroactives jusqu'à août 2025. Autrement dit, la Commission dispose d'un an de « dette réglementaire » qu'elle peut activer sur toute obligation non tenue depuis l'entrée en vigueur du texte. Seule une dizaine d'États membres, sur les 27, ont un dispositif national opérationnel.
Côté entreprise, deux angles concrets. Les chatbots grand public doivent afficher qu'ils sont des IA. Les systèmes qui touchent recrutement, crédit, éducation, forces de l'ordre entrent dans la catégorie haut risque avec obligations de documentation, de traçabilité et d'évaluation. Pour une PME qui a bricolé un agent RH sur GPT-5.6 en 2025 sans documentation, l'exposition est réelle. Un audit interne rapide vaut mieux qu'un courrier de la CNIL.
Meta ferme le robinet gratuit avec Muse Spark 1.1
Meta a lancé Muse Spark 1.1 le 9 juillet 2026, en même temps que sa Meta Model API. C'est la première fois de l'histoire de Meta AI qu'un modèle propriétaire est proposé derrière une API payante. Llama reste open source par ailleurs, mais le signal est clair : la frontière commerciale a bougé. Muse Spark 1.1 est multimodal, agentique, avec contexte 1 million de tokens, computer use, délégation à des sub-agents parallèles.
Le pricing est agressivement positionné à 1,25 $ par million de tokens en entrée et 4,25 $ en sortie, avec 20 $ de crédits offerts. À titre de comparaison, GPT-5.6 Sol démarre à 5 $ par million en entrée et Claude Sonnet 5 est à 2 $/10 $ jusqu'au 31 août. Muse Spark 1.1 se glisse dans le mid-market, en dessous de Sonnet et de Sol, au-dessus des open-weight servis en cloud.
Détail technique important : la Meta Model API parle nativement les formats OpenAI (Chat Completions + Responses) ET Anthropic Messages. Un développeur qui avait déjà câblé son agent sur Claude ou GPT peut basculer en changeant la base URL vers api.meta.ai/v1 et la clé, sans réécrire son code. Meta joue la carte de la commutation zéro friction — mais la preview reste limitée aux développeurs basés aux États-Unis, sans calendrier international annoncé.
La guerre des agents dev : Claude Code, Cursor, ChatGPT Work
Trois annonces resserrent la compétition sur les agents développeur. Claude Code est en version 2.1.211 depuis le 15 juillet 2026, avec Sonnet 5 par défaut depuis la v2.1.197, forwarding des insights de sub-agents dans les workflows, live counter sur les tools longs, screen reader support, et vim insert mode remap. La cible : les workflows agentiques longs avec plusieurs milliers de tokens de contexte.
Cursor est passé sur la ligne 3.11 avec chats latéraux persistants et intégration de Grok 4.5. Le split usage Teams sépare désormais deux pools : d'un côté les modèles Cursor first-party (Composer et Auto), de l'autre les modèles API tierces (Claude, GPT, Gemini). Le seat Standard reste à 40 $/mois avec plus d'usage total. Un seat Premium à 120 $/mois offre 5× l'usage Standard, calibré pour les power users qui font tourner des agents en tâche de fond.
OpenAI a répliqué le 9 juillet avec ChatGPT Work, un agent qui parcourt les apps et fichiers connectés du user pour livrer directement des documents, sheets, présentations et rapports finis. L'App Directory est remplacé par un Plugin Directory. Combiné à la famille GPT-5.6 (Sol, Terra, Luna, tous avec 1 million de tokens de contexte et un cut-off connaissance en février 2026), l'offre entreprise durcit sa réponse à Claude Code et à Gemini Enterprise, présenté à Google Cloud Next '26.
Groq lève 650 M$ dans l'ombre de NVIDIA
Groq a bouclé 650 M$ le 11 juillet 2026, mené par Disruptive et Infinitum, avec Adam Winter nommé CEO pour piloter la phase d'expansion. Le contexte est particulier : NVIDIA a licencié la technologie cœur de Groq en décembre 2025 dans un deal estimé à 20 Md$, et a absorbé les fondateurs Jonathan Ross et Sunny Madra. Le nouveau capital doit permettre à Groq d'atteindre 200 MW de capacité d'inference cloud d'ici fin 2027 et d'adopter le système LPX de NVIDIA, qui intègre les designs Groq.
Rappel produit : NVIDIA a dévoilé son processeur Groq 3 lors du GTC de mars 2026. Le rack Groq 3 LPX embarque 128 LPU individuels et, combiné au Vera Rubin NVL72, revendique 35× le throughput par mégawatt par rapport à la génération précédente. Ce n'est plus « NVIDIA contre les startups d'inference ». C'est « NVIDIA absorbe l'inference » — Cerebras a annoncé une IPO Q2, Quantinuum aussi, et les startups indépendantes de l'inference sont soit rachetées, soit repositionnées.
Le rapport de force ressemble à ce qui s'est passé sur les GPU cloud entre 2019 et 2022 : après plusieurs années de tentatives de démonopolisation, les hyperscalers ont fini par acheter le silicium NVIDIA en volume. La différence en 2026, c'est que NVIDIA achète directement les alternatives. Le marché de l'inference est en train de se consolider brutalement.
Testez votre lecture de la semaine
Quel modèle est actuellement le plus gros modèle open-weight annoncé ?
À partir de quelle date la Commission européenne peut-elle infliger des amendes IA Act rétroactives ?
Combien coûte 1 million de tokens en entrée sur Meta Muse Spark 1.1 via la Meta Model API ?
Quel montant SpaceX a-t-elle accepté de payer pour racheter Anysphere (Cursor) en juin 2026 ?
Quelle est la particularité de la Meta Model API annoncée le 9 juillet 2026 ?