Kimi K3, 2 800 milliards de paramètres : la Chine passe devant Claude Fable 5 en frontend
En sept jours, la course aux modèles frontier a produit trois chocs : le plus gros open-weight jamais publié, un reboot « from scratch » de Gemini 3.5 Pro, et une IPO à 28 milliards de dollars sur le Nasdaq. Voici la semaine du 16 au 23 juillet 2026, décryptée sans favoritisme.
- Moonshot AI publie Kimi K3, MoE 2,8 T paramètres, à la première place du Frontend Code Arena avec 1 679 points, devant Claude Fable 5.
- Google DeepMind sort Gemini 3.6 Flash le 21 juillet, après avoir scrappé Gemini 3.5 Pro et tout reconstruit de zéro.
- SK Hynix a levé 28 milliards de dollars sur le Nasdaq, IPO sur-souscrite sept fois.
- Mistral tue la marque Le Chat et lance Vibe, agent de travail unifié chat + code.
- Publication des poids de Kimi K3 prévue le 27 juillet 2026 : attendez-vous à un basculement des runtimes locaux (Ollama, LM Studio, vLLM).
Kimi K3 : Moonshot pose le plus gros modèle open-weight jamais publié
Le 16 juillet 2026, Moonshot AI a mis en ligne Kimi K3, un Mixture-of-Experts de 2 800 milliards de paramètres, active 16 experts sur 896 par requête, fenêtre de contexte d'un million de tokens, mécanisme d'attention hybride baptésé « Kimi Delta Attention ». Sur le Frontend Code Arena, K3 s'installe à la première place avec 1 679 points, devant Claude Fable 5 (1 631), GPT-5.6 Sol (1 618) et GLM-5.2 (1 587). Sur l'Artificial Analysis Intelligence Index toutes catégories confondues, K3 se classe quatrième sur 189 modèles avec un score de 57, à parité avec Claude Opus 4.8 et GPT-5.5. L'API démarre à 3 $ par million de tokens en entrée et 15 $ en sortie Product.
Le point critique arrive le 27 juillet 2026 : la publication complète des poids sur Hugging Face. Ce n'est pas anecdotique. Moonshot démontre qu'un modèle de la classe 3 T paramètres peut être livré sans accès aux cartes NVIDIA les plus récentes, alors que Pékin travaille depuis dix-huit mois à contourner les restrictions d'export américaines. La conséquence opérationnelle pour une équipe technique : intégrer K3 en fallback via l'API coûte peu, et le déployer en local dès que les runtimes suivront (Ollama, LM Studio et vLLM ont déjà annoncé la prise en charge). La question stratégique est plus lourde. Combien de temps un labo occidental peut-il facturer 5 $ le million de tokens en entrée si un modèle open weights, gratuit à l'auto-hébergement, atteint la même qualité sur un usage ciblé ?
Google reconstruit Gemini de zéro : le premier « from scratch » avoué du secteur
Le 21 juillet, Google DeepMind a publié Gemini 3.6 Flash. La sortie est notable pour ce qu'elle admet : la maison a scrappé intégralement le modèle de base de Gemini 3.5 Pro après des échecs structurels en test enterprise sur Vertex AI. Trois axes ont fait céder le modèle : tool-calling récursif, génération de SVG, raisonnement mathématique. Trois cas d'usage très demandés par les clients grands comptes. Google DeepMind n'a pas patché : reconstruction complète depuis un pré-entraînement neuf. C'est la première fois qu'un frontier lab américain reconnaît publiquement un échec de ce niveau sans le noyer dans un communiqué produit Product.
L'angle éditorial mérite débat. Est-ce du courage industriel, ou l'aveu qu'un labo ne peut plus survivre à un défaut structurel dans un environnement où Artificial Analysis, LM Arena et SWE-Bench Verified publient des scores mis à jour toutes les 48 heures ? Les deux, probablement. La conséquence directe touche les décideurs : les DSI qui avaient standardisé sur Gemini 3.5 Pro doivent migrer vers Flash ou attendre. Google vise la disponibilité de Gemini 3.7 Pro pour septembre 2026. Pendant deux mois, l'écart entre discours produit et disponibilité réelle sera visible dans les contrats d'entreprise. Contrairement aux transitions habituelles, il n'y a pas de version intermédiaire discrètement rebaptisée pour combler le trou.
SK Hynix, PsiBot, Chai : le capital IA circule ailleurs qu'en Californie
Trois signaux financiers cette semaine, tous en dehors des cinq comtés autour de San Francisco. Premier signal : SK Hynix a levé environ 28 milliards de dollars sur le Nasdaq le 6 juillet 2026, sur-souscrite sept fois, le plus gros IPO étranger de l'histoire de Wall Street. La firme coréenne fournit la mémoire HBM4 pour les GPU NVIDIA Rubin et vient de signer un partenariat étendu avec OpenAI dans le cadre de Stargate IPO. Deuxième signal : PsiBot, spin-off de robotique humanoïde chinois, a bouclé un tour de 100 millions de dollars à 1,48 milliard de valorisation le 23 juillet Funding. Troisième signal : Chai Discovery a levé 400 millions de dollars en série C le 21 juillet, avec Index Ventures, Kleiner Perkins et Sequoia, mais l'entreprise est basée à Londres.
Sur la semaine du 15 juillet, huit startups IA ont totalisé 1,022 milliard de dollars levés en une seule journée, réparties entre États-Unis, Inde, Dubaï, Arabie Saoudite et Israël. Les valorisations moyennes des startups d'agents IA ont grimpé de 40% en un trimestre pour atteindre 280 millions de dollars. Lecture froide : les capitaux IA se dispersent géographiquement mais restent concentrés sur trois usages opérationnels — développement logiciel, agents entreprise, robotique. Le déploiement du deep tech IA en Europe continentale reste sous-financé en comparaison, malgré l'entrée en vigueur imminente de la transparence AI Act.
GPT-5.6 et Claude Sonnet 5 : la stabilité des majors, prix agressifs
Contexte stable côté frontier US après trois semaines. OpenAI a livré la famille GPT-5.6 le 9 juillet 2026 en trois tiers : Sol à 5
#160;/ 30 $ le million de tokens (entrée / sortie), Terra à 2,50 #160;/ 15 $, Luna à 1 #160;/ 6 $. Sol atteint 53,6 sur Agents' Last Exam, un benchmark professionnel long-horizon couvrant 55 métiers, soit 13,1 points au-dessus de Claude Fable 5 en mode reasoning adaptatif. La famille introduit Ultra Mode (coordination d'agents parallèles) et Programmatic Tool Calling, qui laisse le modèle écrire du JavaScript pour orchestrer ses outils Product.Anthropic, de son côté, avait publié Claude Sonnet 5 le 30 juin, positionné comme « le Sonnet le plus agentic ». Contexte 1 M tokens, sortie 128 K, pricing intro 2 #160;/ 10 $ jusqu'au 31 août 2026, puis 3
#160;/ 15 $. Sonnet 5 remplace Sonnet 4.6 comme modèle par défaut sur Claude.ai Free et Pro. Sur les benchmarks coding et agent, Sonnet 5 et GPT-5.6 Sol sont en tir croisé, chacun devant sur des sous-familles précises. Ce qui compte pour un acheteur entreprise : à budget mensuel équivalent, un développeur qui active Sonnet 5 en Claude Code consomme trois à cinq fois moins de tokens qu'en session Cursor Composer 2.5 branchée sur GPT-5.6 Sol, selon les remontées communautaires de juillet. Le tarif affiché ne dit pas tout ; la trajectoire d'usage réel non plus.Mistral renomme Le Chat en Vibe : l'Europe copie le playbook agent
Fin juillet, Mistral a acté la disparition de la marque Le Chat. Le nouveau produit s'appelle Vibe. Une seule licence couvre chat conversationnel et code, avec un Work Mode disponible sur web et mobile, mode agent long-horizon qui choisit lui-même les outils, streame la progression et boucle des tâches multi-étapes. La bascule est un aveu : « Le Chat » évoquait un chatbot, or le marché B2B n'achète plus de chatbot en 2026, il achète des agents. Vibe reproduit donc le vocabulaire imposé par OpenAI (Agents, Operator), Google (Deep Research, Agent Space) et Anthropic (Claude with tools, Computer Use) Product.
La copie de vocabulaire suffit-elle à combler l'écart de capacité modèle ? Mistral Large 3 reste techniquement en dessous de la frontière Sonnet 5 / GPT-5.6 Sol sur les benchmarks publics. La force restante : souveraineté données, contrats grands comptes en France et en Allemagne, respect natif du cadre AI Act européen, dont les obligations high-risk ont été repoussées à décembre 2027 via le Digital Omnibus signé le 8 juillet 2026 par le Conseil et le Parlement. Vibe est donc un pari commercial autant que produit : gagner du temps sur la friction achat, en attendant Mistral Large 4. Pour un DSI européen, l'arbitrage réel se joue sur trois axes : latence réseau (Mistral héberge dans l'UE), tarif volume (souvent plus agressif que les US), et disponibilité d'un support technique francophone.
Open source et runtimes locaux : l'écart se resserre encore d'un cran
Au-delà de Kimi K3, la semaine a livré trois signaux forts sur l'open weights. DeepSeek V4 Pro reste devant sur les benchmarks code et math en licence MIT. MiniMax M3 propose 1 million de contexte multimodal natif, en poids ouverts, à des tarifs API dix fois inférieurs aux propriétaires équivalents. Qwen 3.6 conserve la licence Apache 2.0 et une couverture multilingue supérieure à celle de Llama sur les langues asiatiques et arabes. GLM-5.2 tient MIT avec 1 M de contexte. Sur des tâches quotidiennes de développement, de recherche documentaire ou de rédaction, l'écart mesuré entre le meilleur open weights et le meilleur propriétaire est passé sous la barre des dix points de pourcentage sur les leaderboards principaux Success.
Le coût, lui, reste 4 à 10 fois inférieur pour l'open source, en particulier quand on héberge en local via Ollama, LM Studio, vLLM ou llama.cpp. La communauté runtimes locaux a pris date : Ollama et LM Studio annoncent la prise en charge de Kimi K3 dès la publication des poids le 27 juillet 2026, et vLLM a mergé un patch pour l'attention hybride KDA quelques heures après la publication du modèle. Pour une équipe technique de moins de vingt personnes, la question n'est plus « open ou propriétaire » mais « quelle combinaison sur quelle brique du workflow ». La granularité décisionnelle est en train de descendre au niveau de la tâche, plus du modèle.
Testez votre lecture de la semaine
Combien de paramètres compte Kimi K3, publié par Moonshot AI le 16 juillet 2026 ?
Quel modèle Google DeepMind a-t-il scrappé pour reconstruire from scratch avant Gemini 3.6 Flash ?
Combien SK Hynix a-t-il levé lors de son IPO Nasdaq du 6 juillet 2026 ?
Quel est le pricing intro de Claude Sonnet 5 (entrée / sortie par million de tokens, valable jusqu'au 31 août 2026) ?
Quel est le nouveau nom de l'assistant IA de Mistral, ex-Le Chat ?
Pour aller plus loin
La véritable question n'est plus quel modèle utiliser, mais quelle combinaison assembler par tâche. Sonnet 5 pour le code long-horizon, GPT-5.6 Sol pour la coordination d'agents, Kimi K3 pour l'inférence massive en frontend, DeepSeek V4 Pro pour le raisonnement math en local, Mistral Vibe pour la conformité UE. Aucun de ces choix n'est définitif au-delà de trois mois. C'est justement ce que la newsletter documente, chaque semaine, sans complaisance envers un labo particulier.