Kimi K3 fait tomber le mur : 2,8 trillions de paramètres open source arrivent lundi

— Agentia Academy

Kimi K3 fait tomber le mur : 2,8 trillions de paramètres open source arrivent lundi

En sept jours, la carte du marché IA s’est redéployée. Un labo chinois s’apprête à libérer le plus gros modèle open-weight jamais publié, AMD et Cerebras contre-attaquent NVIDIA sur l’inférence, et OpenAI réinvente la voix. Tour d’horizon d’une semaine qui déplace les positions.

.news-article { max-width: 760px; margin: 0 auto; line-height: 1.65; color: #1c1c1c; font-family: "Urbanist", -apple-system, BlinkMacSystemFont, "Segoe UI", "Helvetica Neue", Arial, sans-serif; -webkit-font-smoothing: antialiased; -moz-osx-font-smoothing: grayscale; } .news-article h1, .news-article h2, .news-article h3 { font-family: "Urbanist", -apple-system, BlinkMacSystemFont, "Segoe UI", "Helvetica Neue", Arial, sans-serif; font-weight: 700; color: #1a1a1a; } .news-article h1 { font-size: 2.1rem; line-height: 1.2; margin: 0 0 1.2rem; letter-spacing: -0.01em; } .news-article h2 { font-size: 1.45rem; margin: 2.4rem 0 0.8rem; letter-spacing: -0.005em; } .news-article p { margin: 0 0 1rem; } .news-article .aa-lede { font-size: 1.18rem; color: #2a2a2a; font-style: italic; margin-bottom: 1.8rem; } .news-article .aa-tldr { background: #faf6ef; border-left: 4px solid #6b4a1f; padding: 1.1rem 1.3rem; margin: 1.5rem 0 2rem; border-radius: 4px; } .news-article .aa-tldr ul { margin: 0.6rem 0 0; padding-left: 1.2rem; } .news-article .aa-tldr li { margin-bottom: 0.35rem; } /* Widget Deals */ .news-article .aa-deals-widget { margin: 2rem 0; border: 1px solid #e6dccb; border-radius: 8px; overflow: hidden; background: #fffdf8; } .news-article .aa-deals-filters { display: flex; flex-wrap: wrap; gap: 0.5rem; padding: 1rem; background: #f6efe2; border-bottom: 1px solid #e6dccb; } .news-article .aa-deals-filter { background: #fff; color: #4a3520; border: 1px solid #d4c6ad; padding: 0.45rem 0.95rem; border-radius: 999px; font-size: 0.88rem; font-weight: 500; cursor: pointer; transition: all 0.15s ease; font-family: inherit; } .news-article .aa-deals-filter:hover { background: #f3e9d3; border-color: #b69968; } .news-article .aa-deals-filter--active { background: #6b4a1f; color: #fff; border-color: #6b4a1f; } .news-article .aa-deals-widget table { width: 100%; border-collapse: collapse; font-size: 0.92rem; } .news-article .aa-deals-widget thead { background: #f6efe2; } .news-article .aa-deals-widget th { text-align: left; padding: 0.75rem 1rem; font-weight: 600; color: #4a3520; border-bottom: 1px solid #e6dccb; } .news-article .aa-deals-widget td { padding: 0.75rem 1rem; border-bottom: 1px solid #f0e8d6; vertical-align: top; } .news-article .aa-deals-widget tbody tr:last-child td { border-bottom: 0; } .news-article .aa-deals-widget tbody tr:hover { background: #faf6ef; } /* Badges */ .news-article .aa-badge { display: inline-block; padding: 0.18rem 0.55rem; border-radius: 4px; font-size: 0.78rem; font-weight: 600; line-height: 1.4; margin-right: 0.35rem; vertical-align: middle; } .news-article .aa-badge--funding { background: #fde8d2; color: #8a4b14; } .news-article .aa-badge--acquisition { background: #f4dcdc; color: #8a2a2a; } .news-article .aa-badge--partnership { background: #dde9f4; color: #1f4a7a; } .news-article .aa-badge--product { background: #e1ecd9; color: #2f5a1f; } .news-article .aa-badge--success { background: #d9eada; color: #1f5a2f; } .news-article .aa-badge--warning { background: #fbeccb; color: #7a5a14; } /* Quiz */ .news-article .aa-quiz { margin: 1.4rem 0; padding: 1.2rem 1.4rem; background: #fffdf8; border: 1px solid #e6dccb; border-left: 4px solid #b69968; border-radius: 6px; } .news-article .aa-quiz-question { font-weight: 600; margin: 0 0 0.9rem; color: #2a2a2a; } .news-article .aa-quiz-choice { display: block; width: 100%; text-align: left; background: #fff; color: #2a2a2a; border: 1px solid #d4c6ad; padding: 0.7rem 1rem; margin-bottom: 0.5rem; border-radius: 6px; font-size: 0.95rem; cursor: pointer; transition: all 0.15s ease; font-family: inherit; } .news-article .aa-quiz-choice:hover { background: #f6efe2; border-color: #b69968; } .news-article .aa-quiz-feedback { margin-top: 0.6rem; font-size: 0.9rem; color: #6b4a1f; font-style: italic; min-height: 1px; } /* Callouts */ .news-article [class^="aa-callout-"] { padding: 1rem 1.2rem; margin: 1.5rem 0; border-radius: 6px; border-left: 4px solid; } .news-article .aa-callout-info { background: #eaf2fb; border-color: #2a6bbf; color: #1c3a66; } .news-article .aa-callout-tip { background: #fdf3e0; border-color: #c97a1a; color: #6b3a0a; } .news-article .aa-callout-warning { background: #fbeccb; border-color: #b88012; color: #6b4a0a; } .news-article .aa-callout-success { background: #e1f0e3; border-color: #2f7a3a; color: #1c4a25; } /* Embed placeholder */ .news-article .aa-embed { margin: 1.5rem 0; padding: 1rem; background: #f6efe2; border: 1px dashed #b69968; border-radius: 6px; text-align: center; font-size: 0.85rem; color: #6b4a1f; } .news-article .aa-embed::before { content: "Embed video"; font-weight: 600; }

Kimi K3 fait tomber le mur : 2,8 trillions de paramètres open source arrivent lundi

En sept jours, la carte du marché IA s’est redéployée. Un labo chinois s’apprête à libérer le plus gros modèle open-weight jamais publié, AMD et Cerebras contre-attaquent NVIDIA sur l’inférence, et OpenAI réinvente la voix. Tour d’horizon d’une semaine qui déplace les positions.

Le résumé en 30 secondes
  • Moonshot AI publie Kimi K3, un MoE de 2 800 milliards de paramètres, poids ouverts le 27 juillet 2026.
  • AMD et Cerebras annoncent Helios × Wafer-Scale : +30% de tokens/$ vs le rack Vera Rubin de NVIDIA, +5× de tokens/s/W.
  • OpenAI déploie GPT-5.6 en trois tailles (Luna, Terra, Sol) et GPT-Live, voix à écoute et parole simultanées.
  • Together AI lève 800 M$ à 8,3 Md$ de valorisation, tour mené par le VC de Saudi Aramco.
  • Windsurf est officiellement renommé Devin Desktop après le rachat par Cognition.
DateActeurOpérationMontant / Détail
le 16 juillet 2026Moonshot AISortie Kimi K3 (API), poids ouverts le 27 juillet2 800 Md paramètres MoE, 16 experts sur 896 actifs par token
le 23 juillet 2026AMD × CerebrasIntégration Wafer-Scale Engine dans racks Helios+30% tokens/$ vs NVIDIA Vera Rubin NVL72, dispo Cerebras Cloud fin 2026
juillet 2026OpenAILancement GPT-5.6 (Luna, Terra, Sol) + GPT-LiveContexte 1M tokens, tarif 1–5$ / M input, voix full-duplex
le 21 juillet 2026Google DeepMindSortie Gemini 3.6 FlashFrontier compact, intégration Boston Dynamics Spot via Gemini Robotics-ER 1.6
juillet 2026Together AISérie C800 M$ à 8,3 Md$ post-money, lead Saudi Aramco VC
juillet 2026Tripo AIExtension Série A~150 M$, génération 3D
le 2 juin 2026CognitionRebranding Windsurf en Devin DesktopAprès le deal Google-fondateurs de 2,4 Md$ en licence
juillet 2026Yingzhi XBOTSérie B56 M$, robotique + IA

Kimi K3, l’électrochoc open source venu de Pékin

Moonshot AI a publié Kimi K3 en API le 16 juillet 2026 et promet la sortie des poids pour le 27 juillet. Le modèle est un Mixture of Experts sparse de 2 800 milliards de paramètres, dont seuls 16 experts sur 896 sont activés par token. C’est à ce jour le plus gros modèle open-weight jamais annoncé, et la performance suit le format.

Sur le benchmark Frontend Code Arena, Kimi K3 marque 1 679 points et devance Claude Fable 5 et GPT-5.6 Sol, les deux modèles propriétaires les plus récents du marché. Sur l’évaluation privée long-horizon d’Artificial Analysis, il progresse de +732 points d’Elo par rapport à Kimi K2.6, ce qui le place au niveau des meilleurs modèles propriétaires sur les tâches agentiques prolongées. Le message est double : la Chine continue de compresser l’écart frontier malgré les restrictions américaines sur les GPU haut de gamme, et l’écosystème open-weight devient une menace directe pour les modèles fermés sur le code et l’agentique.

Attention cependant à l’autohébergement : même sparse, un modèle à 2 800 milliards de paramètres exige un cluster GPU conséquent pour tourner en production. La démocratisation réelle passera par les fournisseurs d’inférence tiers (Together AI, Fireworks, Groq, Cerebras) plutôt que par le développeur solo.

AMD et Cerebras attaquent NVIDIA sur l’inférence

Le 23 juillet 2026, AMD et Cerebras Systems ont annoncé l’intégration de la Wafer-Scale Engine dans les racks Helios d’AMD. L’architecture est astucieuse : le prefill des prompts est confié à Helios, tandis que le decode (la génération token à token) est exécuté sur la WSE, qui garde les poids du modèle en mémoire on-chip. Selon AMD, l’ensemble délivre +30% de tokens par dollar par rapport au rack Vera Rubin NVL72 de NVIDIA et jusqu’à 5× plus de tokens par seconde et par watt.

La lecture stratégique est claire. NVIDIA a scellé en juin sa semi-acquisition de Groq pour déployer le rack LPX avec des LPU dédiées à la latence ultra-basse. AMD réplique en s’alliant avec Cerebras, qui est entrée en Bourse en mai 2026 à 185$ avant d’osciller entre 161$ et 386$. Le titre est remonté à 220$ après l’annonce du partenariat. Le marché de l’inférence quitte le monopole d’un accélérateur unique : les workloads sont découpés par phase (prefill, decode, batch, streaming) et attribués au silicium le plus adapté.

Conséquence pour les acheteurs : les prix des tokens vont continuer à baisser en 2027, et les architectures cloud vont se spécialiser. Le choix « NVIDIA par défaut » devient discutable pour toute charge d’inférence à grande échelle.

GPT-5.6 et GPT-Live : OpenAI répond par le produit

OpenAI a lancé la famille GPT-5.6 en trois déclinaisons : Luna, Terra et Sol. Les trois partagent une fenêtre de contexte de 1 million de tokens et un knowledge cutoff en février 2026. La tarification s’étale de 1$ à 5$ par million de tokens en entrée selon la variante, ce qui aligne le prix d’entrée sur celui de Gemini 3.6 Flash et met la pression sur Anthropic dont Claude Fable 5 reste positionné plus haut sur le raisonnement complexe.

L’annonce la plus notable reste GPT-Live. L’interaction voix sort du modèle walkie-talkie qui dominait depuis 2023 : le modèle écoute et parle en simultané, gère les interruptions naturelles et fait de la traduction temps réel. Pour un business, les cas d’usage évidents sont le SDR IA, le service client conversationnel, et le coaching linguistique en temps réel.

En face, Google DeepMind a sorti Gemini 3.6 Flash le 21 juillet et pousse fort sur la robotique via Boston Dynamics, qui intègre désormais Gemini Robotics-ER 1.6 dans le robot Spot et la plateforme d’inspection Orbit AI. Le déplacement du langage vers la vision-langage-action est amorcé.

Windsurf devient Devin Desktop, la consolidation des IDE agentiques s’accélère

Le 2 juin 2026, Windsurf a été officiellement renommé Devin Desktop après son rachat par Cognition, l’éditeur derrière Devin. Le contexte est spectaculaire : le rachat initial par OpenAI a capoté en juillet 2025, Google a payé 2,4 Md$ en licence pour embaucher les fondateurs, et Cognition a récupéré le produit orphelin. Une rumeur non confirmée circule sur un rachat de Cursor par SpaceX pour 60 Md

#8201;— à prendre avec les pinces qu’imposent les valorisations post-2026.

Sur le fond, Cursor a repensé son interaction autour de plusieurs agents en parallèle plutôt qu’un composer unique, avec des environnements cloud isolés exécutés sur des copies configurées du repo. Claude Code garde la plus forte satisfaction développeur du marché, avec 46% des répondants d’un sondage d’avril 2026 le déclarant « most loved », plus du double de Cursor (19%). Devin Desktop, lui, mise sur la fusion agent délégué-éditeur local.

Signal marqué du marché : 59% des développeurs interrogés utilisent trois outils IA ou plus en parallèle. Le combo type reste Cursor pour l’édition et Claude Code pour l’architecture et le debug. Le marché se concentre par le haut même si l’usage reste multi-outils.

Mistral Vibe et Meta Muse Spark : Europe et Meta jouent l’agent

Mistral a poursuivi la mue de son offre grand public : Le Chat est devenu Vibe, et Mistral Medium 3.5 (128 milliards de paramètres) unifie instruction, raisonnement et code dans un seul système. La proposition développeur tient sur trois piliers : connecteurs MCP custom, hooks et observabilité sur les agents distants, disponibles à partir du palier Pro. En parallèle, Mistral a ouvert un nouveau data center à Les Ulis pour proposer de l’inférence souveraine, un argument fort pour les grands comptes européens.

Meta n’est pas en reste avec Muse Spark 1.1, un modèle agentique à 1 million de tokens de contexte. La nouveauté la plus visible est l’ouverture de la première API développeur payante de Meta AI (public preview, 20$ de crédits gratuits, US-only au lancement). Muse Spark intègre computer use natif sur desktop, browser et mobile, et sait déléguer des sous-agents en parallèle pour couvrir une tâche composée.

La lecture ici est celle d’une convergence produit. Tous les acteurs frontier convergent vers le même pattern : long contexte, computer use, sous-agents parallèles, MCP comme protocole d’intégration. Le différenciateur devient l’écosystème (Slack, GitHub, connecteurs métier) et le prix, plus que la capacité brute.

Où va l’argent : levees, IPO et spécialisation B2B

Together AI a bouclé une série C de 800 M$ en juillet, portant la valorisation post-money à 8,3 Md$. Le tour est mené par le véhicule VC de Saudi Aramco, signal explicite d’un mouvement des capitaux souverains du Golfe vers l’inférence open source. Together AI se positionne comme le fournisseur neutre d’entraînement et d’inférence sur modèles open-weight, un créneau qui devient central maintenant que Kimi K3 et GLM-5.2 rivalisent avec les modèles fermés.

Le mois de juillet aura vu au total 1,8 Md$ investis dans les startups d’agents IA sur au moins 12 opérations, avec des valorisations moyennes en hausse de 40% trimestre sur trimestre à 280 M$. La spécialisation B2B rafle 58% du capital : les investisseurs préfèrent l’automatisation d’entreprise, plus monetizable, aux apps grand public. Cerebras, entrée en Bourse en mai, illustre la volatilité du secteur hardware : de 185$ à 386$ puis 161$ en six semaines, cours à 220$ après le deal AMD.

Enfin, un rappel réglementaire : les obligations de transparence de l’EU AI Act entrent en vigueur en août 2026, et la Commission a publié en juillet ses lignes directrices pour les fournisseurs. Toute entreprise déployant un LLM en Europe doit auditer maintenant sa chaîne de fournisseurs, ses obligations d’étiquetage des contenus générés et sa documentation technique.

Testez votre lecture de la semaine

Quelle est la taille annoncée de Kimi K3 en paramètres totaux ?

Selon AMD, quel est le gain de tokens/$ du couple Helios × Cerebras vs le rack Vera Rubin NVL72 de NVIDIA ?

Combien Together AI a-t-elle levé en série C en juillet 2026, et à quelle valorisation post-money ?

Sous quel nouveau nom Windsurf est-il désormais commercialisé ?

Quel est l’apport principal de GPT-Live par rapport aux versions voix précédentes ?

À retenir pour la semaine prochaine : le 27 juillet, guettez la publication des poids Kimi K3. Testez-le via un fournisseur d’inférence tiers (Together AI, Fireworks) avant de décider si vous migrez une charge de production. Et si vous opérez en Europe, ouvrez dès maintenant votre dossier de conformité EU AI Act : l’échéance transparence tombe le mois prochain.

← Toutes les actualités IA · Nos formations IA