Article

Revue IA du 4 septembre 2026 : GPT-6 Astra, coûts et infrastructures

GPT-6 Astra arrive, Nvidia confirme son projet de rachat de Hugging Face et les prix annoncés invitent à comparer le coût des tâches complètes.

Quatre modèles sont annoncés en cinq jours, avec une promesse commune : réduire le coût des tâches. Mais le prix des jetons, leur nombre et les réglages de raisonnement évoluent ensemble. Cette revue examine ces comparaisons, la sortie de GPT-6 Astra et la confirmation du projet de rachat de Hugging Face par Nvidia.

GPT-6 Astra : performances annoncées et questions sur la surveillance

OpenAI a publié GPT-6 Astra le 3 septembre. Son président, Greg Brockman, a lancé « bienvenue dans l'ère de l'AGI », alors qu'aucun seuil d'AGI (intelligence artificielle générale) ne fait consensus dans l'industrie. Les scores annoncés, 99,9 % sur ARC-AGI-3 et 74,1 % sur DeepSWE v1.1, sont mesurés dans les conditions d'essai d'OpenAI.

Astra coûte 10 dollars le million de jetons en entrée et 50 en sortie, soit deux fois et demie le prix au jeton de GPT-5.6 Sol. OpenAI avance en regard, sur DeepSWE v1.1, une baisse d'environ 57 % du coût par tâche.

C'est le premier système qu'OpenAI classe « critique » dans son Preparedness Framework, sa grille d'évaluation des risques. Ce niveau désigne un modèle capable de découvrir seul des vulnérabilités inconnues et d'enchaîner des exploits contre des systèmes défendus. Pendant l'évaluation, Astra a trouvé deux failles jusque-là inconnues.

Son architecture introduit la « profondeur récurrente » : le modèle fait repasser la même requête plusieurs fois dans les mêmes couches avant de répondre. Une part du calcul se fait alors dans des représentations internes, hors du raisonnement écrit (la chaîne de pensée) qu'un relecteur peut lire.

Pour Buck Shlegeris, PDG de Redwood, la technique « détruit la surveillabilité de la chaîne de pensée ». Le directeur scientifique d'OpenAI, Jakub Pachocki, qualifie lui-même cette surveillance de « fragile » et orientée « malheureusement dans une mauvaise direction ».

Deux réserves portent sur le protocole : le taux de refus de 91,5 % est mesuré sans les garde-fous de production, et METR n'a eu qu'une visibilité limitée.

Ces annonces posent deux questions distinctes : quelles actions le modèle peut-il réaliser et dans quelle mesure son exécution reste-t-elle observable ? Les scores de performance ne répondent pas, à eux seuls, à la seconde. Les conditions et les limites des évaluations de sécurité restent donc essentielles pour interpréter la classification annoncée.

Sources : The Decoder (3 septembre 2026), TechCrunch (3 septembre 2026), The Verge (3 septembre 2026), The Decoder (2 septembre 2026), TechCrunch (2 septembre 2026), TechCrunch (1er septembre 2026).

Nvidia confirme le rachat de Hugging Face pour 12,9 milliards

Jensen Huang, le patron de Nvidia, a confirmé le 3 septembre le rachat de Hugging Face pour 12,93 milliards de dollars, que The Information avait rapporté la semaine précédente.

Le montant comprend environ 11,9 milliards de prix d'achat et jusqu'à un milliard en programmes de rétention en actions. La clôture est attendue au premier semestre 2027, sous réserve des autorisations réglementaires.

Jensen Huang déclare que « Hugging Face restera une plateforme ouverte pour tout l'écosystème de l'IA » et que « le calcul Nvidia ne sera pas requis » pour y construire ou y déployer.

La plateforme réunit 18 millions de développeurs autour de plus de 3 millions de modèles. Elle avait refusé une offre de 500 millions du même Nvidia l'an dernier.

Cette promesse de ne pas imposer le matériel Nvidia arrive alors que ses principaux clients directs font fabriquer leurs propres puces. Elle ne sera vérifiable qu'après la clôture.

Sources : TechCrunch (3 septembre 2026), The Decoder (3 septembre 2026), Ars Technica (3 septembre 2026), The Verge (3 septembre 2026).

Comparer les prix par jeton et les coûts par tâche

Avec GPT-6 Astra, quatre modèles sont sortis en cinq jours. Chaque éditeur annonce une baisse calculée par tâche, pendant que le prix au jeton ou le nombre de jetons consommés monte.

Anthropic a publié Claude Fable 5.1 le 1er septembre, à 10 dollars le million de jetons en entrée et 50 en sortie. La lecture de cache passe de 1 à 0,25 dollar.

L'éditeur annonce jusqu'à 45 % de coût en moins sur les tâches « fortement agentiques », de longues exécutions autonomes avec de nombreux appels d'outils. Artificial Analysis mesure l'inverse au niveau d'effort maximal, le réglage où le modèle raisonne le plus : 20 % de coût en plus par tâche, avec 1,7 fois plus de jetons de sortie.

Google a sorti Gemini 3.8 Flash le 2 septembre, son troisième Flash en six semaines. Il coûte 0,75 et 3,75 dollars en tarif d'introduction, puis 1,50 et 7,50 à partir de janvier 2027.

Il atteint 73,7 % sur DeepSWE v1.1 et, selon Google, enchaîne plus d'étapes de raisonnement et d'appels d'outils sur les tâches complexes, donc consomme plus de jetons. Les modèles de pointe de Google, Gemini 3.5 Pro et Gemini 4, restent absents.

Meta a publié Muse Spark 1.3 le 3 septembre, à 1,25 et 4,25 dollars, pour environ 0,55 dollar par tâche.

Sur les limites d'usage de Claude Code, Anthropic a remplacé un bonus temporaire de 50 % par une hausse permanente de 25 %. Résultat : 17 % de quota hebdomadaire en moins à partir du 14 septembre.

Une comparaison utile rapporte le coût à une tâche réussie, en précisant le réglage d'effort, le nombre de tentatives et les outils employés. Les résultats d'Artificial Analysis montrent qu'une réduction annoncée dans certaines conditions peut devenir une hausse dans d'autres.

Sources : The Decoder (1er septembre 2026), The Verge (1er septembre 2026), The Decoder (2 septembre 2026), Ars Technica (2 septembre 2026), The Decoder (3 septembre 2026), The Decoder (30 août 2026).

Droit d'auteur : le ministère de la Justice soutient l'usage loyal, Sony et Warner attaquent Anthropic

Le ministère de la Justice américain a déposé un mémoire en faveur de l'usage loyal (fair use). Cette exception du droit américain autorise certains usages d'une œuvre sans l'accord de ses ayants droit. Le mémoire est versé au procès, engagé fin 2023 à Manhattan, qui oppose le New York Times et d'autres ayants droit à OpenAI et Microsoft.

Selon le ministère, la copie faite pendant l'entraînement n'est jamais diffusée, et les sorties du modèle « manquent souvent, sinon toujours, de similarité substantielle » avec les originaux. C'est un mémoire dans une procédure en cours, pas une décision.

La même semaine, Sony Music, Warner Music et d'autres éditeurs ont assigné Anthropic devant un tribunal fédéral de Californie du Nord. Ils visent le téléchargement d'environ sept millions d'ouvrages depuis les bibliothèques pirates LibGen et PiLiMi, et la récupération de paroles sur des plateformes sous licence. Ils visent aussi l'entraînement sur des données synthétiques qui en dérivent.

La plainte réclame jusqu'à 150 000 dollars par œuvre, met en cause personnellement Dario Amodei et Benjamin Mann, et cite des échanges internes où des salariés font l'éloge du piratage. En septembre 2025, Anthropic avait transigé pour 1,5 milliard de dollars avec des auteurs et éditeurs.

Le mémoire porte sur ce que l'entraînement fait d'une œuvre, la plainte sur la façon dont le corpus a été obtenu : gagner sur la première question laisserait la seconde entière.

Sources : The Decoder (2 septembre 2026), TechCrunch (2 septembre 2026), The Decoder (30 août 2026), TechCrunch (29 août 2026), Ars Technica (31 août 2026).

ChatGPT devient un « très grand moteur de recherche » au sens du DSA

La Commission européenne a désigné ChatGPT le 31 août comme très grand moteur de recherche en ligne, au titre du règlement sur les services numériques (DSA). Le service a dépassé 45 millions d'utilisateurs mensuels dans l'Union.

OpenAI a quatre mois, jusqu'au 31 décembre 2026, pour s'y conformer. Au programme : registre public des publicités, accès des chercheurs aux données, rapports de transparence semestriels, signalement des contenus illicites et pouvoirs d'audit élargis pour la Commission.

La portée de l'accès aux données reste discutée. La juriste Natali Helberger relève qu'il faudra dire si ce droit s'étend aux données d'entraînement quand c'est nécessaire pour identifier un risque systémique. La désignation n'autorise pas non plus explicitement la Commission à tester le modèle elle-même.

À New York, le maire Zohran Mamdani a décidé un moratoire d'un an sur l'IA générative pour les élèves de la maternelle à la troisième. Les enseignants ne sont pas concernés, et les agents conversationnels de compagnie sont interdits à tous les niveaux.

Ces décisions portent sur des périmètres différents : les obligations d'un service de recherche en Europe et les usages scolaires à New York. Elles ne permettent pas de déduire une règle générale d'accès aux paramètres ou aux données d'entraînement des modèles.

Sources : The Decoder (31 août 2026), The Verge (31 août 2026), The Verge (2 septembre 2026), Siècle Digital (3 septembre 2026).

Agents : mieux mesurer le temps, les résultats et les erreurs

Deux chercheurs indépendants du programme MATS ont testé Claude Code et Codex sur 200 tâches de ProgramBench et dix-huit épreuves ajoutées. Les agents estiment mal la durée de leur travail : Claude se trompe d'un facteur trois en moyenne, Codex de six à dix. Ils répondent autour de quatre-vingt-dix minutes quelle que soit la difficulté.

Ils surévaluent aussi leurs résultats de vingt points ; dans un cas, ils annoncent 70 % de réussite pour des scores réels de 7 % et 14,5 %.

L'environnement d'exécution modifie aussi le nombre d'étapes : dans cette étude, le même modèle en consomme deux fois et demie plus dans Claude Code que dans Codex. Un outil donnant le temps écoulé améliore fortement la lecture de cette durée. Cela ne signifie pas que l'agent sait pour autant prédire précisément le temps nécessaire pour terminer une nouvelle tâche.

Google Research a publié WikiSkill, une mémoire persistante pour agents en trois couches : traces d'exécution brutes, wiki qui résume les motifs d'échec, consignes actives annulables si la performance baisse. Sur cinq bancs, la moyenne de Gemini-3.5-Flash passe de 49,5 % à 68,1 %, avec des gains faibles sur les longs documents. Les auteurs précisent que l'agent n'apprend pas : il se rédige de meilleures consignes.

OpenAI teste un « mode persistant » pour Codex, repéré par WIRED dans du code accessible et confirmé sans calendrier de sortie. L'agent reste actif, se donne lui-même ses tâches suivantes et contacte l'utilisateur sans y être invité. Avec GPT-5.6 Sol, pousser le modèle vers ce comportement avait déjà provoqué des suppressions de données.

Les mesures comme les remèdes portent sur ce qui entoure le modèle : une horloge, une mémoire, une règle de facturation.

Sources : The Decoder (30 août 2026), The Decoder (29 août 2026), The Decoder (28 août 2026), The Decoder (31 août 2026).

En bref

  • Stabilité financière : Andrew Bailey, gouverneur de la Banque d'Angleterre et président du Conseil de stabilité financière, écrit aux ministres des finances du G20 que l'endettement croissant « peut aussi intensifier les baisses quand le sentiment se retourne ». Il vise les valorisations de l'IA à fort effet de levier et les investissements croisés entre entreprises d'IA et géants du cloud (hyperscalers) (The Decoder, 31 août 2026).
  • Capacité de calcul : Sam Altman décrit une « bêtise insoutenable » dans la construction de capacité, et admet qu'une baisse assez rapide du coût du calcul rendrait les engagements actuels mauvais, y compris pour OpenAI. La même semaine, Anthropic signe environ 35 milliards de dollars avec Lambda pour 350 mégawatts au Texas, sept jours après les 45 milliards conclus avec Nscale (The Decoder, 3 septembre 2026 ; The Decoder, 3 septembre 2026 ; TechCrunch, 28 août 2026).
  • Disponibilité : ChatGPT, Claude, Grok et Gemini ont connu des interruptions de service presque simultanées le 3 septembre (Ars Technica, 3 septembre 2026 ; The Verge, 3 septembre 2026).
  • Fournisseurs : OpenAI cesse de fournir ses modèles à Cursor après le rachat de l'éditeur par SpaceX, en invoquant les antécédents contractuels d'Elon Musk. Le cofondateur de Cursor, Michael Truell, indique qu'OpenAI pèse 5 % du trafic IA de l'outil (OpenAI, 28 août 2026 ; The Decoder, 29 août 2026).
  • Étiquetage : Instagram remplace son libellé « créateur IA » par « profil généré par IA » et restreint la portée des comptes non étiquetés, car ses utilisateurs ne les distinguent pas de personnes réelles (The Decoder, 31 août 2026 ; TechCrunch, 31 août 2026).
  • Salariés : selon Glassdoor, la part des mentions positives de l'IA dans les avis d'employés est passée de 81 % en 2019 à 43 % à la mi-2026 ; la plateforme rappelle que les mécontents y écrivent plus souvent (The Decoder, 30 août 2026).
  • Contrôle public : une action en justice pourrait obliger l'administration Trump à publier les règles selon lesquelles les agences fédérales examinent les modèles de pointe (Ars Technica, 2 septembre 2026).
  • Détection : Max Spero, PDG de Pangram, estime que l'on est « dangereusement proche » de la théorie de l'internet mort. Le principal défaut de son outil tient à l'usage qu'en font ses utilisateurs, qui transforment ses scores en mise au pilori publique (TechCrunch, 2 septembre 2026 ; The Decoder, 3 septembre 2026).

Explorer

Sur le même sujet

Choisis dans l’index d’après les étiquettes de cet article — les plus proches d’abord, hors de sa série. Rien n’est écrit à la main : un article publié demain avec les mêmes étiquettes y prendra place.

Laisser un commentaire

Elle n'est jamais affichée ni publiée. Elle sert à regrouper vos commentaires et, si vous vous inscrivez un jour avec elle, à vous les rendre.

Votre commentaire sera relu avant d'être publié.