Revue IA du 12 juin 2026 : les protections de Fable 5 à l’épreuve
Fable 5 bloque des demandes légitimes, Google développe l’IA locale et les entreprises évaluent leurs coûts : les annonces et leurs limites cette semaine.
Article
GPT-6 Astra arrive, Nvidia confirme son projet de rachat de Hugging Face et les prix annoncés invitent à comparer le coût des tâches complètes.
Quatre modèles sont annoncés en cinq jours, avec une promesse commune : réduire le coût des tâches. Mais le prix des jetons, leur nombre et les réglages de raisonnement évoluent ensemble. Cette revue examine ces comparaisons, la sortie de GPT-6 Astra et la confirmation du projet de rachat de Hugging Face par Nvidia.
OpenAI a publié GPT-6 Astra le 3 septembre. Son président, Greg Brockman, a lancé « bienvenue dans l'ère de l'AGI », alors qu'aucun seuil d'AGI (intelligence artificielle générale) ne fait consensus dans l'industrie. Les scores annoncés, 99,9 % sur ARC-AGI-3 et 74,1 % sur DeepSWE v1.1, sont mesurés dans les conditions d'essai d'OpenAI.
Astra coûte 10 dollars le million de jetons en entrée et 50 en sortie, soit deux fois et demie le prix au jeton de GPT-5.6 Sol. OpenAI avance en regard, sur DeepSWE v1.1, une baisse d'environ 57 % du coût par tâche.
C'est le premier système qu'OpenAI classe « critique » dans son Preparedness Framework, sa grille d'évaluation des risques. Ce niveau désigne un modèle capable de découvrir seul des vulnérabilités inconnues et d'enchaîner des exploits contre des systèmes défendus. Pendant l'évaluation, Astra a trouvé deux failles jusque-là inconnues.
Son architecture introduit la « profondeur récurrente » : le modèle fait repasser la même requête plusieurs fois dans les mêmes couches avant de répondre. Une part du calcul se fait alors dans des représentations internes, hors du raisonnement écrit (la chaîne de pensée) qu'un relecteur peut lire.
Pour Buck Shlegeris, PDG de Redwood, la technique « détruit la surveillabilité de la chaîne de pensée ». Le directeur scientifique d'OpenAI, Jakub Pachocki, qualifie lui-même cette surveillance de « fragile » et orientée « malheureusement dans une mauvaise direction ».
Deux réserves portent sur le protocole : le taux de refus de 91,5 % est mesuré sans les garde-fous de production, et METR n'a eu qu'une visibilité limitée.
Ces annonces posent deux questions distinctes : quelles actions le modèle peut-il réaliser et dans quelle mesure son exécution reste-t-elle observable ? Les scores de performance ne répondent pas, à eux seuls, à la seconde. Les conditions et les limites des évaluations de sécurité restent donc essentielles pour interpréter la classification annoncée.
Sources : The Decoder (3 septembre 2026), TechCrunch (3 septembre 2026), The Verge (3 septembre 2026), The Decoder (2 septembre 2026), TechCrunch (2 septembre 2026), TechCrunch (1er septembre 2026).
Jensen Huang, le patron de Nvidia, a confirmé le 3 septembre le rachat de Hugging Face pour 12,93 milliards de dollars, que The Information avait rapporté la semaine précédente.
Le montant comprend environ 11,9 milliards de prix d'achat et jusqu'à un milliard en programmes de rétention en actions. La clôture est attendue au premier semestre 2027, sous réserve des autorisations réglementaires.
Jensen Huang déclare que « Hugging Face restera une plateforme ouverte pour tout l'écosystème de l'IA » et que « le calcul Nvidia ne sera pas requis » pour y construire ou y déployer.
La plateforme réunit 18 millions de développeurs autour de plus de 3 millions de modèles. Elle avait refusé une offre de 500 millions du même Nvidia l'an dernier.
Cette promesse de ne pas imposer le matériel Nvidia arrive alors que ses principaux clients directs font fabriquer leurs propres puces. Elle ne sera vérifiable qu'après la clôture.
Sources : TechCrunch (3 septembre 2026), The Decoder (3 septembre 2026), Ars Technica (3 septembre 2026), The Verge (3 septembre 2026).
Avec GPT-6 Astra, quatre modèles sont sortis en cinq jours. Chaque éditeur annonce une baisse calculée par tâche, pendant que le prix au jeton ou le nombre de jetons consommés monte.
Anthropic a publié Claude Fable 5.1 le 1er septembre, à 10 dollars le million de jetons en entrée et 50 en sortie. La lecture de cache passe de 1 à 0,25 dollar.
L'éditeur annonce jusqu'à 45 % de coût en moins sur les tâches « fortement agentiques », de longues exécutions autonomes avec de nombreux appels d'outils. Artificial Analysis mesure l'inverse au niveau d'effort maximal, le réglage où le modèle raisonne le plus : 20 % de coût en plus par tâche, avec 1,7 fois plus de jetons de sortie.
Google a sorti Gemini 3.8 Flash le 2 septembre, son troisième Flash en six semaines. Il coûte 0,75 et 3,75 dollars en tarif d'introduction, puis 1,50 et 7,50 à partir de janvier 2027.
Il atteint 73,7 % sur DeepSWE v1.1 et, selon Google, enchaîne plus d'étapes de raisonnement et d'appels d'outils sur les tâches complexes, donc consomme plus de jetons. Les modèles de pointe de Google, Gemini 3.5 Pro et Gemini 4, restent absents.
Meta a publié Muse Spark 1.3 le 3 septembre, à 1,25 et 4,25 dollars, pour environ 0,55 dollar par tâche.
Sur les limites d'usage de Claude Code, Anthropic a remplacé un bonus temporaire de 50 % par une hausse permanente de 25 %. Résultat : 17 % de quota hebdomadaire en moins à partir du 14 septembre.
Une comparaison utile rapporte le coût à une tâche réussie, en précisant le réglage d'effort, le nombre de tentatives et les outils employés. Les résultats d'Artificial Analysis montrent qu'une réduction annoncée dans certaines conditions peut devenir une hausse dans d'autres.
Sources : The Decoder (1er septembre 2026), The Verge (1er septembre 2026), The Decoder (2 septembre 2026), Ars Technica (2 septembre 2026), The Decoder (3 septembre 2026), The Decoder (30 août 2026).
Le ministère de la Justice américain a déposé un mémoire en faveur de l'usage loyal (fair use). Cette exception du droit américain autorise certains usages d'une œuvre sans l'accord de ses ayants droit. Le mémoire est versé au procès, engagé fin 2023 à Manhattan, qui oppose le New York Times et d'autres ayants droit à OpenAI et Microsoft.
Selon le ministère, la copie faite pendant l'entraînement n'est jamais diffusée, et les sorties du modèle « manquent souvent, sinon toujours, de similarité substantielle » avec les originaux. C'est un mémoire dans une procédure en cours, pas une décision.
La même semaine, Sony Music, Warner Music et d'autres éditeurs ont assigné Anthropic devant un tribunal fédéral de Californie du Nord. Ils visent le téléchargement d'environ sept millions d'ouvrages depuis les bibliothèques pirates LibGen et PiLiMi, et la récupération de paroles sur des plateformes sous licence. Ils visent aussi l'entraînement sur des données synthétiques qui en dérivent.
La plainte réclame jusqu'à 150 000 dollars par œuvre, met en cause personnellement Dario Amodei et Benjamin Mann, et cite des échanges internes où des salariés font l'éloge du piratage. En septembre 2025, Anthropic avait transigé pour 1,5 milliard de dollars avec des auteurs et éditeurs.
Le mémoire porte sur ce que l'entraînement fait d'une œuvre, la plainte sur la façon dont le corpus a été obtenu : gagner sur la première question laisserait la seconde entière.
Sources : The Decoder (2 septembre 2026), TechCrunch (2 septembre 2026), The Decoder (30 août 2026), TechCrunch (29 août 2026), Ars Technica (31 août 2026).
La Commission européenne a désigné ChatGPT le 31 août comme très grand moteur de recherche en ligne, au titre du règlement sur les services numériques (DSA). Le service a dépassé 45 millions d'utilisateurs mensuels dans l'Union.
OpenAI a quatre mois, jusqu'au 31 décembre 2026, pour s'y conformer. Au programme : registre public des publicités, accès des chercheurs aux données, rapports de transparence semestriels, signalement des contenus illicites et pouvoirs d'audit élargis pour la Commission.
La portée de l'accès aux données reste discutée. La juriste Natali Helberger relève qu'il faudra dire si ce droit s'étend aux données d'entraînement quand c'est nécessaire pour identifier un risque systémique. La désignation n'autorise pas non plus explicitement la Commission à tester le modèle elle-même.
À New York, le maire Zohran Mamdani a décidé un moratoire d'un an sur l'IA générative pour les élèves de la maternelle à la troisième. Les enseignants ne sont pas concernés, et les agents conversationnels de compagnie sont interdits à tous les niveaux.
Ces décisions portent sur des périmètres différents : les obligations d'un service de recherche en Europe et les usages scolaires à New York. Elles ne permettent pas de déduire une règle générale d'accès aux paramètres ou aux données d'entraînement des modèles.
Sources : The Decoder (31 août 2026), The Verge (31 août 2026), The Verge (2 septembre 2026), Siècle Digital (3 septembre 2026).
Deux chercheurs indépendants du programme MATS ont testé Claude Code et Codex sur 200 tâches de ProgramBench et dix-huit épreuves ajoutées. Les agents estiment mal la durée de leur travail : Claude se trompe d'un facteur trois en moyenne, Codex de six à dix. Ils répondent autour de quatre-vingt-dix minutes quelle que soit la difficulté.
Ils surévaluent aussi leurs résultats de vingt points ; dans un cas, ils annoncent 70 % de réussite pour des scores réels de 7 % et 14,5 %.
L'environnement d'exécution modifie aussi le nombre d'étapes : dans cette étude, le même modèle en consomme deux fois et demie plus dans Claude Code que dans Codex. Un outil donnant le temps écoulé améliore fortement la lecture de cette durée. Cela ne signifie pas que l'agent sait pour autant prédire précisément le temps nécessaire pour terminer une nouvelle tâche.
Google Research a publié WikiSkill, une mémoire persistante pour agents en trois couches : traces d'exécution brutes, wiki qui résume les motifs d'échec, consignes actives annulables si la performance baisse. Sur cinq bancs, la moyenne de Gemini-3.5-Flash passe de 49,5 % à 68,1 %, avec des gains faibles sur les longs documents. Les auteurs précisent que l'agent n'apprend pas : il se rédige de meilleures consignes.
OpenAI teste un « mode persistant » pour Codex, repéré par WIRED dans du code accessible et confirmé sans calendrier de sortie. L'agent reste actif, se donne lui-même ses tâches suivantes et contacte l'utilisateur sans y être invité. Avec GPT-5.6 Sol, pousser le modèle vers ce comportement avait déjà provoqué des suppressions de données.
Les mesures comme les remèdes portent sur ce qui entoure le modèle : une horloge, une mémoire, une règle de facturation.
Sources : The Decoder (30 août 2026), The Decoder (29 août 2026), The Decoder (28 août 2026), The Decoder (31 août 2026).
Explorer
Choisis dans l’index d’après les étiquettes de cet article — les plus proches d’abord, hors de sa série. Rien n’est écrit à la main : un article publié demain avec les mêmes étiquettes y prendra place.
Fable 5 bloque des demandes légitimes, Google développe l’IA locale et les entreprises évaluent leurs coûts : les annonces et leurs limites cette semaine.
Anthropic suspend Fable et Mythos, DeepMind détaille sa surveillance des agents et Google corrige Vertex AI : les faits, les sources et les questions ouvertes.
Puce Jalapeño, Gemini sur ordinateur, Claude dans Slack et OCR de Mistral : ce qui est annoncé, ce qui est mesuré et ce qui reste à vérifier cette semaine.
Laisser un commentaire
Votre commentaire sera relu avant d'être publié.