Revue IA du 12 juin 2026 : les protections de Fable 5 à l’épreuve
Fable 5 bloque des demandes légitimes, Google développe l’IA locale et les entreprises évaluent leurs coûts : les annonces et leurs limites cette semaine.
Article
GPT-5.6, Grok et Muse Spark renouvellent les comparaisons. Une étude sur les élèves rappelle que réussir une tâche avec l’IA ne mesure pas l’apprentissage.
GPT-5.6, Grok 4.5 et Muse Spark 1.1 arrivent avec de nouveaux scores et tarifs. Les classements changent selon les tests, ce qui rend les comparaisons moins simples que les annonces. Une étude consacrée aux élèves pose une autre question : un meilleur devoir produit avec l'IA correspond-il à un meilleur apprentissage ? La revue examine les mesures et leurs limites.
OpenAI a lancé le 9 juillet GPT-5.6 en trois tailles, Sol, Terra et Luna. Elles coûtent 5 et 30 dollars, 2,5 et 15 dollars, 1 et 6 dollars par million de tokens en entrée et en sortie. La famille arrive avec ChatGPT Work, un agent adossé à Codex et à GPT-5.6 qui agit à travers les applications et les fichiers. L'application Codex rejoint la nouvelle application de bureau ChatGPT.
Selon OpenAI, Sol obtient 53,6 sur Agents' Last Exam, 13,1 points devant Claude Fable 5. Terra est juste au-dessus de Fable 5, et Luna devant Claude Opus 4.8. L'indice d'Artificial Analysis donne Sol à 59, un point sous Fable 5, Terra à 55 et Luna à 51, sous Grok 4.5 (54), lui-même derrière Opus 4.8. Sol y a aussi un taux d'hallucination (réponses inventées) supérieur à celui de GPT-5.5. L'AI Safety Institute dit avoir trouvé des contournements universels des protections à chaque cycle de tests.
Les classements évaluent des tâches différentes. Luna dépasse Opus 4.8 sur l'épreuve présentée par OpenAI, mais reste derrière lui dans l'indice d'Artificial Analysis. Pour choisir un modèle, il faut donc regarder les tâches représentatives de son usage et leur coût complet.
Artificial Analysis estime que Terra et Luna coûtent respectivement environ 50 % et 80 % de moins par tâche que Sol, avec quatre et huit points d'indice en moins. Ce compromis peut être plus utile qu'une première place globale.
Le même jour, OpenAI a présenté GPT-5.6 comme le « modèle préféré » de Microsoft 365 Copilot, dans Word, Excel, PowerPoint et Cowork. TechCrunch note que le terme n'est pas défini. L'annonce ne contredit pas non plus l'information de Bloomberg, parue en début de semaine : Microsoft remplace une partie des logiciels d'OpenAI par ses modèles internes MAI, pour réduire ses coûts. Rien n'indique quelle part des requêtes de Copilot reviendra à GPT-5.6.
Sources : OpenAI (9 juillet 2026), TechCrunch (9 juillet 2026), AINews (10 juillet 2026).
xAI, absorbée par SpaceX, a présenté Grok 4.5, entraîné avec Cursor, que SpaceX a annoncé vouloir racheter pour 60 milliards de dollars. Il coûte 2 dollars en entrée et 6 en sortie par million de tokens. Elon Musk le dit « à peu près comparable à Opus 4.7, mais bien plus rapide ». À sa sortie, Artificial Analysis le classait quatrième de son indice (54 points), derrière Fable 5, GPT-5.5 et Opus 4.8. Selon Le Monde Informatique, il produit en moyenne 15 954 tokens de sortie par tâche sur SWE-Bench Pro, contre plus de 67 000 pour Opus 4.8.
Meta a ouvert le 9 juillet Muse Spark 1.1 par API, sans publier les poids, à 1,25 dollar en entrée et 4,25 en sortie. Meta le destine aux charges agentiques lourdes, à la correction de bogues et aux grandes migrations de code. Dans le tableau de Meta, il mène quatre tests sur douze, Opus 4.8 cinq et GPT-5.5 trois. Sur SWE-Bench Pro, dont OpenAI conteste la validité, Opus 4.8 marque 69,2 contre 61,5. Le banc indépendant VALS-AI le classe quatrième, en le signalant rapide et économique.
Selon la référence retenue, ce tarif est bas ou ordinaire. The Decoder le rapporte aux 25 à 50 dollars par million de tokens de sortie d'Opus 4.8, de GPT-5.5 et de Fable 5. TechCrunch le juge dans la ligne de Claude Haiku 4.5 et de GPT-5.6 Luna, qui coûte 1 dollar en entrée et 6 en sortie. Les deux lancements se comparent en outre à l'ancienne génération : Meta oppose Muse Spark à GPT-5.5, et non à GPT-5.6, sorti le même jour. Selon The Decoder, Grok 4.5 n'a été que « quelques heures » le moins cher des modèles proches de la frontière (les modèles les plus avancés). Il se retrouve un point sous GPT-5.6 Terra, dont le token de sortie coûte 2,5 fois plus cher.
Sources : AINews (9 juillet 2026), Le Monde Informatique (9 juillet 2026), TechCrunch (9 juillet 2026), Siècle Digital (9 juillet 2026), The Decoder (9 juillet 2026).
Le New York Times et le Daily News demandent des sanctions contre OpenAI. Ils l'accusent d'avoir menti sur sa capacité à fouiller ses données d'entraînement et les conversations de ChatGPT pour y chercher leurs articles. Dans ce procès pour violation du droit d'auteur, OpenAI soutenait ne pas pouvoir interroger son corpus d'entraînement. Explorer les conversations serait, selon elle, techniquement lourd et poserait des problèmes de vie privée.
Selon les plaignants, la déposition de Vinnie Monaco, ingénieur d'OpenAI chargé de la protection des données, ordonnée par le tribunal et recueillie en avril, montre le contraire :
TechCrunch rappelle qu'OpenAI avait obtenu de ramener de 120 à 20 millions l'échantillon de journaux de conversation demandé. Celui remis en décembre était si caviardé que le tribunal l'a jugé « inutilisable ». Les plaignants accusent aussi OpenAI d'avoir effacé des milliards de réponses après la plainte, malgré une ordonnance de conservation.
Ils demandent d'écarter cet échantillon et de tenir pour établi que les journaux auraient montré une régurgitation importante de leurs contenus. Ils veulent aussi qu'OpenAI ne puisse plus soutenir le contraire, et paie les frais de cette recherche de preuves. OpenAI dément : les plaignants viseraient la vie privée de personnes étrangères à l'affaire, notamment par des « allégations manifestement fausses ».
À ce stade, TechCrunch rapporte les demandes des plaignants et la réponse d'OpenAI, pas une décision sur ces accusations. Les sanctions sollicitées modifieraient la manière dont le tribunal traite les preuves manquantes. Leur éventuelle adoption reste donc à distinguer des faits déjà établis dans le procès.
Sources : TechCrunch (9 juillet 2026), Siècle Digital (9 juillet 2026).
Une étude a suivi pendant trente mois plus de 26 000 élèves, du collège à la fin du lycée, dans un comté du centre de la Chine de plus d'un million d'habitants. L'usage déclaré de l'IA y passe de presque zéro à environ 80 %. Il saute aux sorties de DeepSeek V2.5, en septembre 2024, et de DeepSeek R1, en janvier 2025.
Six mois après leur premier usage, les notes de devoirs des élèves montent de 18 %, et le temps par devoir passe de 64 à 45 minutes. Dans le même temps, leurs notes aux examens mensuels sur table baissent de 20 %. Aux examens d'entrée au lycée et à l'université, le recul est du même ordre, de 18 à 24 %. Il s'accumule plus lentement, et n'apparaît en entier qu'au bout d'environ deux ans.
La perte se concentre chez ceux qui délèguent. Les utilisateurs qui passent autant de temps que leurs camarades sur leurs devoirs réussissent aussi bien les examens, avec de meilleurs devoirs. Et 81 % des élèves qui utilisent l'IA depuis plus de cinq mois bouclent leurs devoirs en moins de 50 minutes. La perte croît avec le temps d'usage hebdomadaire, d'environ 5 % pour une heure à 30 % au-delà de cinq heures. Elle touche davantage le tiers des meilleurs élèves (−24 %) que le tiers le plus faible (−16 %).
L'étude comporte des limites importantes pour interpréter ces écarts. Le début de l'usage est déclaré par les élèves. Attribuer les différences à l'IA suppose aussi que les groupes auraient évolué de façon comparable sans elle.
Les auteurs expliquent pourquoi le phénomène peut être peu visible dans une classe : chaque enseignant ne suit qu'une matière et la moyenne du comté n'avait baissé que d'environ 10 % en juin 2025. Les résultats invitent à distinguer la qualité d'un devoir assisté des connaissances mobilisables sans assistance.
Chez les utilisateurs aux notes de devoirs supérieures à la moyenne, une meilleure note de devoir annonce même un moins bon examen. Les auteurs recommandent de suivre le temps passé plutôt que la note, et de donner plus de poids aux examens en présentiel.
Source : The Decoder (4 juillet 2026).
Fidji Simo, directrice générale des Applications d'OpenAI depuis mai 2025, quitte ce poste à plein temps pour un rôle de conseillère à temps partiel. Le poste, créé à son arrivée, était rattaché à Sam Altman. Le directeur des opérations Brad Lightcap, la directrice financière Sarah Friar et le directeur produit Kevin Weil lui rendaient compte. Elle était en congé médical depuis avril pour la rechute d'une maladie neuro-immune, un congé plus long et plus difficile que prévu.
Sam Altman doit lui trouver un successeur alors qu'OpenAI, valorisée 852 milliards de dollars, envisage une introduction en Bourse. La croissance de ChatGPT a ralenti fin 2025, sous les objectifs internes de revenus. Kevin Weil a quitté l'entreprise, Brad Lightcap est passé à un rôle de « projets spéciaux », et la directrice marketing Kate Rouch est partie pour se consacrer à son rétablissement. TechCrunch juge l'équipe dirigeante « plutôt mince » vue de l'extérieur. Le départ de Simo laisse vacant l'échelon auquel rendaient compte les opérations, les finances et le produit.
Sources : The Verge (9 juillet 2026), TechCrunch (9 juillet 2026).
Explorer
Choisis dans l’index d’après les étiquettes de cet article — les plus proches d’abord, hors de sa série. Rien n’est écrit à la main : un article publié demain avec les mêmes étiquettes y prendra place.
Fable 5 bloque des demandes légitimes, Google développe l’IA locale et les entreprises évaluent leurs coûts : les annonces et leurs limites cette semaine.
Anthropic suspend Fable et Mythos, DeepMind détaille sa surveillance des agents et Google corrige Vertex AI : les faits, les sources et les questions ouvertes.
Puce Jalapeño, Gemini sur ordinateur, Claude dans Slack et OCR de Mistral : ce qui est annoncé, ce qui est mesuré et ce qui reste à vérifier cette semaine.
Laisser un commentaire
Votre commentaire sera relu avant d'être publié.