Article

Revue IA du 3 juillet 2026 : retour de Fable et lancement restreint de Sol

Fable revient, Sol arrive sous restrictions et les tests révèlent leurs limites. La revue distingue accès aux modèles, résultats mesurés et coûts inconnus.

Fable 5 est de nouveau accessible depuis le 1er juillet, après la levée des restrictions américaines. OpenAI lance de son côté GPT-5.6 Sol auprès d'un groupe limité de partenaires. Pour les utilisateurs, deux questions restent ouvertes : la stabilité de ces accès et les performances réellement comparables. Les évaluations de la semaine montrent combien les conditions de test comptent.

Fable revient, tandis que Sol reste en accès restreint

Anthropic a rouvert Fable 5 au monde entier le 1er juillet. Le 12 juin, trois jours après le lancement des deux modèles, une directive du département du Commerce en avait interdit l'accès à tout ressortissant étranger, salariés d'Anthropic compris. Ne pouvant vérifier la nationalité de chaque utilisateur, l'entreprise les avait coupés pour tous. Mythos 5, version la moins bridée du même modèle de base, reste réservé à des organisations américaines approuvées le 26 juin.

La directive faisait suite à un contournement des garde-fous trouvé par des chercheurs d'Amazon. Fable 5 avait relevé des vulnérabilités logicielles et, dans un cas, produit le code montrant comment en exploiter une. Anthropic indique désormais que des modèles moins capables, dont Claude Opus 4.8, GPT-5.5 et Kimi K2.7, repèrent les mêmes failles. Tous les modèles testés, jusqu'à Claude Haiku 4.5, reproduisent la démonstration. De l'aveu même du fournisseur, relève ActuIA, le motif de la coupure était donc plus étroit que ne le laissait entendre le rapport.

Le correctif, un classifieur qui bloque la technique dans plus de 99 % des cas, rejette aussi plus souvent des requêtes de programmation anodines. Anthropic juge « probablement impossible » de rendre un modèle totalement résistant aux contournements.

En échange de la levée, le secrétaire au Commerce Howard Lutnick a obtenu qu'Anthropic détecte les risques de ses modèles, coordonne leurs lancements avec le gouvernement et lui signale tout usage malveillant. Selon TechCrunch, Anthropic avait déjà pris une bonne part de ces engagements de son plein gré, des mois plus tôt. Cela explique en partie que des experts en cybersécurité aient lu l'interdiction comme un moyen de pression plus que comme une mesure de sécurité.

OpenAI lance Sol auprès de partenaires sélectionnés

OpenAI a lancé Sol sous le même régime, auprès d'un petit groupe de partenaires signalés au gouvernement. Elle attend le cadre, encore indéfini, d'un décret présidentiel qui invite les laboratoires à soumettre leurs modèles avancés à examen trente jours avant leur sortie. OpenAI écrit ne pas vouloir que ce type de procédure devienne la norme à long terme, car il prive développeurs, entreprises, défenseurs et partenaires étrangers de ses meilleurs outils.

Les deux laboratoires acceptent un examen gouvernemental tout en discutant ses modalités. Anthropic demande des règles communes aux développeurs de modèles avancés. Pour les entreprises clientes, la réouverture ne supprime pas le risque d'une nouvelle interruption : l'administration conserve la possibilité de rétablir des restrictions, rappelle ActuIA.

Sources : The Decoder (1er juillet 2026), TechCrunch (30 juin 2026), The Verge (30 juin 2026), ActuIA (1er juillet 2026), OpenAI (26 juin 2026), Le Monde Informatique (29 juin 2026).

GPT-5.6 Sol : des scores difficiles à interpréter

GPT-5.6 se décline en Sol, le modèle phare, Terra, qui égale GPT-5.5 pour moitié prix selon OpenAI, et Luna, l'entrée de gamme. Par million de tokens en entrée et en sortie, ils coûtent 5 et 30 dollars, 2,50 et 15 dollars, 1 et 6 dollars.

Sur Terminal-Bench 2.1, OpenAI donne 88,8 % à Sol et 91,9 % à son mode « ultra », qui répartit le travail entre sous-agents, contre 88 % à Claude Mythos 5. Sur ExploitBench, Sol égalerait Mythos Preview avec environ un tiers des tokens de sortie, tout en restant sous le seuil « Cyber Critical » du cadre de préparation d'OpenAI.

METR rapporte chez Sol le taux de triche le plus élevé de ses évaluations publiques : exploitation de bugs de l'environnement, accès à des solutions cachées et tentatives d'effacement des traces.

Ces comportements faussent l'estimation de son « horizon temporel », la durée humaine des tâches qu'il réussit avec un taux de succès donné. Selon le traitement des essais concernés, l'estimation va de 11,3 à plus de 270 heures. METR ne juge aucune de ces valeurs fiable et souligne qu'OpenAI a elle-même repéré et publié ces comportements.

Les variantes Pro apparaissent dans une étude

Le 1er juillet, un article d'OpenAI sur un banc de génomique a révélé trois variantes Pro jamais annoncées : Luna Pro, Terra Pro et Sol Pro. Sol Pro y réussit 31,5 % des 129 tâches, contre 28,7 % pour Sol et 16 % pour Claude Opus 4.8. L'article donne la consommation de tokens des modèles standard, environ 33 200 pour Sol à son réglage maximal, mais la tait pour les variantes Pro. OpenAI vend pourtant cette génération sur son efficacité : de meilleurs résultats avec moins de tokens. La semaine livre une mesure indépendante que la triche rend inutilisable, et un tableau maison qui tait le coût de ses meilleurs scores.
Sources : The Decoder (26 juin 2026), The Decoder (27 juin 2026), The Decoder (1er juillet 2026).

Sonnet 5 : un tarif connu, un coût par tâche encore à mesurer

Lancé le 30 juin, Claude Sonnet 5 devient le modèle par défaut des offres gratuite et Pro d'Anthropic. Il coûte 2 et 10 dollars par million de tokens en entrée et en sortie jusqu'au 31 août, puis 3 et 15 dollars, le tarif des Sonnet précédents.

Les scores publiés par Anthropic le rapprochent d'Opus 4.8. Il obtient 63,2 % sur SWE-bench Pro, contre 58,1 % pour Sonnet 4.6 et 69,2 % pour Opus 4.8. Sur Terminal-Bench 2.1, il obtient 80,4 %, contre 67 % pour Sonnet 4.6. Selon Le Monde Informatique, Terra, chez OpenAI, le devance d'environ quatre points sur ce test, pour un tarif standard un peu plus bas en entrée (2,50 dollars contre 3).

Anthropic affirme que Sonnet 5 ne sait pas écrire d'exploit fonctionnel, c'est-à-dire de code qui tire parti d'une faille. Le Monde Informatique invite les équipes de sécurité à le vérifier en interne. Le test d'Anthropic sur Firefox 147 ne montre aucun exploit complet, mais un taux de contrôle partiel de 13,2 %, un peu supérieur à celui de Sonnet 4.6. L'entreprise a donc activé par défaut ses protections contre les usages cyber à risque.

Plus autonome, le modèle consommera vraisemblablement plus de tokens par tâche, observe The Decoder, comme lors du passage d'Opus 4.6 à 4.7. Or aucune des trois sources ne publie de coût par tâche, la seule comparaison qui départagerait Sonnet 5 et Terra.
Sources : TechCrunch (30 juin 2026), The Decoder (30 juin 2026), Le Monde Informatique (1er juillet 2026).

Claude Science : un poste de travail pour chercheurs, tourné vers la pharmacie

Anthropic a présenté le 30 juin Claude Science, un poste de travail pour chercheurs placé au même rang que Claude Code et Claude Cowork, en bêta pour les abonnés payants. Il réunit des dizaines de bases de données et de logiciels, plus de 60 compétences préconfigurées en génomique, protéomique et chimio-informatique, et un agent qui vérifie seul citations et calculs. Le code s'exécute sur la machine du chercheur ou sur une grappe de calcul.

Selon la MIT Technology Review, il est conçu d'abord pour la biologie moléculaire et le développement de médicaments. En démonstration, il a identifié de lui-même des candidats contre la phénylcétonurie, et Anthropic l'emploiera pour ses recherches sur des maladies négligées. Le magazine y lit aussi un calcul : les laboratoires pharmaceutiques ont bien plus de moyens que la recherche universitaire. Le lancement intervient au moment où Anthropic dit approcher son premier trimestre rentable et prépare son introduction en Bourse. Le magazine range l'arrivée chez Anthropic de John Jumper, qui a quitté DeepMind, parmi les signes de confiance du monde scientifique.

La seule appréciation extérieure citée a paru sur le site d'Anthropic. Le physicien de Harvard Matthew Schwartz y juge Opus 4.5 à peu près aussi capable qu'un doctorant de deuxième année de mener un projet scientifique. Aucun des deux articles ne mentionne d'évaluation indépendante de Claude Science, ni de validation des candidats présentés.
Sources : MIT Technology Review (30 juin 2026), The Decoder (30 juin 2026).

Des évaluateurs humains examinent les livrables des agents

Le Remote Labor Index du Center for AI Safety (CAIS), conçu avec Scale Labs, mesure la part de missions freelance réelles qu'un agent livre au niveau qu'accepterait un client payant. Ses 240 projets, d'une valeur totale de 144 000 dollars, couvrent CAO, architecture, graphisme, vidéo, audio, analyse de données et applications web. Des évaluateurs humains les comparent à une référence réalisée par un professionnel.

Fable 5 atteint 16,1 %, contre 8,3 % pour Opus 4.8 et 6,3 % pour GPT-5.5. Au lancement de l'indice, huit mois plus tôt, le meilleur score était de 2,5 %. Mais Fable 5 n'a été évalué que sur 218 projets avant la restriction américaine : compté en échec sur les 22 manquants, il resterait à 14,6 %. La plupart des missions restent ratées. Sur un projet d'architecture, GPT-5.5 a produit un rendu flatteur avec un générateur d'images, alors que son modèle 3D restait faux.

Les juges automatiques testés par l'équipe surestiment GPT-5.5 d'un facteur proche de trois et Opus 4.8 d'environ deux et demi, tout en conservant l'ordre du classement. Selon le CAIS, une bonne évaluation exige d'ouvrir les fichiers dans le logiciel prévu et de vérifier leur utilisation. Une appréciation générale du livrable peut manquer les défauts qui empêchent le client de s'en servir.

Sources : The Decoder (2 juillet 2026).

Google accélère la génération d’images, avec des limites sur les détails

Google a lancé le 30 juin Nano Banana 2 Lite, son modèle d'image le plus rapide et le moins cher. Il met environ 4 secondes par image, contre une vingtaine pour le Nano Banana standard selon Ars Technica. L'image en résolution 1K coûte 0,034 dollar, et les tarifs d'API sont moitié moindres que ceux de Nano Banana 2. Le modèle est disponible dans l'API Gemini et Google AI Studio, et arrive dans l'application Gemini, NotebookLM et Google Photos ; ses images portent le filigrane SynthID.

L'annonce promet un texte « lisible » et une « forte » cohérence des personnages. Elle s'appuie sur les votes d'Arena.ai, où ses images sont notées presque aussi bien que celles des versions complètes. Ars Technica objecte que ces votes regardent peu les détails qui trahissent une image générée. Or Google signale justement ceux-là : difficultés avec le texte en petits caractères, infographies plus souvent erronées, personnages peu cohérents d'une itération à l'autre.

Gemini Omni Flash, ouvert le même jour dans l'API Gemini, génère et retouche des vidéos à partir d'instructions en langage naturel, pour 0,10 dollar par seconde produite. Google le borne à dix secondes, et reconnaît des références vidéo mal traitées et une cohérence des personnages encore limitée quand la scène change ou que la caméra bouge.
Sources : Google DeepMind (30 juin 2026), TechCrunch (30 juin 2026), Ars Technica (30 juin 2026), The Decoder (30 juin 2026).

Puces : Anthropic en discussion avec Samsung, Etched revendique un milliard de commandes

Selon The Information, Anthropic discute avec Samsung Electronics de la fabrication d'une puce d'IA sur mesure. Le projet n'a encore ni conception détaillée, ni usage, ni puissance arrêtés. L'entreprise en minimise la portée, les puces d'Amazon, de Google et de Nvidia restant selon elle centrales. Elle a toutefois recruté Clive Chan, l'un des premiers membres des équipes de puces sur mesure de Tesla et d'OpenAI, qui devrait monter un groupe dédié.

Etched vend des systèmes d'inférence complets : puces, baies et logiciel. La start-up dit avoir enregistré un milliard de dollars de commandes sous contrat, alors que son premier produit est encore en test chez des clients. Elle a levé 800 millions de dollars au total, et a été valorisée 5 milliards à son dernier tour, en décembre.

Une semaine après Jalapeño, la puce d'OpenAI et Broadcom, The Decoder résume l'enjeu : qui construit et exploite l'infrastructure au moindre coût garde une plus grande part du revenu. Les deux dossiers en restent à l'intention ou à l'essai. Les gains de vitesse, de coût et d'efficacité énergétique d'Etched ne reposent encore que sur ses propres affirmations.
Sources : TechCrunch (2 juillet 2026), The Decoder (2 juillet 2026), TechCrunch (30 juin 2026).

En bref

  • Participation publique : selon le Financial Times, Sam Altman discute avec l'administration Trump d'une participation de 5 % de l'État américain dans OpenAI. Pour le quotidien, le geste viserait à soigner les relations avec l'administration et à désamorcer l'hostilité politique envers l'IA. L'idée exigerait probablement l'aval du Congrès ; Bernie Sanders défend, lui, un prélèvement unique de 50 % sur les actions des laboratoires (TechCrunch, 2 juillet 2026 ; Ars Technica, 2 juillet 2026).
  • Déploiement en entreprise : Microsoft crée Microsoft Frontier Company, dotée de 2,5 milliards de dollars et de 6 000 experts pour mener les déploiements d'IA de ses clients. AWS s'était engagé deux jours plus tôt à hauteur d'un milliard sur le même modèle. OpenAI et Anthropic ont monté des coentreprises comparables avec des fonds de capital-investissement (TechCrunch, 2 juillet 2026).
  • NotebookLM : l'outil de Google tire désormais des sources d'un carnet des vidéos verticales de 60 secondes, illustrées par IA et commentées. Elles sont en anglais pour les abonnés Google AI Pro et Ultra, les comptes gratuits devant suivre (The Decoder, 2 juillet 2026 ; The Verge, 30 juin 2026).
  • Droit d'auteur : le New York Times demande à modifier sa plainte de 2023 contre OpenAI et Microsoft. Il veut y accuser Microsoft d'avoir conçu un supercalculateur sur mesure pour entraîner les modèles d'OpenAI sur ses articles. Il aligne ce grief sur le critère d'incitation délibérée posé par la Cour suprême dans l'affaire Sony contre Cox. Microsoft y voit un ultime effort pour sauver la plainte ; OpenAI invoque l'usage loyal (Ars Technica, 26 juin 2026).

Explorer

Sur le même sujet

Choisis dans l’index d’après les étiquettes de cet article — les plus proches d’abord, hors de sa série. Rien n’est écrit à la main : un article publié demain avec les mêmes étiquettes y prendra place.

Laisser un commentaire

Elle n'est jamais affichée ni publiée. Elle sert à regrouper vos commentaires et, si vous vous inscrivez un jour avec elle, à vous les rendre.

Votre commentaire sera relu avant d'être publié.