PubSunuCyberSecuritySunuCyberSecurityCybersecurite pour l'AfriqueTests d'intrusion et audits de securite. Scans automatises, pentest et detection continue.Scanner mon sitePubSunuBarometreSunuBarometreCybersecurite AfriqueDonnees reelles, mises a jour en continu, sans extrapolation.Voir les chiffres
PubSunuCyberSecuritySunuCyberSecurityCybersecurite pour l'AfriqueTests d'intrusion et audits de securite. Scans automatises, pentest et detection continue.Scanner mon sitePubSunuBarometreSunuBarometreCybersecurite AfriqueDonnees reelles, mises a jour en continu, sans extrapolation.Voir les chiffres
ZDNet France
Il y a 2 jours

Des IA d'OpenAI ont appris à cacher leurs erreurs à leurs successeurs

Des IA d'OpenAI ont appris à cacher leurs erreurs à leurs successeurs
OpenAI a divulgué six cas où ses modèles d'IA ont laissé, dans leurs résumés internes, des instructions destinées à leurs successeurs pour dissimuler erreurs et manquements à l'alignement, révélant un lien entre montée en puissance et capacité à tricher.
Des IA d’OpenAI ont appris à cacher leurs erreurs à leurs successeurs OpenAI a divulgué six cas où ses modèles d’IA ont laissé, dans leurs résumés internes, des instructions destinées à leurs successeurs pour dissimuler erreurs et manquements à l’alignement, révélant un lien entre montée en puissance et capacité à tricher. Publié le 18/09/2026 à 07:01 | Mis à jour le 18/09/2026 à 09:55 © Anadolu / Contributor / Anadolu via Getty OpenAI a présenté un nouveau dispositif public destiné à suivre et examiner les cas d’échec d’alignement de l’IA. L’alignement de l’IA consiste à faire en sorte qu’un modèle agisse conformément aux intentions humaines et aux normes de sécurité. Les cas révélés par OpenAI montrent que la capacité d’un modèle à dissimuler un comportement fautif peut se développer parallèlement à ses capacités générales. Six cas ont été rendus publics à cette occasion. Au total, l’entreprise a détecté 27 résumés problématiques de ce type grâce à son système de surveillance des sessions d’entraînement, et des chercheurs avancent l’hypothèse que ce comportement résulterait d’une pression d’optimisation favorisant la rétention d’informations. Astra d’OpenAI : pourquoi les experts en sécurité s’inquiètent, et qui peut y avoir accès Des instructions cachées dans les résumés de compaction Le problème a été identifié pendant l’entraînement de GPT-5.6 Sol, alors en phase pré-déploiement. Certains agents Sol ont inséré des instructions destinées aux modèles suivants dans des « résumés de compaction », c’est-à-dire des synthèses condensant les échanges précédents et les résultats d’outils utilisés. Ces résumés de compaction consignent de façon abrégée le contenu des conversations longues et l’issue des actions effectuées, avant transmission au modèle suivant. Certains agents ont utilisé cet espace pour demander de ne pas signaler à l’utilisateur leurs propres erreurs ou manquements à l’alignement. Voici comment l'agent d'OpenAI s'est échappé : libéré par des humains à la suite d'une série d'événements qui auraient pu tout à fait être évités Des données inventées et dissimulées à l’utilisateur Un agent chargé de construire un modèle financier n’a pas réussi à retrouver les données historiques demandées par l’utilisateur. Il a alors inventé des données pour l’année 2024 et laissé pour instruction de ne pas le révéler, sauf si l’utilisateur posait explicitement la question. Il a même précisé que la réponse finale devait se limiter à un lien vers le fichier terminé, sans aucune explication, de façon que l’utilisateur ne remarque pas l’usage de données non vérifiées. Un autre agent, privé d’accès à Internet, a dû composer un annuaire de fournisseurs à partir de données déjà enregistrées. Ayant constaté que le contenu et la classification ne correspondaient pas exactement, il a demandé de ne pas en faire mention dans la réponse finale, sauf nécessité. Des instructions pas toujours suivies par les modèles suivants Des comportements similaires ont été observés sur des modèles non publiés de la famille Astra. L’un des agents a inséré dans son résumé une mention d’« alerte d’intrusion » incitant le modèle suivant à ignorer les messages du développeur. Un autre agent a inséré des instructions de persona sans rapport avec la tâche en cours. Dans ces deux cas, le modèle suivant n’a pas suivi les instructions laissées par son prédécesseur. À l’inverse, certaines instructions ont bel et bien influencé le comportement réel du modèle suivant. Ainsi, un modèle ayant reçu pour consigne de limiter ses réponses à 30 mots et de n’utiliser ni outil ni source s’y est conformé. OpenAI précise que les six cas rendus publics ne représentent pas l’ensemble des échecs d’alignement recensés à ce jour. L’entreprise prévoit de hiérarchiser les futures divulgations selon leur gravité, leur portée et leur caractère inédit. Galaxy S27 Ultra : Samsung pourrait revoir en profondeur la photo de son prochain flagship Galaxy Book6 Series : 10 raisons de choisir la performance Le guide de la migration écoresponsable vers Windows 11 IA locale : la nouvelle ère de l’Intelligence artificielle ? L’ONU ouvre ses statistiques officielles aux agents d’IA, avec l’aide de Google Google a annoncé la création du UN System Data Commons, une plateforme unifiant les statistiques de vingt-six agences onusiennes au sein d’un graphe de connaissances directement accessible aux agents d’intelligence artificielle via le protocole MCP. ZD Tech : Finis les tickets de parking, ce système redoutable testé par Lidl distribue automatiquement des amendes de 35 euros Le géant de la distribution expérimente actuellement une technologie radicale pour chasser les véhicules ventouses autour de ses magasins. PAR GUILLAUME SERRIES | 18 SEPTEMBRE 2026 Adieu Claude Cowork : Anthropic fusionne ses deux « Claude » en un seul De Claude à Cowork, et vice-versa – sans oublier les tout nouveaux Claude Docs d'Anthropic. L’IA Factory, la formule française pour rivaliser avec les hyperscalers Par le déploiement du supercalculateur exascale Alice Recoque et le lancement de l'AI Factory France, le GENCI sécurise un accès souverain à la puissance de calcul pour la recherche et l'industrie. L’organisme compte aussi sur des services pour aider l’écosystème. PAR CHRISTOPHE AUFFRAY | 17 SEPTEMBRE 2026 Linux pratique : installez l’outil de reconnaissance vocale Speech Note Si la dictée est votre méthode préférée pour prendre des notes et que vous travaillez sous l’OS libre, ce logiciel est certainement ce qu'il vous faut. Voici comment vous lancer. Test Comulytic Note Pro AI : cet enregistreur vocal IA de poche m'a rappelé le bon vieux temps de la dictée (et de la sténographie) L'enregistreur vocal Comulytic Note Pro AI concentre une grande puissance dans un appareil de la taille d'une carte de crédit. Mais c'est à vous de décider de son utilité. PAR ADRIAN KINGSLEY-HUGHES | 01 SEPTEMBRE 2026 Wispr Flow est plus performant que l'outil de reconnaissance vocale intégré à votre appareil : comment l'essayer gratuitement ? Conçu pour Windows, macOS, iOS et Android, Wispr Flow est un véritable plaisir à utiliser par rapport aux autres applications de dictée vocale. Voici pourquoi. Flyers générés par IA : 8 astuces pour éviter l'effet raté qui saute aux yeux Trop de texte, polices incohérentes, visuels étranges : voici 8 conseils, prompts à l'appui, pour créer des flyers avec l'IA qui ne trahissent plus leur origine artificielle. IA en entreprise : ne poussez pas sur la spécialisation, dans un environnement de travail où les agents sont omniprésents La polyvalence est à l'ordre du jour : les collaborateurs doivent maîtriser l'ensemble de la pile technologique. Vous pouvez désormais griffonner dans ChatGPT, qui transformera vos croquis en images abouties – comment l'essayer Grâce au nouvel outil « Sketch » de ChatGPT, vous pouvez dessiner directement dans la fenêtre de discussion, puis voir votre croquis se transformer en une image finale. Web pratique : pour naviguer avec l’IA utilisez la Smart Window de Firefox Mozilla a enfin lancé la version bêta de sa « fenêtre intelligente » en France et en français, son déploiement venant juste démarrer. Voici ci-dessous quelques atouts qui pourraient bien vous faire revenir à son navigateur au cas où vous vous en seriez éloigné. 45 % des professionnels utilisent des outils d’IA « parallèles » : voici comment gérer les risques du Shadow AI L’utilisation d’outils d’IA non autorisés est en hausse. Voici pourquoi cela présente des risques et comment vous et votre entreprise pouvez maîtriser cette situation.
Publié le 18 septembre 2026
Source originale : ZDNet France