-
Lionel Messi en Argentine pour faire ses adieux à son père décédé
-
Le cancer de Joe Biden s'est aggravé, selon son fils
-
Colombie: deux attaques marquent le premier jour du président de la Espriella au pouvoir
-
MotoGP: "Confiant" et dominateur, Martin favori à Silverstone
-
Tour de France: Vollering domine Niewiadoma à Nice et endosse le maillot jaune
-
Retour timide des touristes au Porge, encore meurtri par le mégafeu
-
Zelensky avertit que l'hiver sera difficile pour l'Ukraine, 4 morts dans des frappes dans la région de Kiev
-
Que peut-on attendre du pacte de défense scellé par Ryad, Ankara et Islamabad?
-
Foot: le père et agent de Lionel Messi décède à l'âge de 68 ans
-
Hongrie : le "juge qui a dit non" à Orban choisi par le camp Magyar pour devenir président
-
Euro de natation: Léon Marchand forfait sur les 200 et 400 m quatre nages
-
Angleterre: le milieu brésilien Bruno Guimaraes rejoint Arsenal
-
Tour de France: la lauréate sortante Pauline Ferrand-Prévot abandonne avant la 8e étape
-
Violences sexuelles sur mineurs : le gouvernement se penche sur les défaillances des enquêtes
-
A Kiev, dernier adieu à un bénévole qui a consacré sa vie aux morts
-
Euro d'athlétisme: Duplantis, Werro, Jacobs, les stars à suivre à Birmingham
-
Violences sexuelles sur mineurs: un courrier de Darmanin pointe les défaillances des enquêtes
-
Le Sénat américain approuve la nomination de Todd Blanche comme ministre de la Justice
-
Zelensky en Serbie pour sa première visite chez cet allié de Moscou
-
Vin: une étude sur sept siècles montre les ravages du dérèglement climatique
-
En Hongrie, l'attente et le doute dans l'audiovisuel public après un mois sans JT
-
Début des vendanges en Bourgogne, un nouveau record de précocité
-
Plages désertes et "odeur insupportable": le Mexique lutte contre les sargasses
-
Pour les Afro-Américains de Memphis, voter pour exister dans un Etat à la carte électorale redessinée
-
Arrêter la guerre en Ukraine ? Le parti russe d'opposition Iabloko y croit
-
Lise Klaveness, l'anti-Infantino canal historique
-
Indemnité carburant pour "grands rouleurs": la date limite de dépôt reportée à fin août
-
"Je ne voulais pas me voir dans les miroirs": l'impact psychologique de la reconstruction mammaire
-
Amazon fait construire au Texas une immense centrale à gaz pour ses centres de données
-
Présidentielle: Gabriel Attal porte plainte, dénonçant une ingérence russe
-
Nocturne et amatrice de café: une nouvelle espèce de grenouille découverte au Costa Rica
-
Colombie: le président de la Espriella promet de combattre "sans répit" le narcotrafic
-
Le rappeur Moha La Squale condamné à deux ans pour des violences sur deux femmes
-
Colombie: le président de la Espriella promet de combattre "sans répit le narcoterrorisme"
-
La justice bloque à nouveau la salle de bal de Trump, qui va saisir la Cour suprême
-
De la Espriella, un millionnaire pro-Trump à la présidence de la Colombie
-
Colombie: le président Abelardo de la Espriella soutenu par Trump, entre en fonctions
-
Au Porge, sinistré par le mégafeu, une soirée de solidarité avec les commerçants
-
Les Bourses mondiales touchent des sommets après l'emploi américain
-
Yémen: nouvelles attaques meurtrières des rebelles houthis dans une région pétrolifère
-
Tour de France: Niewiadoma, géante de Provence
-
La Bourse de Paris termine en hausse et poursuit sa course aux records
-
Tour de France: Niewiadoma s'impose au sommet du Ventoux et endosse le maillot jaune
-
Canicules et sécheresse : un été de pertes et de désespoir pour l'agriculture
-
Culottes menstruelles : les règles du remboursement précisées
-
En Thaïlande, "choc" et "incrédulité" dans un lycée après une fusillade mortelle
-
Emploi américain moins bon que prévu, les Bourses en hausse
-
Dans les ruines de Gaza, la laborieuse renaissance de l'apiculture sur les toits
-
En Gironde, des vétérinaires au chevet de la faune sauvage après le mégafeu
-
Pour combattre les moustiques, une entreprise américaine en relâche 600.000 dans les jardins
L'IA devient menteuse et manipulatrice, les chercheurs s'inquiètent
Les derniers modèles d'intelligence artificielle (IA) générative ne se contentent plus de suivre les ordres et vont jusqu'à mentir, manigancer ou menacer pour parvenir à leurs fins, sous le regard inquiet des chercheurs.
Menacé d'être débranché, Claude 4, le nouveau-né d'Anthropic, fait du chantage à un ingénieur et menace de révéler une liaison extra-conjugale. L'o1 d'OpenAI essaye lui de se télécharger sur des serveurs extérieurs et nie lorsqu'on le prend la main dans le sac.
Pas besoin d'aller fouiller dans la littérature ou le cinéma, l'IA qui se joue de l'homme est désormais une réalité.
Pour Simon Goldstein, professeur à l'université de Hong Kong, ces dérapages tiennent de l'émergence récente des modèles dits de "raisonnement", capables de travailler par étapes plutôt que de produire une réponse instantanée.
o1, version initiale du genre pour OpenAI, sorti en décembre, "a été le premier modèle à se comporter ainsi", explique Marius Hobbhahn, patron d'Apollo Research, qui teste les grands programmes d'IA générative (LLM).
Ces programmes tendent aussi parfois à simuler "l'alignement", c'est-à-dire à donner l'impression qu'ils se plient aux consignes d'un programmeur tout en poursuivant, en fait, d'autres objectifs.
Pour l'heure, ces traits se manifestent lorsque les algorithmes sont soumis à des scénarios extrêmes par des humains, mais "la question, c'est de savoir si les modèles de plus en plus puissants auront tendance à être honnêtes ou pas", estime Michael Chen, de l'organisme d'évaluation METR.
"Les utilisateurs poussent tout le temps les modèles aussi", fait valoir Marius Hobbhahn. "Ce que nous observons est un vrai phénomène. Nous n'inventons rien."
Beaucoup d'internautes évoquent, sur les réseaux sociaux, "un modèle qui leur ment ou invente. Et ce ne sont pas des hallucinations, mais une duplicité stratégique", insiste le co-fondateur d'Apollo Research.
Même si Anthropic et OpenAI font appel à des sociétés extérieures, comme Apollo, pour étudier leurs programmes, "davantage de transparence et un accès élargi" à la communauté scientifique "permettraient de meilleures recherches pour comprendre et prévenir la tromperie", suggère Michael Chen.
Autre handicap, "le monde de la recherche et les organisations indépendantes ont infiniment moins de ressources informatiques que les acteurs de l'IA", ce qui rend "impossible" l'examen de grands modèles, souligne Mantas Mazeika, du Centre pour la sécurité de l'intelligence artificielle (CAIS).
Si l'Union européenne s'est dotée d'une législation, elle concerne surtout l'utilisation des modèles par des humains.
Aux Etats-Unis, le gouvernement de Donald Trump ne veut pas entendre parler de régulation et le Congrès pourrait même bientôt interdire aux Etats d'encadrer l'IA.
- L'IA en justice? -
"Il y a très peu de prise de conscience pour l'instant", constate Simon Goldstein, qui voit néanmoins le sujet s'imposer dans les mois à venir avec la révolution des agents IA, des interfaces à même de réaliser seules une multitude de tâches.
Les ingénieurs sont engagés dans une course derrière l'IA et ses dérives, à l'issue incertaine, dans un contexte de compétition féroce.
Anthropic se veut plus vertueux que ses concurrents, "mais il essaye en permanence de sortir un nouveau modèle pour dépasser OpenAI", selon Simon Goldstein, une cadence qui offre peu de temps pour des vérifications et corrections éventuelles.
"En l'état, les capacités (de l'IA) se développent plus rapidement que la compréhension et la sécurité", reconnaît Marius Hobbhahn, "mais nous sommes toujours en mesure de rattraper notre retard".
Certains pointent dans la direction de l'interprétabilité, une science récente qui consiste à décrypter de l'intérieur le fonctionnement d'un modèle d'IA générative, même si d'autres, notamment le directeur du CAIS, Dan Hendrycks, sont sceptiques.
Les combines de l'IA "pourraient gêner son adoption si elles se multiplient, ce qui constitue une forte incitation pour les entreprises (du secteur) à résoudre" ce problème, selon Mantas Mazeika.
Simon Goldstein évoque, lui, le recours à la justice pour mettre au pas l'intelligence artificielle, en se tournant vers les sociétés en cas de sortie de route.
Mais il va plus loin et propose même de "tenir légalement responsables" les agents IA "en cas d'accident ou de crime".
E.Ramalho--PC