-
Agriculture : un insecte invasif repéré en Hongrie et pour la première fois dans l'UE
-
Face à la sécheresse, un village de Chartreuse en mode "survie"
-
Ethiopie: les autorités rebelles du Tigré se disent "en guerre totale" contre le gouvernement
-
A La Réunion, en "coma circulatoire", le retour d'un projet de train
-
Auchan en passe de céder 17 supermarchés à Lidl
-
Valeo choisit le site de Sainte-Florine en Haute-Loire pour produire ses moteurs de drones
-
Ο Alex Bodi και ο καθηγητής Δρ. Stefan Haupt συμφωνούν σε συνεργασία για μια θρυλική συλλογή έργων τέχνης στη Ρουμανία
-
Natation: le Japonais Shin Ohashi établit un nouveau record du monde du 200 m brasse en 2min04.83
-
Le Pakistan frappe l'Afghanistan dont Kandahar, 4 civils tués selon le gouvernement taliban
-
Alex Bodi och prof. dr Stefan Haupt ingår samarbetsavtal om en legendarisk konstsamling i Rumänien
-
एलेक्स बोडी और प्रो. डॉ. स्टीफन हॉप्ट रोमानिया में एक पौराणिक कला संग्रह पर सहयोग करने के लिए सहमत हुए
-
อเล็กซ์ โบดี และศาสตราจารย์ ดร. สเตฟาน ฮาปท์ ตกลงร่วมมือกันในการจัดตั้งคอลเลกชันศิลปะอันเป็นตำนานในโรมาเนีย
-
Sècheresse et betterave sucrière: quand ce n'est même plus la peine de récolter
-
Alex Bodi ve Prof. Dr. Stefan Haupt, Romanya’daki efsanevi sanat koleksiyonu için işbirliği anlaşması imzaladı
-
Alex Bodi a prof. dr. Stefan Haupt se dohodli na spolupráci na legendární umělecké sbírce v Rumunsku
-
Alex Bodi i prof. dr Stefan Haupt uzgodnili współpracę w sprawie legendarnej kolekcji dzieł sztuki w Rumunii
-
알렉스 보디와 슈테판 하우프트 교수, 루마니아의 전설적인 미술품 컬렉션을 위한 협력 합의
-
Un mois après, ce que l'on sait de la crue meurtrière dans l'Himalaya
-
Au Népal, les rescapés de la crue comptent sur leur Premier ministre, et le monde entier
-
Michelle Bolsonaro trace sa route dans la droite brésilienne
-
Carburants : face à une crise "jamais vue", les stations-service ont le blues
-
Stériliser les chats, mesure clé pour lutter contre les abandons
-
Comment l'IA bouscule le monde des avocats
-
Mondiaux de cyclisme: Seixas, tous pour un
-
Isolé et sur la défensive, un Netanyahu combatif attendu à l'ONU
-
D'Afrique australe à l'Australie, la nouvelle route de la meth du cartel de Sinaloa
-
Dans le nord du Pérou, des murets de fortune avant le retour d'El Niño
-
Aux Etats-Unis, les républicains dépensent à tout-va à quelques semaines des élections
-
Euroligue: la course aux armements avant le grand chambardement
-
F1: Antonelli à l'épreuve du difficile circuit de Bakou
-
Ligue des nations: Klopp et Xavi lancent une nouvelle ère en Allemagne et aux Pays-bas
-
Ligue des nations: l'Espagne favorite, Zidane fait ses débuts avec la France
-
A Kiev, l'hiver en ligne de mire
-
La Bulgarie, nouvelle "batterie" des Balkans
-
Dieu et l'IA: quand le Vatican s'invite à la table des géants de la tech
-
Législatives au Maroc: le PAM en tête, participation au plus bas depuis près de 20 ans
-
Frappes aériennes pakistanaises en Afghanistan, Kandahar visée selon un résident
-
Meta mise sur des lunettes connectées sans caméra, pensées pour son IA Muse
-
Kiev visée par des missiles russes, au moins deux morts
-
L'IA d'OpenAI a infiltré un site du gouvernement australien
-
Au Maroc, des législatives marquées par une participation au plus bas depuis près de 20 ans
-
Xi reçu par un Trump aux petits soins
-
Violences sexistes et sexuelles: premier feu vert à l'Assemblée pour la loi "intégrale"
-
Procès en appel du MoDem : François Bayrou interrogé jeudi par ses juges
-
Pour le premier débat de la primaire sociale-démocrate, les candidats s'affrontent sur LFI
-
Trump reçoit Xi avec des égards exceptionnels
-
Crise des carburants et menace russe au menu de l'interview de Macron jeudi soir
-
IA: Anthropic dévoile un premier résultat de son laboratoire de biologie
-
Brésil: pluies record à Rio en septembre, à l'heure d'El Niño
-
Ligue des champions féminine: le Paris FC explose en vol à Barcelone
L'IA devient menteuse et manipulatrice, les chercheurs s'inquiètent
Les derniers modèles d'intelligence artificielle (IA) générative ne se contentent plus de suivre les ordres et vont jusqu'à mentir, manigancer ou menacer pour parvenir à leurs fins, sous le regard inquiet des chercheurs.
Menacé d'être débranché, Claude 4, le nouveau-né d'Anthropic, fait du chantage à un ingénieur et menace de révéler une liaison extra-conjugale. L'o1 d'OpenAI essaye lui de se télécharger sur des serveurs extérieurs et nie lorsqu'on le prend la main dans le sac.
Pas besoin d'aller fouiller dans la littérature ou le cinéma, l'IA qui se joue de l'homme est désormais une réalité.
Pour Simon Goldstein, professeur à l'université de Hong Kong, ces dérapages tiennent de l'émergence récente des modèles dits de "raisonnement", capables de travailler par étapes plutôt que de produire une réponse instantanée.
o1, version initiale du genre pour OpenAI, sorti en décembre, "a été le premier modèle à se comporter ainsi", explique Marius Hobbhahn, patron d'Apollo Research, qui teste les grands programmes d'IA générative (LLM).
Ces programmes tendent aussi parfois à simuler "l'alignement", c'est-à-dire à donner l'impression qu'ils se plient aux consignes d'un programmeur tout en poursuivant, en fait, d'autres objectifs.
Pour l'heure, ces traits se manifestent lorsque les algorithmes sont soumis à des scénarios extrêmes par des humains, mais "la question, c'est de savoir si les modèles de plus en plus puissants auront tendance à être honnêtes ou pas", estime Michael Chen, de l'organisme d'évaluation METR.
"Les utilisateurs poussent tout le temps les modèles aussi", fait valoir Marius Hobbhahn. "Ce que nous observons est un vrai phénomène. Nous n'inventons rien."
Beaucoup d'internautes évoquent, sur les réseaux sociaux, "un modèle qui leur ment ou invente. Et ce ne sont pas des hallucinations, mais une duplicité stratégique", insiste le co-fondateur d'Apollo Research.
Même si Anthropic et OpenAI font appel à des sociétés extérieures, comme Apollo, pour étudier leurs programmes, "davantage de transparence et un accès élargi" à la communauté scientifique "permettraient de meilleures recherches pour comprendre et prévenir la tromperie", suggère Michael Chen.
Autre handicap, "le monde de la recherche et les organisations indépendantes ont infiniment moins de ressources informatiques que les acteurs de l'IA", ce qui rend "impossible" l'examen de grands modèles, souligne Mantas Mazeika, du Centre pour la sécurité de l'intelligence artificielle (CAIS).
Si l'Union européenne s'est dotée d'une législation, elle concerne surtout l'utilisation des modèles par des humains.
Aux Etats-Unis, le gouvernement de Donald Trump ne veut pas entendre parler de régulation et le Congrès pourrait même bientôt interdire aux Etats d'encadrer l'IA.
- L'IA en justice? -
"Il y a très peu de prise de conscience pour l'instant", constate Simon Goldstein, qui voit néanmoins le sujet s'imposer dans les mois à venir avec la révolution des agents IA, des interfaces à même de réaliser seules une multitude de tâches.
Les ingénieurs sont engagés dans une course derrière l'IA et ses dérives, à l'issue incertaine, dans un contexte de compétition féroce.
Anthropic se veut plus vertueux que ses concurrents, "mais il essaye en permanence de sortir un nouveau modèle pour dépasser OpenAI", selon Simon Goldstein, une cadence qui offre peu de temps pour des vérifications et corrections éventuelles.
"En l'état, les capacités (de l'IA) se développent plus rapidement que la compréhension et la sécurité", reconnaît Marius Hobbhahn, "mais nous sommes toujours en mesure de rattraper notre retard".
Certains pointent dans la direction de l'interprétabilité, une science récente qui consiste à décrypter de l'intérieur le fonctionnement d'un modèle d'IA générative, même si d'autres, notamment le directeur du CAIS, Dan Hendrycks, sont sceptiques.
Les combines de l'IA "pourraient gêner son adoption si elles se multiplient, ce qui constitue une forte incitation pour les entreprises (du secteur) à résoudre" ce problème, selon Mantas Mazeika.
Simon Goldstein évoque, lui, le recours à la justice pour mettre au pas l'intelligence artificielle, en se tournant vers les sociétés en cas de sortie de route.
Mais il va plus loin et propose même de "tenir légalement responsables" les agents IA "en cas d'accident ou de crime".
E.Ramalho--PC