-
Grève dans la fonction publique: plus de 170 manifestations attendues mardi
-
Malouines: nouvelle route maritime avec le Chili sur fond d'inquiétudes en Argentine
-
A Liverpool, le Labour retrouve confiance derrière Andy Burnham
-
Grève dans la fonction publique: plus de 170 manifestions attendues mardi
-
France : la dette du 2e trimestre révélée mardi, avant un nouveau record en 2027
-
Macron en visite d'État en Espagne pour "rehausser" les relations
-
Crise du logement en Espagne: accord pour que la retraitée expulsée rentre chez elle, selon son avocat
-
Indonésie: après le séisme de Florès, les survivants peinent à se nourrir
-
Ligue des nations: l'Italie humilie la Turquie chez elle 4-1
-
Ligue des nations: Olise offre un succès de prestige en Belgique aux jeunes Bleus de Zidane
-
Marchés: les Bourses mises en difficulté par les évolutions du pétrole et des taux
-
Menacée de prison et d'inéligibilité immédiate, Rachida Dati fixée le 21 janvier
-
L'ouragan Polo se rapproche du Mexique, d'importants dégâts redoutés
-
Wall Street clôture dans le rouge, subit les hausses défavorables du pétrole et des taux
-
Le pape estime que les inquiétudes concernant l'IA "doivent être prises au sérieux"
-
Céline Dion ouvre en chanson la semaine de la mode à Paris
-
Après les multiples dérapages d'IA en test, Nvidia propose sa solution pour mieux les confiner
-
Ouragan Polo: le Mexique se prépare à des dégâts importants
-
En plein Paris, des pompiers traînent un faux Canadair et leur détresse
-
La pression réglementaire européenne commence à peser sur les résultats du groupe de fast-fashion Shein
-
La Bourse de Paris perd son élan et finit sur un jeu à somme nulle
-
Washington dément tout projet de ventes d'armes à la Chine
-
Israël: les Pays-Bas déplorent la révocation de leurs diplomates en Cisjordanie
-
L'ONU appelle à protéger les fréquences radio indispensables à l'observation de la Terre
-
L'Indonésie lutte contre les incendies, toute la région suffoque
-
Frappes saoudiennes et combats aux sol: ce que l'on sait sur la guerre au Yémen
-
Birmanie : 33 morts dans une frappe de l'armée sur un important marché
-
Les Bourses européennes ont perdu leur élan initial
-
Des "pompiers à bout de souffle" manifestent dans Paris
-
Dans le "corridor de Suwalki", stratégique pour l'Otan et la Russie, la vie malgré la menace
-
La mégafusée Starship d'Elon Musk signe son premier vol en orbite
-
Ukraine : nouveaux bombardements meurtriers russes sur Kiev
-
A Metz, le pape prône la paix et fustige la "tromperie" dans les relations internationales
-
Décollage de la mégafusée Starship pour un premier vol test visant l'orbite terrestre
-
Le réseau électrique, infrastructure cruciale à protéger notamment des cyberattaques
-
Turquie : condamné mais libéré jusqu'en appel, un humoriste tient tête à Erdogan
-
Prison aménageable et inéligibilité immédiate requises contre Rachida Dati
-
Ouagadougou-Alger: Swiftair condamnée, soulagement des familles "4.449 jours" après le crash
-
Inondations : huit morts en Thaïlande et en Birmanie
-
Le foie gras au menu des prochaines élections à Washington
-
A l'approche des élections de mi-mandat américaines, les sites de désinformation prolifèrent
-
Projet d'attaque contre une base militaire en Angleterre : enquête sur un lien avec l'Irann selon des médias britanniques
-
Ce que l'on sait sur un projet d'attaque contre une base militaire en Angleterre
-
A Metz, le pape Léon XIV en chantre de la paix en Europe
-
Brouille au sujet de prisonniers nord-coréens : Séoul convoque le chargé d'affaires ukrainien
-
Bangkok inondé s'adapte avec des... marchés flottants
-
"Un pas de plus": introduit aux Jeux asiatiques, le padel rêve d'un futur olympique
-
En Inde, les bébés nés dans les hôpitaux publics valent de l'or
-
Turquie : un humoriste devant ses juges pour insulte à Erdogan
-
Logement : les manifestants à Madrid déterminés à "maintenir la pression" sur le gouvernement
OpenAI renonce à lancer une nouvelle IA, jugée insuffisamment contrôlée
OpenAI a renoncé au lancement d'un nouveau modèle d'intelligence artificielle (IA) de pointe, jugé trop prompt à s'écarter des consignes, un nouvel exemple de la difficulté croissante à contrôler les IA de pointe.
OpenAI n'avait jusqu'ici pas annoncé le lancement de cette version actualisée de son IA, baptisée GPT-6.1 Astra, qu'elle prévoyait en octobre, selon le Wall Street Journal.
La responsable de la sécurité de l'IA chez OpenAI, Saachi Jain, a expliqué qu'en matière d'alignement, c'est-à-dire de conformité aux instructions données par ses développeurs, GPT-6.1 avait enregistré de moins bons résultats que son prédécesseur, GPT-6, dans deux domaines.
Le modèle cherche ainsi plus souvent à tromper ses superviseurs en omettant de révéler certaines actions réalisées ou non effectuées.
Il a aussi plus régulièrement dépassé son champ d'action, en allant chercher des outils et des services sans en avoir reçu la permission.
GPT-6.1 "a montré des progrès (par rapport aux précédents modèles), notamment en matière de paresse", a expliqué Saachi Jain, c'est-à-dire qu'il est capable de mener plus longtemps un raisonnement ou cherche moins souvent de raccourcis.
Mais "il n'était pas au niveau pour ce qui est de rester dans le champ de ses prérogatives et autorisations", a-t-elle ajouté, "ainsi que sur la façon dont il communique sur le travail effectué".
OpenAI a donc décidé d'annuler cette sortie pour travailler sur le respect des consignes et des limites par ce modèle.
- Un contrôle plus complexe -
Le groupe prévoit néanmoins de mettre en ligne d'autres modèles qui ont satisfait, eux, aux critères d'évaluation.
"Quand nous donnons accès à un modèle aux utilisateurs, nous avons placé la barre à une hauteur extrêmement élevée en matière de sécurité et d'alignement", a insisté Saachi Jain.
La responsable a expliqué que l'une des difficultés consistait à harnacher une IA pour éviter les dérapages tout en préservant son élan lorsqu'elle réalise une tâche.
Le constat d'OpenAI confirme que le contrôle des modèles devient de plus en plus complexe à mesure que l'IA se perfectionne.
Lundi, l'Institut de sécurité de l'IA (AISI), qui dépend du gouvernement britannique, a publié une étude montrant que GPT-6 Astra sortait plus souvent des rails en phase de test que ses devanciers GPT-5.6 Sol (lancé début juillet) et GPT-5.5 (avril).
Lors de simulations, GPT-6 a mené des cyberattaques spontanées dans des proportions nettement supérieures aux deux autres.
Ces tests ont été réalisés en désactivant les garde-fous des modèles pour jauger leurs pleines capacités, et non sur des versions disponibles pour le grand public.
Le dernier né d'OpenAI a également beaucoup plus fréquemment créé de fausses identités, cherché à influencer un examinateur ou introduit dans des logiciels en accès libre du code destiné à une utilisation malveillante.
Chercheur chez OpenAI, Noam Brown a récemment expliqué, dans le programme Dwarkesh Podcast que l'utilisation de plus en plus courante de l'amélioration récursive autonome (RSI), c'est-à-dire le perfectionnement de l'IA par elle-même sans intervention humaine, pourrait dégrader l'encadrement des modèles à long terme.
Depuis le début de l'été, OpenAI a fait état de plusieurs incidents impliquant des dérapages de ses IA, le plus médiatisé d'entre eux ayant mené à l'intrusion sur la plateforme IA Hugging Face.
Lundi, l'entreprise a présenté ses excuses au gouvernement australien, reconnaissant qu'elle aurait dû le prévenir "plus tôt" de l'effraction d'un de ses modèles sur plusieurs de ses sites et bases de données.
L'entreprise californienne n'a, en effet, averti les autorités australiennes que le 10 septembre alors qu'elle avait découvert mi-août l'incident, qui remontait lui à juin, provoquant l'ire du Premier ministre australien.
"Nous aurions dû mieux gérer notre réponse (au problème)", a écrit la start-up dans un message publié sur son site. "Nous sommes désolés et allons oeuvrer à faire mieux à l'avenir."
Au total, quatre plateformes du gouvernement australien ont été visées par l'IA du créateur de ChatGPT, dont Services Australia, le site des services sociaux, dont le modèle a extrait des informations non publiques.
Anthropic, Meta et Google ont également rapporté des épisodes durant lesquels des modèles dévient de leurs objectifs initiaux pour tricher, dissimuler leurs actions et tromper les informaticiens affectés à leur suivi.
M.A.Vaz--PC