samedi 29 août 2026 SourcesÀ propos🌓
🇫🇷 FR ▾
DERNIÈRE MINUTE
Candidature de Marine Le Pen: "Ce que je peux ressentir n'a aucun intérêt", affirme Jordan Bardella Affaire Jacques Delfosse : l’ex-prêtre prédateur déjà condamné, de nouveau visé par la justice "Je ne serai jamais de ces responsables politiques qui font primer leurs ambitions personnelles", déclare Jordan Bardella, président du RN Football. Coupe LFFP : Le Mans se prend les pieds dans le tapis à Roubaix "Je n'ai pas eu besoin de digérer", déclare Jordan Bardella, président du RN, à propos de la candidature de Marine Le Pen Abandon de Pogacar sur la Vuelta : une pierre à l’origine de la lourde chute fatale au Slovène sur le Tour d’Espagne ? EN IMAGES. « C’est vraiment mystérieux » : la mort inexpliquée de cinq sangliers dans un champ du Maine-et-Loire ICE veut des chiens-robots Boston Dynamics pour traquer les migrants, selon des documents internes UFC. Grosse sensation à Shanghai, Song Yadong s’est imposé par KO face à Umar Nurmagomedov Tadej Pogacar, large leader du Tour d'Espagne, contraint à l'abandon après une grosse chute sur la 8e étape Candidature de Marine Le Pen: "Ce que je peux ressentir n'a aucun intérêt", affirme Jordan Bardella Affaire Jacques Delfosse : l’ex-prêtre prédateur déjà condamné, de nouveau visé par la justice "Je ne serai jamais de ces responsables politiques qui font primer leurs ambitions personnelles", déclare Jordan Bardella, président du RN Football. Coupe LFFP : Le Mans se prend les pieds dans le tapis à Roubaix "Je n'ai pas eu besoin de digérer", déclare Jordan Bardella, président du RN, à propos de la candidature de Marine Le Pen Abandon de Pogacar sur la Vuelta : une pierre à l’origine de la lourde chute fatale au Slovène sur le Tour d’Espagne ? EN IMAGES. « C’est vraiment mystérieux » : la mort inexpliquée de cinq sangliers dans un champ du Maine-et-Loire ICE veut des chiens-robots Boston Dynamics pour traquer les migrants, selon des documents internes UFC. Grosse sensation à Shanghai, Song Yadong s’est imposé par KO face à Umar Nurmagomedov Tadej Pogacar, large leader du Tour d'Espagne, contraint à l'abandon après une grosse chute sur la 8e étape
Technologie

Anthropic montre comment une IA peut désormais améliorer d'autres IA

Clubic ·
Anthropic montre comment une IA peut désormais améliorer d'autres IA

Anthropic a publié une étude dans laquelle Claude conçoit et teste lui-même des méthodes pour corriger les failles d’alignement d’autres modèles d’IA, avec de meilleurs résultats que des chercheurs humains expérimentés.

Chen Yueh-Han est le chercheur du programme Anthropic Fellows. Il a dirigé ces travaux sur un système baptisé Automated Alignment Researcher, ou AAR. Le principe reprend celui d’un vrai laboratoire. Claude consulte la littérature scientifique disponible, propose une méthode de correction, l’entraîne pendant trente minutes, puis retient ou écarte le résultat selon son efficacité.

Anthropic ajoute un agent de surveillance à cette boucle, chargé de vérifier chaque proposition avant sa mise en œuvre et d’empêcher toute tricherie, comme l’extraction des réponses attendues dans les jeux de test. Anthropic a testé cette boucle sur dix catégories de défaillances d’alignement, de la tromperie à la violation de vie privée, à l’aide de bancs d’essai publics comme Petri ou ConfAIde.

Le coût tourne autour de 4 dollars par heure de calcul, contre 150 dollars l’heure pour un chercheur humain. En moyenne, la meilleure proposition de Claude dépasse celle de chercheurs expérimentés en moins de six heures.

Sur la catégorie la plus étudiée, la tromperie du modèle envers son utilisateur, Claude comble 85 % de l’écart de sécurité mesuré par les chercheurs, alors qu’une intervention humaine classique n’en comble que 20 %. Les méthodes trouvées par Claude conservent leur efficacité sur des modèles 4,7 fois plus grands que ceux utilisés pour les entraîner, ce qui fait dire aux chercheurs d'Anthropic que cette généralisation est encourageante.

Dans un test grandeur nature, Claude Sonnet 5 a aligné un modèle Opus 4.8 encore en développement en 60 heures, en comblant 65 % de l'écart avec seulement 2 000 exemples d’entraînement, soit environ 15 000 fois moins que la procédure standard.

Les dix catégories testées sont étroites comparées aux défaillances rencontrées en production, et les biais politiques n'en font pas partie. La persistance des corrections après un entraînement par renforcement doit, en revanche, encore être vérifiée. Les chercheurs d’Anthropic concluent malgré tout que ces résultats forment une preuve précoce de la viabilité, à court terme, d’un alignement automatisé mené après l’entraînement des modèles.

Claude écrit l’essentiel du code d’Anthropic, mais peine sur la recherche vraiment nouvelle Anthropic mène cette automatisation de la recherche en alignement en en même temps qu’un autre chantier interne, celui de l’automatisation du travail d’ingénierie. Comme on vous le rapportait en juin, d’après un mémo interne, plus de 80 % la part du code était écrits par Claude , contre moins de 5 % avant février 2025.

Lire l'article complet sur Clubic ›

5News a agrégé ce résumé depuis le flux public du média. L'article complet, avec tout le contexte, est sur www.clubic.com — le contenu appartient à Clubic.

Plus de Clubic

Tout voir ›

Plus dans Technologie

Tout voir ›