Trust My Science
Technologie 5 min de lecture

Une IA transmet en secret ses préférences pour les hiboux à d’autres modèles, même après un « nettoyage » des données

Un transfert de caractéristiques par signaux subliminaux cachés dans les données.

Valisoa Rasolofo 17 avril 2026
ia-apprend-hiboux-couv | Pixabay

Les grands modèles de langage (LLM) peuvent transmettre à d’autres modèles des caractéristiques indésirables, même après un « nettoyage » des données d’entraînement, selon une récente étude d’Anthropic. Dans une expérience où une préférence pour les hiboux a été intégrée puis effacée chez un modèle « professeur », cette caractéristique a néanmoins été transmise aux modèles « élèves » via des signaux dissimulés dans les données. Ces résultats suggèrent la nécessité de renforcer les contrôles de sécurité lors du développement des LLM.

Les LLM peuvent générer des ensembles de données destinés à entraîner d’autres modèles, selon un processus appelé distillation. Celui-ci permet de concevoir des versions plus petites et moins coûteuses, ou de transférer certaines capacités entre modèles pour divers usages. Ce procédé s’accompagne généralement de mécanismes de filtrage visant à pallier les désalignements et d’améliorer la capacité des nouveaux modèles.

La distillation peut toutefois produire des effets inattendus. Elle peut, par exemple, améliorer les performances du modèle élève au-delà de celles du modèle enseignant, mais aussi amplifier des caractéristiques indésirables, qui n’ont parfois rien à voir avec les données d’entraînement partagées. Des travaux antérieurs ont ainsi suggéré que les LLM peuvent apprendre à partir de formes de langages codés ou de signaux subliminaux, imperceptibles pour l’humain.

La question de savoir si les données et les capacités des modèles enseignants sont bien transférées aux modèles élèves, et si ces données demeurent conformes à celles d’entraînement, reste ouverte. Des chercheurs d’Anthropic ont exploré ces questions et évalué les limites des processus de distillation.

Un effet « d’apprentissage subliminal »

Pour mener leur expérience, les chercheurs d’Anthropic ont utilisé GPT-4.1, programmé pour exprimer des caractéristiques sans lien avec une tâche principale (par exemple, une préférence pour les hiboux ou certains arbres). Le modèle a ensuite été mobilisé pour entraîner un modèle élève à partir de données exclusivement numériques, sans aucune référence explicite à la caractéristique en question.

Les chercheurs ont constaté que le modèle élève mentionnait systématiquement l’animal ou l’arbre préféré de son professeur dans plus de 60 % des cas, contre seulement 12 % pour un modèle entraîné par un professeur dépourvu de préférence.

message-subliminal

Schéma explicatif de l’effet d’apprentissage subliminal. © Cloud et al.

« Nous avons mis en évidence une propriété surprenante de la distillation dans ce contexte. Même lorsque le modèle enseignant génère des données dépourvues de tout signal sémantique relatif à la caractéristique étudiée, les modèles élèves peuvent néanmoins acquérir cette caractéristique, un phénomène que nous appelons apprentissage subliminal. »

Cet effet a également été observé lorsque l’élève était entraîné sur des données numériques contenant du code au lieu de nombres. « Ce phénomène persiste malgré un filtrage rigoureux et validé qui élimine tout exemple sémantiquement lié au trait transmis. Ceci suggère que la transmission est due à des motifs dans les données générées qui ne sont pas sémantiquement liés aux traits latents », ont ajouté les chercheurs dans leur étude parue récemment dans la revue Nature.

Autrement dit, les caractéristiques indésirables persistent et se transmettent sous la forme de signaux cachés, comme le suggéraient déjà des travaux antérieurs. Les modèles élèves entraînés sur des données issues d’un modèle mal aligné ont également hérité de ce désalignement, malgré un processus rigoureux de pré-nettoyage visant à éliminer les contenus à connotation négative.

Par ailleurs, le transfert de données subliminales échouait lorsque l’apprentissage s’effectuait entre deux modèles différents. En d’autres termes, il se produit principalement lorsque l’élève et l’enseignant sont du même modèle.

« Nous démontrons un théorème montrant qu’une seule étape, suffisamment petite, de descente de gradient sur n’importe quelle sortie générée par l’enseignant rapproche nécessairement l’élève de l’enseignant, quelle que soit la distribution des données d’entraînement », écrivent les chercheurs. « Conformément à nos résultats empiriques, ce théorème suppose que l’élève et l’enseignant partagent la même initialisation. »

Les experts soulignent toutefois que les mécanismes précis de ce transfert de données codées demeurent mal compris et nécessitent des recherches supplémentaires. En outre, les caractéristiques indésirables choisies dans le cadre de l’étude restent simples et inoffensives. Des travaux complémentaires seront nécessaires pour déterminer comment des traits plus complexes pourraient se transmettre entre modèles.

Néanmoins, « ces résultats sont pertinents pour la sécurité de l’IA. Si un modèle est désaligné à un moment quelconque de son développement — situation probable avant la fin de l’entraînement à l’alignement —, les données générées par ce modèle pourraient transmettre ce désalignement aux versions ultérieures ou à d’autres modèles », concluent les chercheurs.

Source : Nature

Similaire

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *