En résumé
Anthropic annonce un filigrane invisible pour les textes générés par Claude.
Le mécanisme intervient pendant la sélection du prochain token.
Sebastian Raschka détaille la génération, la détection et les limites du procédé.
Le signal : Anthropic veut identifier les textes produits par Claude grâce à un filigrane invisible intégré à la génération des tokens.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Anthropic annonce un filigrane pour les textes produits par ses modèles Claude. L’annonce vise notamment à identifier un texte publié comme généré par un modèle Claude, tel que Claude Opus 4.8. Le filigrane doit rester invisible pour les utilisateurs. Anthropic prévoit de le décoder afin de déterminer si un texte porte sa marque. Sebastian Raschka présente le fonctionnement dans une vidéo de 48 minutes accompagnée d’un transcript. Sa présentation explique la génération de texte, le choix des tokens et le mécanisme de détection. Elle s’appuie aussi sur plus de 50 diapositives, alors que le projet initial devait en compter 10. L’annonce d’Anthropic décrit le dispositif en amont de cette analyse.
Le mécanisme reste intégré au processus habituel de génération de texte. Raschka le décrit comme une modification limitée du fonctionnement courant des modèles de langage. Pour produire une réponse, le système transforme d’abord le texte d’entrée en identifiants de tokens. Ces identifiants passent ensuite dans le modèle de langage. Le modèle produit une distribution de scores pour le prochain token. Ces scores, appelés logits, couvrent l’ensemble du vocabulaire possible. Le token sélectionné est ensuite reconverti en texte. Le texte obtenu est ajouté à l’entrée pour poursuivre la génération. Cette boucle continue jusqu’à la production d’un token de fin de texte. Raschka propose également ses diapositives détaillées.
La sélection varie selon la méthode utilisée par le modèle. Le décodage glouton consiste à choisir le score le plus élevé. Raschka explique toutefois que les grands modèles de langage n’utilisent généralement pas toujours cette méthode. Une sélection systématique du score maximal pourrait produire des réponses identiques et davantage reproduire les données d’entraînement. Le filigrane intervient donc dans cette étape de sélection du prochain token. L’exemple présenté utilise la phrase « the capital of Germany is » et le token « Berlin ». Dans cette démonstration, « Berlin » reçoit le score le plus élevé. Le modèle calcule cependant ces scores sur tout son vocabulaire avant de produire le token suivant.
Le vocabulaire atteint environ 250 000 tokens dans l’exemple pédagogique de Raschka. Une distribution complète serait difficile à représenter, car les scores seraient très resserrés sur un graphique. Le chercheur montre donc une portion située autour des indices 19 800 à 19 900. L’indice 19 846 reçoit le score le plus élevé dans son illustration. Le score est ensuite détokenisé pour produire « Berlin ». Une réponse plus longue répète cette opération après chaque token généré. Raschka insiste sur le rôle des scores bruts, qui peuvent aller de moins l’infini à plus l’infini. Leur conversion en probabilités dépend de la méthode d’échantillonnage employée.
La détection repose sur un filigrane invisible que les utilisateurs ne peuvent pas lire directement. Anthropic doit disposer du procédé permettant de décoder cette marque dans un texte. L’objectif déclaré est d’identifier les sorties de ses modèles lorsqu’elles sont publiées ailleurs. Raschka consacre aussi sa présentation aux possibilités d’échec ou de retrait du filigrane. Sa vidéo cherche ainsi à expliquer le fonctionnement, les avantages et les limites du procédé. Elle relie cette analyse aux mécanismes généraux des modèles de langage, notamment à la tokenisation et à l’échantillonnage. La présentation complète est disponible dans la version vidéo publiée sur YouTube.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés