En résumé
Oxford a autorisé OpenAI à utiliser des textes historiques de la Bodleian pour entraîner ses modèles.
OpenAI avait reçu 125 000 images de documents historiques de la bibliothèque en juin 2025.
Des membres du personnel ont soulevé des risques réputationnels et environnementaux liés au partenariat.
Le signal : La Bodleian a partagé 125 000 images numérisées avec OpenAI dès juin 2025, dont des thèses historiques et des ballades du XVIe siècle.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Oxford et OpenAI ont conclu en mars 2025 un partenariat autour de la numérisation de textes conservés à la Bodleian Library. L’université avait alors présenté le logiciel d’OpenAI comme un moyen de rendre ces contenus plus accessibles aux étudiants et aux chercheurs. Des documents internes indiquent toutefois que les fichiers numérisés ont aussi servi à « alimenter l’ensemble d’entraînement d’OpenAI ». Le projet concerne des textes historiques, et l’université affirme que les contenus sont libres de droits. OpenAI s’est dite fière de contribuer à préserver les connaissances historiques mondiales dans ses modèles. L’entreprise a également invoqué la nécessité de représenter différentes cultures, histoires et perspectives auprès de plus d’un milliard d’utilisateurs.
La numérisation précède l’entraînement. L’annonce de mars 2025 ne précisait pas que les documents seraient utilisés pour entraîner les modèles d’OpenAI. Cette utilisation apparaît dans des procès-verbaux de réunions obtenus grâce à une demande d’accès aux documents administratifs. Ces comptes rendus rapportent des préoccupations de membres du personnel, notamment au sein du comité de gouvernance de la Bodleian. Ils évoquent le risque réputationnel associé au partenariat avec OpenAI. Ils mentionnent aussi l’effet d’une technologie énergivore sur les engagements environnementaux de l’université. Oxford affirme que la numérisation constituait son intérêt principal et que la contribution aux données d’entraînement avait été évoquée avec transparence. Lire l’article original du Guardian
125 000 images de dissertations historiques avaient été transmises à OpenAI en juin 2025. Ces documents comprennent des thèses de doctorat rédigées aux XIXe et XXe siècles dans des universités européennes et américaines. La collection comprend aussi 10 000 ballades imprimées du XVIe siècle, avec leurs paroles et leurs notations musicales. Des échanges internes ont porté sur la numérisation de documents administratifs irlandais du XVIIIe siècle, de lettres privées de l’écrivaine Marie Edgeworth et des carnets de Dorothy Hodgkin sur la pénicilline. Le contrat ouvre également la possibilité d’une numérisation beaucoup plus large des 23 millions d’ouvrages de la Bodleian. Les procès-verbaux évoquent enfin la création d’un agent conversationnel appelé « Ask the Bod ».
Les livres rares attirent également l’attention des entreprises d’IA. Des libraires d’occasion ont signalé des commandes de titres spécialisés, dont un guide sur les outils agricoles de l’Afrique du XVIIIe siècle et des biographies de pilotes automobiles des années 1950. Des propriétaires de librairies ont estimé que ces ouvrages pouvaient fournir des données encore absentes des collections numérisées en ligne. Les sites collectés automatiquement contiennent de plus en plus de contenus générés par l’IA, ce qui réduit leur utilité pour l’entraînement selon l’article. OpenAI a signé des accords comparables avec la Boston Public Library, Caltech, le MIT et l’université du Michigan. Oxford est le seul membre britannique de NextGenAI.
Oxford conserve les scans et précise que le matériel numérisé est modeste par son ampleur, libre de droits et non exclusif à OpenAI. La Bodleian garde les droits sur les fichiers et prévoit de les publier ouvertement en ligne dans les prochains mois. L’université affirme que ce projet permettra à davantage de personnes d’accéder aux documents. Les collections physiques restent intactes dans cet accord. Cette situation contraste avec celle décrite pour certains achats de livres d’occasion destinés au scan. Anthropic, concurrent d’OpenAI, a consacré des dizaines de millions de dollars à l’acquisition de livres avant leur découpe et leur numérisation, même si l’entreprise affirme ne pas acheter ni détruire d’ouvrages rares ou anciens. Voir les informations publiées par le Guardian
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés
À lire aussi