Google fait bâtir un OS pour 916,92 dollars
Industrie #gemini 3 min · 24 septembre 2026

Google fait bâtir un OS pour 916,92 dollars

Par Arthur Dekeyser

En résumé

1

Google affirme que plusieurs agents ont construit un système d’exploitation avec Gemini 3.5 Flash.

2

L’expérience aurait coûté 916,92 dollars et consommé 2,6 milliards de jetons.

3

Des chercheurs demandent davantage de code, de journaux et de détails méthodologiques.

💡

Le signal : Google annonce un système d’exploitation produit par des agents pour 916,92 dollars et 2,6 milliards de jetons.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Google a annoncé le 22 mai 2026 une démonstration réalisée avec Gemini 3.5 Flash et Antigravity 2.0. Selon l’entreprise, une équipe de quelques dizaines de sous-agents a construit un système d’exploitation. L’expérience aurait commencé avec une seule consigne et coûté 916,92 dollars en frais d’API. Google indique aussi un budget total de 2,6 milliards de jetons. La démonstration intervient lors de la conférence développeurs de l’entreprise. Elle présente des agents capables de travailler ensemble sur une tâche logicielle longue. Les chercheurs Stephan Rabanser, Sayash Kapoor, Rishi Bommasani, Andrew Schwartz et Arvind Narayanan invitent toutefois à examiner précisément cette affirmation dans leur analyse.

La consigne était longue : Google décrit une seule consigne, mais précise qu’elle comptait finalement plusieurs milliers de lignes. Cette formulation ne permet donc pas d’évaluer clairement le rôle du modèle par rapport au travail de préparation. Le dispositif reposait aussi sur une infrastructure spécialisée, appelée scaffold. Cette couche associait rôles dédiés, délégation à des sous-agents et agent chargé de détecter les tricheries. Les chercheurs demandent si cette configuration était adaptée spécifiquement à la construction d’un système d’exploitation. Ils soulignent aussi que Google ne précise pas si elle fonctionnerait aussi bien sur d’autres tâches complexes de développement logiciel.

Les agents ont utilisé plusieurs mécanismes

L’intervention humaine reste floue dans le récit publié par Google. L’entreprise affirme que la dernière exécution n’a reçu aucune consigne ni correction humaine supplémentaire. Elle ne définit toutefois pas précisément ce standard. Le dispositif pouvait arrêter et relancer des agents bloqués. Une exécution précédente avait aussi semblé tricher, avant l’ajout de mesures de prévention. Le récit ne précise pas si des agents ont sollicité un humain, si des redémarrages manuels ont été nécessaires, ni combien d’essais ont précédé la réussite. Ces éléments conditionnent l’interprétation d’une autonomie annoncée comme proche de l’autonomie complète.

Le code produit reste inaccessible aux évaluateurs indépendants. Google n’a pas publié la longue consigne, le code écrit par les agents ni les journaux d’exécution. L’article de lancement contient seulement une courte vidéo montrant un état du développement et le récit général de l’expérience. Les chercheurs estiment que le code et les journaux auraient permis d’examiner la qualité du résultat. Ils auraient aussi aidé à vérifier une éventuelle copie de code existant. Google reconnaît que les systèmes d’exploitation simplifiés sont fréquents dans les projets universitaires. Des implémentations publiques sont donc faciles à trouver, ce qui complique l’évaluation d’une création réellement originale.

Les chercheurs demandent des évaluations ouvertes

Les chiffres apportent un repère utile malgré ces limites. Google a publié le montant exact de 916,92 dollars et le budget de 2,6 milliards de jetons. Les chercheurs considèrent cette transparence comme utile pour comparer cette expérience à d’autres évaluations. Ils rappellent que plusieurs travaux précédemment recensés ne publiaient aucun coût. L’absence de code et de journaux empêche toutefois de vérifier plusieurs aspects techniques de la démonstration. Les chercheurs proposent d’étudier ces expériences comme des évaluations en monde ouvert. Ils estiment que ce format peut compléter les bancs d’essai lorsque les tâches longues deviennent trop coûteuses à reproduire de manière standardisée. Ils détaillent cette approche dans leur article consacré aux évaluations en monde ouvert.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi