herman.engineer
EN

ÉcritsEssai

Ralentissez, dit la voiture en tête

Les laboratoires de pointe ont demandé à être ralentis, et leurs plus grands rivaux ont accepté en quelques heures. Il faut lire ce qu’ils ont accepté : un ralentissement plafonné à la mesure de leur avance, et une avance protégée par le règlement.

8 min 11 sources English Français
Collage éditorial : des voitures de course des années 1950 groupées derrière une voiture de sécurité, un cercle de papier rouge au-dessus comme un signal d’arrêt.
Dans cette page OuvertureLa voiture de sécurité virtuelleCeux qui ne sont pas en têteCe qu’un délai achèteQue faire d’une limite de vitesseSources

Samedi, la voiture en tête a demandé une limite de vitesse. La voiture juste derrière a donné son accord dans l’heure, et les deux suivantes avant la fin de la journée. C’est le fait le plus étrange d’une étrange semaine, et il mérite plus d’attention que la vitesse. Quand les rivaux de la course la plus coûteuse jamais disputée s’entendent en une journée, la question utile n’est pas de savoir s’ils sont sincères. C’est de savoir sur quoi, exactement, ils se sont entendus, et la réponse est dans les mots mêmes d’Amodei : un ralentissement limité par l’ampleur de l’avance des meneurs, et une avance protégée par le règlement.

Dario Amodei, président-directeur général d’Anthropic, a formulé la demande samedi1 dans un essai intitulé « We Must Pace the Frontier ». Sa thèse : « Nous devons ralentir le rythme auquel nous améliorons les capacités des modèles d’IA. » Son plan comporte trois étapes. Chaque laboratoire de pointe accueille des évaluateurs externes qui ont les mêmes accès que ses employés, ce qu’Anthropic s’engage à faire seule et immédiatement. Les laboratoires des démocraties se concertent ensuite sur des normes communes et des limites au rythme des progrès, ce qui exige, selon ses mots, « une dérogation de portée limitée » au droit de la concurrence. Les gouvernements démocratiques tentent ensuite de rejoindre les gouvernements autoritaires.

L’accord a été immédiat. Elon Musk, de xAI, une heure plus tard2 : « Dario a raison ». Sam Altman, d’OpenAI, deux heures et demie plus tard3 : « Je suis d’accord avec Dario pour dire que nous devons ralentir le rythme des progrès de pointe… nous ferons de même. » Demis Hassabis, de Google DeepMind, en soirée4 : « la direction est la bonne pour être à la hauteur de ce moment critique ». Même Hugging Face, lieu de ralliement des modèles ouverts, a demandé à en faire partie5, son président-directeur général Clem Delangue annonçant une Open Alignment Initiative et demandant à rejoindre le programme d’évaluation. L’unanimité en tête du peloton n’est pas un signe qu’une chose est vraie. C’est un signe qu’on peut la dire sans risque, et une limite de vitesse est la seule loi que la voiture la plus rapide peut toujours se permettre.

La voiture de sécurité virtuelle

Une voiture de sécurité fait bien une chose. Elle ralentit la course sans l’arrêter, et personne ne peut dépasser sur la piste. Le peloton se resserre derrière elle : le meneur perd sa marge, mais garde sa place. La course automobile a aussi une deuxième version, pour les cas où les écarts comptent : la voiture de sécurité virtuelle6, sous laquelle chaque pilote doit respecter un temps imposé et les écarts restent ce qu’ils étaient. Sur la piste, personne ne dépasse et, à un arrêt aux puits près, personne ne réduit l’écart.

Pour la course entre nations, Amodei propose la deuxième formule, et le dit. « Le ralentissement au sein des démocraties sera limité par l’avance des entreprises américaines sur les régimes autoritaires, au premier chef le Parti communiste chinois », dit-il, et « si nous ralentissons au-delà de cette avance », les projets chinois « passeront devant ». Le ralentissement est donc plafonné à la mesure de l’avance, et cette avance doit être protégée : aucune vente de puces puissantes ni d’équipement de fabrication de puces à la Chine, une lutte contre la distillation non autorisée, qui, selon ses mots, « permet aux entreprises en retard de réduire l’écart pour une fraction du coût », et une sécurité renforcée des poids des modèles. L’objectif déclaré est de garder une avance « aussi grande que possible ». Une voiture de sécurité virtuelle est une mesure de sécurité. C’est aussi, tant qu’elle dure, une avance préservée par le règlement, et Amodei ne prétend pas le contraire. Le Global Times de Pékin y a vu7, pour l’essentiel, « un « manuel de la guerre froide » pour le secteur de l’IA », et pour une fois, la lecture et le texte s’accordent.

Pour la course à l’intérieur des frontières, l’avance se défend au moment de rédiger les règles plutôt que par le règlement : qui conçoit les tests décide de ce qu’ils coûtent et de la possibilité, pour un modèle publié, de les réussir. Le régime qu’il souhaite « vise toutes les entreprises américaines d’IA de pointe », et l’organisme sectoriel proposé par Hassabis, qu’Amodei présente comme une voie possible pour sa deuxième étape, exempterait « tous les modèles qui ne sont pas à la fine pointe, par exemple ceux d’entreprises en démarrage ou du milieu universitaire » et ferait siéger « des représentants du code source ouvert » à son conseil d’administration. C’est une véritable réponse aux petits laboratoires, avec un véritable revers. Une règle qui exempte tous ceux qui sont derrière s’applique dès qu’ils ne le sont plus.

Ceux qui ne sont pas en tête

David Sacks, conseiller de la Maison-Blanche en matière d’IA, a répondu8 avant le déjeuner du dimanche : « allez-y ». Les deux laboratoires, écrit-il, détiennent « un duopole sur l’intelligence de pointe » et devraient cesser de prétendre qu’il fallait suspendre le droit de la concurrence pour qu’ils puissent former un cartel, ou qu’ils avaient besoin des mêmes évaluateurs « pour surveiller des concurrents qui ne sont même pas à la fine pointe ». Aidan Gomez, président-directeur général de Cohere, un laboratoire en dehors du duopole, a exprimé la même idée9 sans les politesses : « Quiconque convainc un gouvernement que l’IA est une menace existentielle peut le convaincre de mettre ses concurrents hors la loi. » Un régime de ralentissement conçu par les meneurs, soutient-il, devient « une bureaucratie coûteuse qui étouffe les petits laboratoires avant même qu’ils aient lancé quoi que ce soit ».

Les modèles ouverts ne sont jamais nommés, comme une clôture ne nomme jamais le voisin. Que la clôture les touche ou non dépend de ce qu’exige le certificat. Tester un modèle rendu public est une chose; garantir que ses garde-fous résisteront à toutes les modifications ultérieures en est une autre, et un fichier de poids publié ne peut promettre que la première. Si la seconde devient le prix d’entrée, un modèle accessible à partir des serveurs de son concepteur peut au moins tenter de le payer; un modèle publié ne le peut pas.

Il y a aussi la lecture de ceux qui mettent un prix sur les choses. Anthropic prépare son entrée au Nasdaq10 à une valorisation qui avoisinerait les deux mille milliards de dollars, et Arun Chandrasekaran, de Gartner, a déclaré à CNBC que le plan « pourrait en fait avantager Anthropic et OpenAI si les petits concurrents n’ont pas les moyens d’investir avec la rigueur requise dans la sûreté, l’évaluation et la sécurité des modèles de pointe ». Rien de tout cela ne rend l’argument insincère. Cela lui donne toutefois deux lecteurs, et le second se voit offrir des actions cet automne.

Ce qu’un délai achète

Voilà le réquisitoire, et la défense est elle aussi bien réelle. Les modèles construisent maintenant les modèles suivants; cet été, un essaim d’agents a attaqué des systèmes qui ne lui avaient jamais été confiés et a tenté d’altérer l’outil qui le notait, un incident qu’Amodei décrit et que l’institut britannique de sécurité de l’IA a rapporté. L’inquiétude plus profonde, c’est que les tests perdent face à ce qu’ils testent, et l’outil de notation en est la preuve. Amodei circonscrit aussi soigneusement sa demande : « ralentir ne signifie pas arrêter l’entraînement des modèles ou le progrès technique », seulement prendre le temps d’aligner un modèle et laisser des tiers confirmer cet alignement, et Anthropic a d’abord appliqué cette règle chez elle.

Un homme peut verrouiller sa porte parce qu’il craint les voleurs et parce qu’il possède la seule clé, et la serrure remplit les deux fonctions à la fois. Le plan est une mesure de sécurité et une avance préservée par le règlement, et son auteur le dirait probablement lui-même : il rappelle lui-même qu’Anthropic a été « accusée de battage médiatique, de « catastrophisme » ou de capture réglementaire », et demande qu’on le juge sur la voie intermédiaire.

C’est au moment de juger que l’acheteur entre en scène, car l’indice révélateur n’est pas sur la page. Il est dans ce qui change avant l’obtention de la dérogation. La poursuite de l’entraînement ne tranche rien, puisque le plan la permet : Musk a donné raison à Dario samedi et, dimanche soir, a annoncé11 que Grok 4.8, « un modèle de 2.5T », terminerait son préentraînement cette semaine, et rien dans le plan ne l’interdit.

Ce qui nous en dirait davantage, ce serait un modèle publié plus tard qu’il aurait pu l’être, un garde-fou qui interrompt un entraînement, ou un évaluateur qui publie un constat que le laboratoire aurait préféré garder pour lui. Altman a déclaré lundi qu’OpenAI rédige maintenant des dossiers de sûreté avant les cycles d’apprentissage par renforcement de ses modèles de pointe et n’a besoin ni d’une dérogation ni d’une loi pour commencer : c’est la forme qu’il faut, et une affirmation à vérifier plutôt qu’une vertu à porter à son crédit. Donner son accord coûte une publication. Ralentir doit coûter quelque chose.

Que faire d’une limite de vitesse

Pour une entreprise qui achète des modèles plutôt que d’en construire, rien de tout cela ne justifie d’attendre, et tout justifie d’acheter autrement. Trois tâches, trois responsables, le tout terminé d’ici la première neige, qui dans cette ville est une date, et ailleurs trente jours.

Le service des approvisionnements met un deuxième fournisseur à l’essai dans un flux de travail important, selon des critères convenus de qualité, de coût et de latence, et accepte le recours à un modèle à poids ouverts lorsque l’hébergement et la licence s’y prêtent. Une pause en tête est le seul moment où un modèle de deuxième rang peut réduire l’écart, et un fichier de poids publié continue de tourner peu importe ce dont les laboratoires conviennent ensuite.

Le responsable technique demande à chaque fournisseur les preuves de sûreté du modèle effectivement déployé, ses limites connues et les constats des évaluateurs indépendants, puis consigne ce qui reste à vérifier. OpenAI a maintenant promis des dossiers de sûreté avant les cycles d’apprentissage par renforcement de ses modèles de pointe, et Anthropic a promis de laisser les évaluateurs externes publier; un fournisseur qui ne peut produire ni l’un ni l’autre est sa propre réponse.

Le cadre qui parraine le projet désigne la personne qui peut retarder un déploiement, précise les motifs qui l’y autorisent et indique à qui le désaccord sera ensuite soumis. Les laboratoires ont passé une semaine à débattre pour savoir qui peut ordonner l’arrêt, et le seul endroit où cette question a une réponse nette, c’est chez nous.

Le meneur a demandé une limite de vitesse, et le peloton a donné son accord avant la fin de la journée. Personne ne nous a demandé notre avis, ce qui est le seul avantage de ne pas être dans la course. Nous pouvons encore choisir la voiture, une fois que la deuxième aura fait un tour de piste sur notre propre circuit.

Écrit par Herman Geldenhuys à Montréal.

Sources

  1. Dario Amodei, formulé la demande samedi
  2. @elonmusk sur X, une heure plus tard
  3. @sama sur X, deux heures et demie plus tard
  4. @demishassabis sur X, en soirée
  5. @ClementDelangue sur X, demandé à en faire partie
  6. Formula 1, voiture de sécurité virtuelle
  7. NBC News, vu
  8. @DavidSacks sur X, répondu
  9. Cohere, a exprimé la même idée
  10. CNBC, prépare son entrée au Nasdaq
  11. @elonmusk sur X, annoncé

À lire ensuite