-
Remerciements pour les contributions de Jan et explication de la stratégie
- Nous remercions Jan pour ses contributions et pensons qu’il continuera à contribuer à la mission depuis l’extérieur.
- Nous voulons expliquer notre stratégie concernant les questions soulevées par son départ.
-
Renforcer la prise de conscience des risques et des opportunités de l’AGI
- Renforcer la prise de conscience des risques et des opportunités de l’AGI afin que le monde soit mieux préparé.
- Démontrer à plusieurs reprises la capacité de mise à l’échelle du deep learning et en analyser les implications.
- Appeler à une gouvernance internationale de l’AGI, un sujet qui n’était pas populaire à l’époque.
- Pionnier de la science de l’évaluation des risques catastrophiques des systèmes d’IA.
-
Poser les bases du déploiement de systèmes sûrs
- Poser les bases du déploiement sûr de systèmes de plus en plus capables.
- Rendre une nouvelle technologie sûre pour la première fois n’est pas chose facile.
- Beaucoup de travail a été accompli pour présenter GPT-4 au monde en toute sécurité.
- En s’appuyant sur les enseignements tirés du déploiement, continuer à améliorer le comportement des modèles et la surveillance des abus.
-
Les défis à venir
- L’avenir sera plus difficile que le passé.
- Il faut continuer à renforcer le travail sur la sécurité à la hauteur de l’importance des nouveaux modèles.
- Cela a été structuré via le Preparedness Framework introduit l’an dernier.
-
Vision de l’avenir
- À mesure que les modèles deviendront plus puissants, ils devraient s’intégrer plus profondément au monde.
- Les utilisateurs n’interagiront pas seulement avec un modèle unique via des entrées et sorties textuelles, mais avec des systèmes composés de plusieurs modèles multimodaux et d’outils.
-
Développer des systèmes sûrs et bénéfiques
- Nous pensons que ces systèmes seront très bénéfiques et utiles aux personnes, et qu’ils pourront être fournis en toute sécurité.
- Beaucoup de travail de fond est nécessaire pour cela.
- Cela inclut une réflexion attentive sur les éléments connectés pendant l’entraînement, ainsi que des solutions à des problèmes difficiles comme la supervision évolutive.
- Tout en construisant dans cette direction, nous ne savons pas encore quand les critères de sécurité de lancement seront atteints, et un retard du calendrier de lancement est acceptable.
-
Boucles de rétroaction et tests rigoureux
- Nous reconnaissons qu’il est impossible d’imaginer tous les scénarios futurs possibles.
- Il faut des boucles de rétroaction très étroites, des tests rigoureux, une réflexion attentive à chaque étape, une sécurité de niveau mondial, et un équilibre entre sécurité et capacités.
- Nous continuerons à mener des recherches sur la sécurité selon différents horizons temporels.
- Nous poursuivrons la collaboration avec les gouvernements et diverses parties prenantes.
-
Comprendre la voie vers l’AGI
- Il n’existe aucun playbook éprouvé pour explorer la voie vers l’AGI.
- Une compréhension empirique aidera à éclairer la voie à suivre.
- Nous travaillons à offrir d’immenses bénéfices tout en atténuant les risques graves.
- Nous prenons notre rôle très au sérieux et examinons attentivement les retours sur nos actions.
1 commentaires
Avis sur Hacker News
Dans une entreprise tech suffisamment grande, les organisations de réduction des risques comme le juridique, les achats ou l’IT ne peuvent évoluer que dans la fenêtre d’Overton située entre les risques que l’entreprise les a embauchées pour éviter et le désir de la direction d’avancer vite quand elle estime que c’est nécessaire.
Les responsables des risques finissent par voir, à répétition, des avertissements de plus en plus fermes ignorés ou frontalement contestés, puis soit ils s’adaptent, soit ils partent parce que cela heurte leur sens de l’éthique.
Peut-être que l’« AGI » et les peurs de niveau extinction de l’humanité rendent tout cela inutilement dramatique. Remplacez AGI par « absence de politique interdisant l’usage d’appareils personnels » et il doit bien exister une startup où le responsable sécurité était obsédé par la politique interne, où la direction ne l’était pas, et où cette personne a fini par démissionner.
Ou bien c’est peut-être réellement aussi grave et dangereux que ça en a l’air. De l’extérieur, c’est difficile à juger.
Que les récentes passes d’armes publiques ne soient que des fuites de drames internes ou de politique interne, ou que l’attitude de l’entreprise face à ce problème ne soit pas assez sérieuse, aucune des deux options n’est bonne.
Cette organisation ressemble de plus en plus à un cirque, et pire encore, à une organisation qui passe à côté de l’essentiel. Il est très inquiétant que ces gens « pilotent » la commercialisation de cette technologie et donnent le ton au secteur. Surtout quand des figures clés qui avaient rejoint l’entreprise par principe et pour des raisons morales semblent partir en masse.
Au bout du compte, on va sans doute découvrir assez vite ce que donne le fait d’avoir confié tout cet argent, ce pouvoir, cette responsabilité et cette confiance à la Silicon Valley.
Un modèle superintelligent qui refuse les instructions est aussi inutile qu’un modèle stupide qui ne les comprend pas. L’équipe d’alignement faisait elle aussi partie de la course à la création de modèles plus puissants. Si vous voulez comprendre plus techniquement, regardez le dernier article d’OpenAI : https://openai.com/index/weak-to-strong-generalization/
Bien sûr, si l’on convainc les gens qu’un grand modèle de langage possède une agentivité incarnée et peut s’échapper des systèmes comme un virus informatique, on peut présenter cela comme un problème général de sécurité. Mais un grand modèle de langage est un générateur de texte. Physiquement, il ne peut rien faire ; il ne peut agir que si nous l’y autorisons et si nous le connectons à quelque chose.
Le vrai risque est que les gens ne comprennent pas cela, et qu’un grand nombre d’entre eux veuillent connecter ces modèles à des situations dangereuses au seul motif qu’OpenAI a garanti leur sécurité. Si l’on n’a pas accès aux données d’entraînement, on ne peut pas savoir quels comportements ont été appris ni comment le modèle se comportera. Avec les données d’entraînement, on peut le comprendre bien mieux, et l’incertitude restante se limite au non-déterminisme de l’implémentation. Cela reste au moins un processus probabiliste explicable.
Ils ont laissé l’équipe sécurité prendre la main, et le résultat a été un produit détesté par tout le monde. Et maintenant, il est intéressant de voir qu’une entreprise qui produit globalement des produits parmi les meilleurs de leur catégorie se fait à nouveau détester par la communauté tech parce qu’elle n’a pas laissé l’équipe sécurité dominer le développement produit.
Le résultat est une pièce de théâtre où la double pensée et la novlangue deviennent la norme ; pour rester, il faut privilégier l’interprétation la moins contraignante possible de la lettre des lois applicables plutôt que leur esprit, ainsi que la pièce elle-même.
Pour une manière très pragmatique de penser la réalité d’une culture de sécurité durable, [1] mérite aussi d’être consulté.
[1] https://github.com/lorin/resilience-engineering/raw/master/b...
L’idée que l’IA va éliminer l’humanité pour fabriquer des trombones détourne l’attention des vrais dangers actuels, et c’est agaçant
Les escrocs sont en plein âge d’or, et leurs capacités vont encore s’améliorer et devenir plus faciles à utiliser. Les gens croient aveuglément des sorties hallucinées et deviennent réellement plus bêtes. Même la communication ordinaire se délite, parce qu’on ne peut plus savoir si l’interlocuteur n’a pas simplement copié-collé du charabia d’IA au lieu de participer à une vraie discussion
On a déjà vu des produits de petites amies IA, et le nombre d’utilisateurs de certains d’entre eux n’inspire pas confiance dans l’avenir de notre espèce
Le plus gros problème, c’est que toutes sortes de cadres dirigeants complètement dingues et de profils MBA ne s’intéressent qu’à extraire jusqu’au dernier centime, par tous les moyens. Y compris en licenciant et en remplaçant des milliers de personnes d’un coup par de médiocres chatbots propriétaires d’une entreprise soutenue par Microsoft
Je ne pense pas que l’IA lancera des armes nucléaires, mais je crois qu’elle remplacera les emplois de tout le monde et rendra les puissants encore plus puissants. « Mais il y aura le revenu de base ! », s’écriera le flagorneur de l’IA, mais prononcer une formule magique ne change pas le monde réel
Si le but d’une tâche est de produire le plus possible de bullshit le plus vite possible, les grands modèles de langage seront excellents
Pas de smartphones en vue, les gens viennent physiquement, se parlent, achètent de la nourriture locale, rient et boivent un verre. Ensuite, ils vont manger chez des amis ou faire des activités en plein air. En revanche, pour les gens constamment collés en ligne, cela a clairement l’air sombre
Étrangement, beaucoup de dirigeants semblent littéralement croire que minimiser les coûts de main-d’œuvre est plus important que fournir de la valeur aux clients
Je suis aussi d’accord sur le problème des petites amies virtuelles. Ajoutez-y la VR, et des garçons de plus en plus isolés socialement combleront leurs besoins avec cette technologie
Il est vrai que l’IA peut produire beaucoup de sorties automatisées, mais mon argument est qu’elles sont presque toujours médiocres, au mieux
Il y a beaucoup à dire sur le fait que les risques de l’IA ne viennent pas de l’IA elle-même, mais des personnes qui l’exploitent et la financent. Dire que l’IA elle-même est dangereuse est un pur tissu d’âneries
Les grands modèles de langage sont utiles dans une certaine mesure, mais d’après mon expérience, ils ne sont pas encore prêts pour des tâches plus difficiles que les travaux très basiques
Crier très fort à la sécurité de l’IA et créer un sentiment de catastrophe ressemble à une stratégie visant à accroître l’importance d’OpenAI et à exagérer les capacités des grands modèles de langage. Cette ère de « l’IA » consiste à faire semblant que les machines peuvent penser, et que les gens qui les construisent sont des prophètes
Pendant des décennies, beaucoup de gens ont plaidé pour la sécurité. Ils ont prédit et construit la trajectoire de l’IA, ils avaient raison, et nous devrions les écouter
« Si l’on accepte qu’une machine véritablement intelligente puisse avoir des effets profonds, et qu’il existe ne serait-ce qu’une faible possibilité que cela se produise dans un avenir prévisible, il est prudent d’essayer de s’y préparer à l’avance. Si nous attendons qu’il semble très probable que des machines intelligentes apparaissent bientôt, il sera trop tard pour discuter et réfléchir suffisamment aux problèmes concernés. »
~ Cofondateur de DeepMind, 2008
https://www.vetta.org/documents/Machine_Super_Intelligence.p...
Il est tout à fait possible que ce soient des personnes profondément naïves, qui comprennent très peu les bases empiriques de ce qu’elles font
Ils disent avoir « appelé à une gouvernance internationale de l’AGI avant que ce soit populaire », puis ont menacé de se retirer de l’UE dès qu’une telle gouvernance a commencé à être mise en place
Ils disent avoir « posé les bases pour déployer en sécurité des systèmes de plus en plus capables. Trouver comment rendre une nouvelle technologie sûre pour la première fois n’est pas facile », mais c’est d’autant plus vrai quand OpenAI n’est pas du tout open
Ils parlent de « prudence quant à ce à quoi elle est connectée pendant l’entraînement, de solutions à des problèmes difficiles comme la supervision scalable, de nouveaux types de travaux de sécurité », mais c’est ce que l’UE demandait. Quand elle a exigé la divulgation des sources protégées par le droit d’auteur, la documentation des modèles de fondation, etc., ils ont menacé de se retirer
La traduction de « nous pensons que la compréhension empirique peut éclairer la voie à suivre. Nous sommes énormément… » est la suivante : « nous voulons rester aussi fermés que possible, obtenir un fossé défensif suffisant et des entreprises dépendantes de nous afin de rester pertinents et indispensables »
Eux non plus ne veulent pas mourir, donc il n’y a pas lieu de penser qu’ils n’ont aucune incitation à assurer la sécurité de tout le monde
Il y a quelques faits
C’est une réponse aux affirmations de Jan : https://x.com/janleike/status/1791498174659715494
La réponse ne contient rien de concret sur l’alignement de l’IA. On ne sait pas quand l’alignement de l’IA pourra être développé. L’éthique de l’IA et les biais de l’IA sont nécessaires, mais ce sont des préoccupations différentes de l’alignement de l’IA. On ne sait pas non plus quand sera développée une IA susceptible de provoquer un risque existentiel
Si une IA présentant un risque existentiel est développée avant l’alignement de l’IA, il existe un certain risque d’extinction de l’humanité. OpenAI est en première ligne du développement d’IA présentant un risque d’extinction de l’humanité, tout en n’allouant pas suffisamment de ressources à l’alignement de l’IA
Ça me met mal à l’aise de m’abonner à ChatGPT
Comme beaucoup en conviennent, le danger de l’IA n’est pas une entité surhumaine incontrôlable
Le danger est bien plus proche et réel. Par exemple, quand de grands modèles de langage sont appliqués à la modération de chats et identifient mal des propos, quand ils résument un rapport militaire de 100 pages et en tirent une mauvaise conclusion, ou quand ils hallucinent certains détails dans l’actualité qui finissent par être acceptés comme des faits historiques des années plus tard
La longue traîne de ces conséquences grandira à la mesure de l’échelle d’utilisation des grands modèles de langage. Un problème unique, jusque-là invisible, pourrait avoir un impact bien plus important que les autres. Les morts qui en résulteront mèneront à davantage de régulation, tandis que les autres conséquences deviendront simplement notre nouveau mode de vie
Même si une machine est moins précise qu’un humain faisant le même travail, elle est plus facile à auditer, son comportement est reproductible et elle peut passer à l’échelle. Même si une erreur de guerre imaginable tue beaucoup de gens, cela pourrait quand même être préférable, puisque les humains feront à la place un meilleur travail
Au final, c’est un compromis
La manière d’utiliser seulement les prénoms, comme « Sam et Greg », pour donner l’impression d’une relation familière avec l’entreprise m’agace
La tentative de paraître décontracté et humain sonne faux, et en même temps, l’attitude consistant à les élever dans la culture populaire en les désignant seulement par leur prénom paraît arrogante
« Par exemple, notre équipe a beaucoup travaillé pour lancer GPT-4 dans le monde en toute sécurité » — vous plaisantez ?
Je ne pense pas qu’il faille s’inquiéter du superalignement alors qu’OpenAI n’est même pas capable de définir ou de tester correctement l’AGI
« Modération de modèles », ça sonnerait moins sexy, non ?
La peur que l’AGI détruise l’humanité semble surtout venir du soupçon qu’un dispositif pensant logiquement arriverait effectivement à la conclusion que nous devrions être éliminés
Si l’on confie à une AGI la gestion d’une usine de trombones, on pourrait revenir un jour et constater que la majeure partie du carbone et du fer de la galaxie a été reconfigurée en trombones. L’extinction de la faune et de la flore locales ne serait qu’un sous-produit de cette dynamique. Pour un aperçu simple, voir [2]
[2]: https://selfawaresystems.com/wp-content/uploads/2008/01/ai_d...
Mais pourquoi faudrait-il exterminer les humains ? Ne pourrait-on pas créer des réserves naturelles pour nous et pour les autres formes de vie, à des fins de conservation biologique et de recherche ? Ce genre de pratique existe dans les sociétés humaines depuis des milliers d’années
Si nous créons quelque chose qui nous ressemble mais qui est bien plus capable, nous serons terrifiés et en difficulté