1 points par GN⁺ 2023-10-02 | 1 commentaires | Partager sur WhatsApp
  • Une expérience de terrain menée par le Harvard Digital Data Design Institute et BCG a évalué, auprès de 758 consultants, dans quelle mesure l’IA modifie la productivité et la qualité du travail des travailleurs du savoir
  • Les tâches incluaient créativité, pensée analytique, rédaction et persuasion, proches du travail réel des consultants, afin d’évaluer l’applicabilité au travail plutôt que de simples benchmarks
  • Pour les tâches bien adaptées à l’IA, ChatGPT-4 a amélioré la vitesse de travail de plus de 25 %, les performances évaluées par des humains de plus de 40 % et le taux d’achèvement des tâches de plus de 12 %
  • Tous les travaux ne bénéficient pas du même effet : la frontière technologique irrégulière, où se distinguent des domaines forts et faibles, apparaît comme une contrainte clé
  • Dans la pratique, les usages se divisent entre les Centaurs, qui répartissent le travail, et les Cyborgs, qui intègrent l’IA dans leur workflow ; il faut évaluer, tâche par tâche, la combinaison entre humain et IA

Expérience de terrain auprès de consultants BCG

  • Karim Lakhani et d’autres chercheurs du Harvard Digital Data Design Institute ont collaboré avec Boston Consulting Group (BCG) pour évaluer l’impact de l’IA sur la productivité des travailleurs du savoir et la qualité de leur travail
  • L’expérience a porté sur 758 consultants, soit 7 % des contributeurs individuels de BCG
  • Les tâches reflétaient l’éventail du travail quotidien des consultants
    • Créativité

    • Pensée analytique

    • Capacités rédactionnelles

      • Persuasion

Gains de performance et limites

  • Dans les domaines de tâches où l’IA fonctionne bien, ChatGPT-4 a fortement amélioré les performances
    • La vitesse de travail a augmenté de plus de 25 %
    • Les performances selon une évaluation humaine ont augmenté de plus de 40 %
    • Le taux d’achèvement des tâches a augmenté de plus de 12 %
  • À l’inverse, les performances de l’IA ne sont pas uniformes sur toutes les tâches
    • Elle produit d’excellents résultats pour certains travaux, mais se montre insuffisante pour d’autres
    • Cette différence est décrite comme une jagged technological frontier

Deux modes d’utilisation observés dans le travail du savoir

  • Les utilisateurs de l’IA se répartissent globalement en deux profils
    • Centaurs : ils divisent et délèguent les tâches entre humains et IA
    • Cyborgs : ils intègrent l’IA dans leur propre workflow
  • Plutôt qu’une opposition binaire entre utiliser ou non l’IA, il est important d’évaluer la valeur produite par la combinaison entre humain et IA dans chaque flux de travail

1 commentaires

 
GN⁺ 2023-10-02
Avis de Hacker News
  • Ces tâches semblent faites sur mesure pour GPT : des domaines comme la créativité, la pensée analytique, l’écriture et la persuasion, par exemple lui demander 10 idées de chaussures, une segmentation de marché, un communiqué de presse ou une note inspirante destinée aux employés.
    Réponse de GPT à la première tâche : https://chat.openai.com/share/db7556f7-6036-4b3d-a61a-9cd253...
    Les hallucinations assurées de GPT sont presque impossibles à distinguer de documents typiques de conseil en management.

    • Si le travail consiste en gros à dire « les idées sont mauvaises, il y a un tableur, personne ne s’intéresse au discours marketing, personne n’est inspiré par le baratin de comité de direction », alors c’est de faible valeur dès le départ, et donc un input presque parfait pour un LLM.
    • C’est vrai si l’on ne regarde que le résultat, mais la valeur des travailleurs du savoir vient surtout de la qualité des inputs.
      Le client ne veut pas « 10 idées », mais « 10 idées utiles fondées sur une compréhension de l’entreprise et du marché ». Si un consultant en management répond à cette question par quelque chose comme « chaussures bateau », il ne gardera pas son client très longtemps.
      De la même manière, en génie logiciel, si vous demandez « écris-moi 10 lignes de code », on peut dire que c’est indiscernable du code que ChatGPT produit tous les jours.
    • « Pour promeneurs de chiens, avec distributeur intégré de sacs à déjections » : je ne sais pas si je dois détester ou aimer ; et « pour personnes malvoyantes, avec retour haptique » : des chaussures haptiques, voilà qui est vraiment innovant.
    • Si les hallucinations assurées de GPT ressemblent à des documents de conseil en management, alors cela semble aussi bien convenir à Harvard et aux institutions qui gravitent autour.
      Mon employeur a engagé plusieurs fois McKinsey, connu pour recruter des profils HYP, et les livrables étaient, pour le dire gentiment, insuffisants. Mon expérience avec ce type d’institutions a globalement été similaire.
      Je sais bien que ce n’est qu’anecdotique, mais j’ai l’impression que ce genre d’étude est fortement teinté de biais de confirmation.
    • La réponse de GPT se lit comme si elle sortait de MAD magazine.
  • Cette étude a enterré le point essentiel. Les LLM ont été meilleurs sur certaines tâches, mais en ont réellement rendu d’autres pires.
    La première tâche est une tâche de généraliste, que l’étude qualifie de « dans la frontière », donc l’amélioration des performances n’est pas surprenante. Il s’agit d’explorer un domaine bien défini sans nécessiter de forte expertise métier, ce qui correspond aux points forts des LLM. Les tâches que les jeunes consultants effectuent en début de carrière, dans des rôles proches de business analyst, sont aussi largement de ce type généraliste.
    Les LLM sont forts dans ce type de recherche générale parce qu’ils ont généralisé beaucoup d’informations, mais cette généralisation est aussi leur faiblesse. Voyez-les comme des journalistes spécialisés dans un domaine de recherche. Quand on lit le journal, on a l’impression d’obtenir des éclairages ; mais dès qu’on lit un article sur un sujet que l’on connaît bien, on voit que l’analyse est pleine de défauts et que le journaliste ne comprend pas le sujet à notre niveau.
    La deuxième tâche, « hors de la frontière », exigeait de l’analyse de tableur, des entretiens et une analyse plus approfondie étayée par des éléments probants, autant de tâches sur lesquelles les LLM actuels sont faibles. Le groupe sans LLM a donc obtenu 84,5 %, tandis que les utilisateurs de LLM n’ont atteint que 60 à 70,6 %.
    La conclusion est que les LLM sont excellents pour la recherche généralisée, mais moins adaptés aux travaux d’analyse spécialisée.

    • On dirait une nouvelle version de l’amnésie de Gell-Mann. J’ai envie de l’appeler l’amnésie du LLM-man.
      Quand je pose des questions de programmation, ChatGPT hallucine environ 20 % du temps, et je suis suffisamment compétent pour le remarquer. Il faut probablement supposer qu’il y a au moins autant d’hallucinations et d’informations erronées quand on l’interroge sur d’autres domaines.
    • Les LLM sont généralement bons pour les tâches qu’un travailleur du savoir moyen sait bien faire, ou peut apprendre à bien faire relativement vite.
    • La comparaison entre les LLM et les journalistes est une bonne intuition.
  • C’est drôle. Les capacités d’écriture de GPT-3/4 sont impressionnantes, mais ce qui est encore plus frappant, c’est à quel point l’écriture humaine est pleine de poudre aux yeux.
    Le « consultant business » est le sommet des rôles qui exigent ce type d’écriture ampoulée, et ChatGPT peut se comporter encore plus comme un consultant business que les meilleurs consultants business.
    Au travail, pour être pris au sérieux, il faut parfois gonfler une idée concise ou des données en plusieurs pages de document ou en un deck de slides. Comme ça, les autres voient immédiatement qu’on y a « mis des efforts ».
    Le rôle qui convient le mieux à ChatGPT aujourd’hui est peut-être de prendre un texte concis et de l’étendre en un document beaucoup plus long et bourré de remplissage. Le destinataire endurera le long document ou les slides, reconnaîtra que « du travail a été fait », puis le remettra dans ChatGPT pour le résumer à son idée centrale initiale.

    • La plupart des gens se sont concentrés sur ce que les LLM peuvent faire, mais ce qui est tout aussi intéressant, voire davantage, c’est ce qu’ils ne peuvent pas faire et pourquoi.
      Quand on dit que « les LLM peuvent générer du texte », on peint avec un pinceau aussi large qu’une autoroute à dix voies. Il me semble que notre vocabulaire pour décrire ce qu’est réellement l’écriture, ses catégories et ses niveaux, est assez limité.
      Par exemple, pour un e-mail poli, du spam inspirationnel façon LinkedIn ou du jargon corporate, il est amusant, et à mes yeux tout à fait prévisible, que GPT surpasse les humains dès le premier essai. En revanche, si on lui demande le prochain tome de Game of Thrones ou de la littérature bien écrite, il s’effondre : c’est ennuyeux, générique, rempli de clichés, d’intrigues et de personnages creux.
      Il faut désormais cartographier le paysage de l’écriture dans un meilleur espace conceptuel. Pour l’instant, on semble même incapables de distinguer des différences équivalentes à celles entre l’arithmétique et l’algèbre abstraite.
  • Les LLM sont étonnamment bons pour les tâches linguistiques. La plupart de ce qu’on appelait autrefois le traitement automatique du langage naturel est désormais presque submergé. Résumé, questions-réponses, analyse de sentiment, etc. : le niveau est vraiment impressionnant.
    Ils sont aussi très forts pour les tâches de génération où les contours des « faits » ne sont pas très nets et où tout n’a pas besoin de s’imbriquer de façon dense comme dans un roman de Pynchon. Nouvelles courtes, tribunes, textes produit : ce sont des amplificateurs de productivité capables de prototyper 20 idées en une minute.
    Mais leur position actuelle s’arrête à peu près là. On projette le langage naturel dans un espace latent pour produire des concepts séparables dans une certaine mesure, on applique quelque chose qui ressemble à une transformation affine, puis on redescend.
    Pour un ordinateur, c’est incroyablement impressionnant, mais si l’on demande s’ils peuvent vraiment remplacer la part d’un diplômé coûteux de Penn, il est probable que ce pour quoi on paie soit autre chose qu’un éclair fulgurant de stratégie produit.

    • Je me demande combien de temps il faudra pour que l’IA devienne compétente en droit. Les tâches linguistiques qu’elle réussit aujourd’hui ressemblent à des tâches artistiques. Elle résout des problèmes dont l’espace des solutions est immense et robuste aux petites variations.
      Si l’on modifie légèrement le dessin d’un homme-arbre en colère, il restera probablement un bon dessin d’homme-arbre en colère.
    • Difficile d’être d’accord. Les LLM ne font rien de manière fiable, même dans un domaine très restreint.
      Si leurs sorties semblent acceptables, c’est parce que les humains comblent les fissures avec leur cerveau humain. Ils repèrent les sorties absurdes, résolvent les petites ambiguïtés et corrigent inconsciemment les erreurs mineures de faits ou de logique.
      Mais on ne mettrait pas directement le résultat d’un LLM dans un autre programme informatique. Cela exclut donc la plupart des tâches classiques de traitement automatique du langage naturel.
    • Pour que « la plupart de ce que les gens appelaient autrefois traitement automatique du langage naturel est désormais submergé » soit vrai pour la plupart des usages en services de production, les LLM devraient être au moins 10 fois plus rapides.
      Je suis globalement d’accord pour dire qu’ils peuvent assez bien faire ce genre de tâches, mais leurs performances sont encore insuffisantes pour les exécuter sur de grands jeux de données.
    • Si on lui demande un texte spécifiquement formulé comme du traitement du langage naturel, il s’en sort très bien.
      Mais juste après, il dit de ne pas l’utiliser tel quel, parce que ce serait « contraire à l’éthique ».
  • Cela en dit surtout long sur l’inutilité des consultants de BCG.

    • Il semble qu’il existe avec les LLM l’équivalent du vieux dicton : « la presse est exacte sur tout, sauf dans mon domaine d’expertise ». Les sorties des LLM paraissent bonnes sur tout, sauf dans mon domaine d’expertise.
      Les personnes sans expérience en écriture ou en édition pensent que les LLM vont révolutionner ce domaine. Les vrais auteurs et éditeurs voient en un coup d’œil qu’il faut autant de temps pour corriger une sortie de LLM que pour écrire le texte depuis zéro, ce qui la rend en pratique sans valeur.
      De même, les personnes qui ne savent pas programmer ou qui ont une compréhension superficielle du sujet, en particulier les managers qui veulent avoir l’air techniques, voient une sortie de LLM et pensent qu’elle est prête à être déployée ; les bons programmeurs, eux, voient qu’il y a tant de gros et petits problèmes que cela ne vaut pas la peine de la corriger plutôt que de réécrire depuis zéro.
    • La plupart des consultants en management sont inutiles, mais il y a aussi une réalité qu’il faut accepter.
      Dans une équipe de 20 à 30 ingénieurs, il n’y a généralement qu’un seul ingénieur du genre « pourquoi est-il encore avec nous ? », à la fois excellent techniquement et à l’aise avec les gens. Mais aussi agréable soit-il, le travail reste le travail : il ne fait que donner des indices sur la façon dont le management devrait fonctionner. Il joue aux jeux vidéo, a une famille et une vie ; il ne s’intéresse pas à la direction que prend l’entreprise, ni au management et aux responsabilités inutiles. En plus, les gens au-dessus ne le voient que comme un « ingénieur », pas comme un « manager ».
      Quand le reste des ingénieurs et des managers adopte aussi l’attitude « ce n’est pas mon problème », un étrange vide de communication apparaît. Les ingénieurs proches du produit n’ont pas envie de parler aux managers, de peur d’entendre « si tu t’y connais si bien, fais-le toi-même » ; les managers n’ont pas envie de parler aux ingénieurs, de peur d’entendre « si ça t’intéresse tant, fais-le toi-même ».
      C’est dans cette distance croissante entre managers et ingénieurs que s’insèrent les consultants en management. Grâce à la souplesse que leur donne la direction générale, ils peuvent faire des allers-retours entre ingénieurs et managers, parler à tout le monde, et ne pas se retrouver coincés par un « alors fais-le toi-même ». Ils remettent un rapport et repartent au bout d’un mois avec l’équivalent d’un an de salaire d’un manager ou d’un ingénieur.
      En y repensant sérieusement, il y a beaucoup de choses que l’on sait que l’entreprise devrait faire, mais que l’on ne dit pas, parce que les dire augmenterait le travail et les risques. Un « bon » consultant en management trouve ces choses « qu’on n’a pas envie de faire mais qu’il faut faire », les remonte à la direction générale, puis la direction met en place un système pour les faire exécuter. Si quelqu’un a besoin d’un consultant en management, il peut m’embaucher. Je lui dirai de 20 façons pourquoi son entreprise n’est pas terrible, dont 18 seront générées par ChatGPT.
    • Je suis assez d’accord. Les LLM ont surtout augmenté ma production en programmation pour la rédaction de JSDoc et de descriptions de PR. Des choses que je n’ai pas vraiment envie de faire.
    • Cette étude montre seulement que 40 % du travail des consultants de BCG n’est que du bruit sans réelle valeur ajoutée. Les clients devraient désormais exiger 40 % de remise.
    • Le fait qu’à chaque fois que GPT fait quelque chose, on répète « cela en dit plus long sur [cible] » en dit lui-même long.
      C’est drôle de pouvoir prédire ce genre de commentaire dans n’importe quel fil. À force d’écrire « cela en dit plus long sur [insérer] », l’expression elle-même perd son sens. On pourrait peut-être dire quelque chose de plus substantiel.
  • Rien d’étonnant. GPT est effroyablement bon, et il se prête aussi très bien à la programmation
    Je demande à GPT-4 d’écrire du code et j’essaie de voir s’il fonctionne, mais je le copie-colle rarement tel quel. Je le réécris moi-même pour l’adapter au contexte de la base de code. Malgré tout, quand je ne sais pas trop comment m’y prendre, cela me fait gagner beaucoup de temps
    Il arrive que ses suggestions ne me plaisent pas, mais même ça, c’est utile. Souvent, l’espace du problème devient plus clair dans ma tête

    • Hier, j’ai utilisé ChatGPT pour du code pour la première fois
      Je lui ai confié une tâche assez délicate, dont je ne trouvais pas la réponse sur Google et dont je n’étais même pas sûr qu’elle soit possible. La demande était : « étant donné un objet Python, donne-moi la liste des fonctions qui ont reçu cet objet en argument. On ne peut pas modifier le code existant, seulement changer la structure de l’objet »
      Au début, il a proposé des idées assez mal adaptées, comme modifier les fonctions, les envelopper dans des décorateurs ou examiner la pile d’appels courante, mais après quelques échanges il a suggéré de résoudre le problème en interceptant le traceur Python, et ça a effectivement fonctionné
      Ce qui est étonnant, c’est qu’il ne me semble pas probable qu’il ait vu quelque chose de ce genre dans ses données d’entraînement, et pourtant il a assemblé les morceaux. C’était presque d’un niveau humain. Quand je lui ai demandé, il a aussi expliqué facilement la limite liée au fait que cela peut interférer avec les débogueurs
    • L’article publié ne porte pas sur des tâches de programmation, mais sur de la génération de texte pour des « consultants en stratégie »
      Les exemples de la page 10 ressemblent à ceci : proposer au moins 10 idées de nouvelles chaussures ciblant des marchés ou des sports délaissés, segmenter le marché de l’industrie de la chaussure par type d’utilisateurs, rédiger un projet de communiqué de presse pour promouvoir un produit, écrire une note inspirante destinée aux employés pour expliquer pourquoi il est supérieur aux produits concurrents
      Personnellement, je n’y vois quasiment aucune valeur réelle
    • Le simple fait d’expliquer le problème à GPT-4 peut parfois être aussi utile que sa réponse. C’est presque du débogage au canard en plastique augmenté
    • Ce n’est qu’un cran au-dessus de la programmation qui consiste à « essayer des trucs jusqu’à ce que ça marche »
      Je ne dis pas que vous êtes ce genre de programmeur, mais cela rend clairement possible ce type de programmeur
    • C’est vraiment un canard en plastique qui parle bien : https://en.wikipedia.org/wiki/Rubber_duck_debugging
  • En tant qu’ancien consultant, la question évidente qui me vient est la suivante. Et si l’on supprimait complètement les consultants et que GPT-4 travaillait directement pour les clients ?
    Pour confier du travail à un consultant, un client doit expliquer ses besoins, examiner les résultats, donner du feedback, et assister à quelques réunions
    Mais si GPT-4 rend les consultants bien meilleurs, il semble aussi capable de faire leur travail à leur place. En ajoutant à cela la réduction des coûts de communication due au fait de ne pas travailler avec un groupe externe, pourquoi un client ne supprimerait-il pas les coûts et la charge de gestion liés aux consultants externes pour capter directement les bénéfices ?
    C’est d’autant plus vrai lorsque le client est déjà expert du domaine et a seulement besoin de ressources supplémentaires. Par exemple, un chef de marque marketing connaît bien son produit et son marketing, mais peut travailler avec des consultants marketing parce qu’il a besoin de plus de ressources, en raison de limites d’effectifs internes
    Je me demande si BCG a vraiment réfléchi jusqu’au bout aux implications de sa participation à cette étude. Le pas entre « aider les consultants à mieux aider les clients » et « aider directement les clients et montrer qu’ils n’ont pas tellement besoin de consultants » me paraît très court
    Surtout si le client recrute un stagiaire et lui met GPT-4 entre les mains

    • Les cabinets comme BCG ou McKinsey existent surtout pour se défausser de la responsabilité
      Du point de vue d’un CEO, on peut les faire venir, les payer très cher pour produire un plan et une stratégie, puis s’attribuer le mérite si ça marche, et dire si ça échoue : « nous avons travaillé étroitement avec les experts de McKinsey, donc ce n’est pas ma faute »
  • HN est vraiment mauvais en prédictions. Il y a à peine quelques mois, les commentaires affirmant avec assurance que les LLM n’étaient que des perroquets stochastiques et n’accompliraient rien pullulaient
    « Je n’arrive pas à me défaire de l’idée que le prochain hiver de l’IA est tout proche », mais oui, bien sûr
    [0] https://news.ycombinator.com/item?id=23886325

    • Qui a prétendu que les consultants en management n’étaient pas des perroquets stochastiques ?
    • Ce commentaire disait aussi : « si l’objectif est de trouver un moyen rentable de remplacer le spam de content marketing, alors très bien. C’est réussi »
      Et si l’on lit l’article, le niveau des livrables dont on parle correspond presque exactement à cela : au moins 10 idées de nouvelles chaussures ciblant des marchés ou des sports délaissés, une segmentation du marché de l’industrie de la chaussure, un communiqué de presse produit, une note inspirante pour les employés expliquant pourquoi le produit est meilleur que les concurrents
      En plus, sur la deuxième tâche, le groupe sans LLM a fait nettement mieux
    • Je ne suis pas sûr que cet article démontre grand-chose. Régurgiter des communiqués de presse ressemble beaucoup à une tâche de perroquet stochastique
    • Ce n’est pas grave de mal prédire. Ce qui est difficile à supporter, c’est l’absence totale de recalibrage
      Si vous avez fait une prédiction absurdement mauvaise, cela signifie que votre modèle du sujet est faux et doit être corrigé
      Mais si vous continuez à faire des prédictions sans jamais corriger votre modèle, c’est un gros problème
    • Ce commentaire va sans doute entrer au panthéon de HN, comme celui de la personne qui disait que Dropbox pouvait être facilement remplacé par quelque chose comme rsync
  • Avec le temps, beaucoup de tâches de bureau seront optimisées par des services comme GPT
    J’avais assez de sens technique pour savoir qu’une grande partie de mon travail de bureau était répétable et scriptable, mais pas assez pour écrire les scripts moi-même. Grâce à ChatGPT, j’ai pu créer ces scripts, et il m’a fallu environ 15 à 20 heures pour les faire fonctionner parfaitement
    Je connaissais à peine le scripting Python et je ne savais rien du tout de pandas ou de xlswriter, mais j’ai pu construire quelque chose qui me fait gagner 20 à 25 heures par semaine
    Sur HN, il y a beaucoup de gens qui savent bien programmer, et ils semblent sous-estimer le monde que des services comme ChatGPT ouvrent aux non-programmeurs. À l’inverse, cela peut aussi amener les personnes sans curiosité à apprendre moins. Avant, si j’avais voulu apprendre à arrêter par script plusieurs services snapd, j’aurais cherché sur Google et assemblé les morceaux ; maintenant, je demande à ChatGPT et j’obtiens un script fonctionnel en moins d’une minute

    • Tout à fait d’accord. En partant de « est-ce que X est possible, comment faire ? », j’ai produit plusieurs preuves de concept rudimentaires pour des problèmes dont je ne connaissais même pas les mots-clés à chercher
  • Deux points méritent d’être relevés dans le résumé
    Il est question de « 18 tâches réalistes de conseil situées à l’intérieur de la frontière des capacités de l’IA ». Autrement dit, ils ont volontairement choisi des tâches que GPT-4 peut accomplir. Comme il existe de nombreuses tâches que GPT-4 ne sait pas faire, lorsqu’on dit que les performances ont fortement augmenté, il faut garder en tête que cela se limite aux tâches bien adaptées à GPT-4
    Il est aussi indiqué que « les participants sous la moyenne ont progressé de 43 % par rapport à leur propre score, et ceux au-dessus de la moyenne de 17 % ». Même en ne sélectionnant que des tâches particulièrement adaptées à GPT-4, l’amélioration des participants au-dessus de la moyenne n’était que de 17 %. Si ce type de gain se retrouve de façon générale, cela reste impressionnant, mais 17 % me paraît bien inférieur à ce que certains essaient de vendre

    • Les participants sous la moyenne peuvent être plus enclins à accepter telle quelle la sortie de GPT, parce qu’ils ont moins de capacité à la relire et à l’éditer
      Les participants au-dessus de la moyenne, plus sûrs de leurs propres compétences, sont susceptibles de retravailler davantage les sorties de GPT. Le groupe sous la moyenne a donc pu produire plus vite un livrable final, et comme ce test était limité dans le temps, la vitesse a probablement joué un rôle important
      ChatGPT est très fort pour produire du texte verbeux, et les formulations marketing comme les messages inspirants sont par nature verbeuses. En d’autres termes, les tâches étaient en quelque sorte faites sur mesure pour un ChatGPT non assisté, ce qui désavantageait plutôt les meilleurs performeurs
    • Vous sous-estimez l’effet. Les gains s’accumulent par effet composé
      Une petite hausse d’efficacité devient un avantage majeur dans la croissance à long terme. 17 %, c’est déjà une amélioration énorme