2 points par GN⁺ 2024-07-16 | 1 commentaires | Partager sur WhatsApp
  • Kevin Bankston affirme que, lorsqu’il a ouvert un document personnel dans Google Drive/Docs, Gemini l’a résumé sans demande préalable, relançant la polémique sur le comportement par défaut des fonctions IA de Workspace et sur l’étendue du consentement utilisateur
  • L’affaire a commencé avec le cas d’un PDF de déclaration fiscale de Bankston, puis le cœur du problème s’est resserré moins sur Google Docs lui-même que sur le comportement des fichiers ouverts depuis Google Drive
  • Même après vérification des réglages, le commutateur des résumés Gemini dans Gmail, Drive et Docs était déjà désactivé, et l’emplacement des paramètres indiqué par Gemini ne correspondait pas à la réalité, rendant difficile pour l’utilisateur de comprendre ce qu’il contrôlait réellement
  • Bankston a observé un schéma dans lequel, après avoir cliqué sur le bouton Gemini d’un document dans Drive, l’ouverture d’autres documents du même type de fichier semblait déclencher automatiquement Gemini
  • Google a rétorqué que les données Workspace ne sont ni utilisées pour l’entraînement ni conservées, mais le lien entre l’état du panneau latéral Gemini de Drive et les réglages de résumé reste un point que l’utilisateur doit encore vérifier lui-même

Polémique autour du résumé automatique de Gemini à partir de documents personnels

  • Kevin Bankston a publié sur X qu’en ouvrant sa déclaration fiscale dans Google Docs, Gemini l’avait résumée sans qu’il le demande
  • Il a soulevé la question de savoir si Gemini traitait automatiquement les documents personnels ouverts dans Google Docs, et s’est inquiété d’une situation où l’utilisateur devrait découvrir puis désactiver des réglages dont il n’avait pas connaissance
  • Par la suite, le contexte s’est clarifié : il s’agirait moins de Google Docs lui-même que de documents ouverts dans Google Drive
    • Le type de document était un PDF
    • La possibilité que cela puisse aussi s’appliquer à Docs n’est pas totalement écartée

Un commutateur de résumé désactivé et des indications de réglage contradictoires

  • Bankston a tenté de retrouver les paramètres de confidentialité indiqués par Gemini, mais affirme ne pas avoir trouvé le réglage à l’endroit indiqué
  • Il a ensuite vérifié les options concernées, mais Gemini summaries in Gmail, Drive, and Docs était déjà désactivé
  • L’emplacement des paramètres différait aussi des deux pages web indiquées au départ par le bot Gemini
  • Cette expérience a renforcé les inquiétudes sur le manque de contrôle utilisateur concernant des informations personnelles sensibles

Un schéma de déclenchement automatique observé dans Drive selon le type de fichier

  • Le problème observé par Bankston semble être limité à Google Drive
  • Il a observé qu’après avoir appuyé sur le bouton Gemini dans au moins un document, l’ouverture ultérieure de documents du même type de fichier déclenchait automatiquement Gemini
    • Dans le cas observé, le type de fichier était le PDF
    • Par la suite, les fichiers du même format ouverts dans Google Drive devenaient des cibles de déclenchement automatique
  • Bankston a également avancé que Google Workspace Labs, qu’il avait activé en 2023, avait pu écraser les réglages Gemini AI censés s’appliquer

La réponse de Google et ses explications sur la protection des données

  • Un porte-parole de Google a expliqué que les fonctions d’IA générative étaient conçues pour offrir à l’utilisateur des choix et un contrôle sur ses données
  • Selon Google, l’utilisation de Gemini in Google Workspace nécessite une activation préalable par l’utilisateur
  • Si l’utilisateur l’a activé, le contenu est utilisé de manière respectueuse de la vie privée pour générer des réponses utiles aux prompts, et n’est pas conservé séparément sans autorisation
  • Google explique dans un article de blog sur la protection des données Workspace que les données Workspace ne sont ni collectées ni utilisées pour l’entraînement
  • L’entreprise ajoute que, si la fonction est activée, elle peut résumer le contenu d’un document ouvert, mais que ce contenu n’est pas conservé

La piste du panneau latéral et la charge de vérification qui reste à l’utilisateur

  • Google a suggéré que Bankston avait peut-être utilisé le panneau latéral Gemini de Drive, et que fermer ce panneau pouvait résoudre le problème
  • Dans l’expérience de Bankston, les réglages de résumé concernés étaient déjà désactivés, de sorte qu’un écart subsiste entre l’état de désactivation attendu par l’utilisateur et le comportement réel
  • Lorsqu’ils ouvrent des documents sensibles stockés dans Google Drive, les utilisateurs doivent donc vérifier eux-mêmes l’état d’activation des fonctions Gemini, celui du panneau latéral et le comportement selon le type de fichier

1 commentaires

 
GN⁺ 2024-07-16
Avis de Hacker News
  • Cela montre une fois de plus que les données envoyées chez un fournisseur cloud ne sont, au final, pas contrôlées comme si elles nous appartenaient
    Cette fois, il y avait un signal clair, mais je pense que les systèmes de Google lisent et agrègent depuis longtemps les données contenues dans des documents privés
    Cette inquiétude existe depuis le lancement de Gmail il y a 20 ans : à l’époque, les gens étaient surpris par l’idée que « Google lit les e-mails pour afficher de la publicité », mais la boîte de réception de 1 Go et la nouvelle interface étaient assez convaincantes
    Par la suite, avec Google Drive et autres, Google a appris à rendre cela moins inquiétant ou moins explicite, sans doute aussi parce qu’il voulait l’argent des clients entreprise

    • Que Google lise et agrège les données de documents privés est évident
      Sinon, comment proposerait-il la recherche dans les documents ?
    • Pour les données hébergées chez un fournisseur cloud, je fais davantage confiance à ProtonDrive
      Parce que les données sont chiffrées à la fois en transit et au repos
      Apple chiffre désormais aussi la plupart des données en transit et au repos, et documente quelles données sont protégées
      En revanche, je ne suis pas certain qu’un futur Apple ne veuille pas utiliser mes données pour entraîner des modèles publics
      Leur architecture consistant à ajouter, au grand modèle de langage central préentraîné d’Apple, une couche de fine-tuning remplaçable fondée sur un apprentissage local semble correcte du point de vue de la confidentialité, mais en pratique je n’en sais rien
      Je fais moins confiance à Google Drive parce que j’ai accordé un accès à Drive à Colab Pro et à quelques tiers, et si cet article est exact, ma confiance baisse encore
      L’analogie avec les débuts de Gmail est pertinente
      Trois ans avant le lancement public de Gmail, Peter Norvig m’avait invité en privé à l’utiliser, et à l’époque j’aimais bien les publicités pertinentes affichées à côté de Gmail
      J’ai aussi donné à ce service à 20 dollars par mois, Google AI Plus ou je ne sais quoi, l’accès à l’ensemble de mes actifs Google, parce que je voulais tester l’utilité des grands modèles de langage intégrés à un environnement comme Workplace
      Au final, j’ai donc volontairement renoncé à ma confidentialité dans les services Google
    • Dire que « les systèmes de Google lisent et agrègent depuis longtemps les données contenues dans des documents privés » est vrai, puisque c’est ainsi que fonctionne la recherche
      Mais si cela sous-entend que les données privées de tout le monde ont été aspirées pour alimenter de grands modèles de langage, c’est clairement une théorie du complot
      Je trouve stupéfiant de croire que Google aurait convaincu des dizaines de milliers d’ingénieurs de garder discrètement le secret sur un vaste complot visant à abuser des données privées de tout le monde
    • Après une réservation sur Expedia, l’e-mail d’itinéraire est arrivé dans Gmail et, quelques minutes plus tard, un bouton d’appel natif de Google est apparu sur l’écran d’accueil Android pour configurer son produit de voyage
      Depuis, j’ai abandonné Android, mais il est plus difficile de se passer de Gmail
  • Toute IA devrait relever d’un consentement explicite, aussi bien pour l’entraînement que pour le scan
    L’utilisateur doit cocher lui-même une case du type « Je souhaite utiliser les fonctionnalités d’IA », avec un texte expliquant très clairement ce que cela signifie
    Cela devrait être obligatoire et imposé, avec de lourdes amendes pour les entreprises qui ne s’y conforment pas

    • Je comprends pour l’entraînement, mais je ne vois pas pourquoi le scan poserait problème
      Littéralement, il ne s’agit que d’exécuter un algorithme sur mes données et de m’en montrer le résultat
      Fondamentalement, ce n’est pas différent d’un correcteur orthographique ou de la génération automatique d’une table des matières à partir des styles de titre
      Si le résultat reste privé et visible uniquement par moi, comme c’est le cas ici, je ne vois pas ce qui inquiète
      Le fait que l’algorithme soit fondé sur un grand modèle de langage n’a rien à voir avec la confidentialité ou la sécurité
    • L’IA est en train de devenir le nouveau réseau social
      Les utilisateurs ne sont pas les clients, mais le produit
      Au lieu de fournir aux entreprises de réseaux sociaux des données pour vendre de la publicité, on leur fournit désormais des données pour entraîner l’IA, en échange d’un accès gratuit au service
    • Je me demande ce que « scan » signifie exactement
      J’imagine qu’il s’agit de lire temporairement un document pour en fournir un résumé, et non à des fins d’entraînement, mais je ne vois pas pourquoi cela devrait être réglementé
    • Il faudrait aussi une extension de robots.txt permettant d’exclure les fichiers publiquement accessibles des jeux de données d’entraînement de l’IA
      Je me souviens qu’il existe une première tentative appelée ai.txt, mais je ne sais pas vraiment qui la respecte pour l’instant
    • Je me demande quels sont exactement les effets de l’entraînement de l’IA sur la confidentialité
  • En laissant de côté le fait que cet article est manifestement rédigé de manière à prêter à confusion, voici les liens partagés dans le fil de tweets mentionné
    Gestion de l’activité Gemini : https://myactivity.google.com/product/gemini
    Page qui contient la plupart des réponses sur l’opt-out pour Google Workspace et plusieurs apps Google : https://support.google.com/docs/answer/13447104#:~:text=Turn...

  • Le titre rend l’affaire un peu floue
    Si l’on demande à Gemini de résumer un document, il n’est pas surprenant qu’il le résume
    Ici, le terme « scan » en fait beaucoup trop, et le titre laisse entendre que Google entraîne Gemini avec des documents privés
    Le vrai sujet est que, alors que l’utilisateur pensait avoir explicitement désactivé cela, Gemini a été exécuté avec un document privé en entrée et l’a résumé
    Cela dit, le fait que les paramètres n’aient pas été respectés constitue un bug significatif de l’infrastructure de Google, et pour quelqu’un qui s’oppose totalement à l’usage de cette nouvelle génération d’IA, cela peut justifier de revoir sa stratégie de sortie

    • Quand on demande à Gemini de résumer un PDF, il n’est pas surprenant qu’il résume ce PDF
      Mais si, parce qu’on lui a demandé une fois de résumer un PDF, Gemini résume tous les PDF présents dans Drive, là ce serait surprenant
  • Je me demande si le titre n’est pas trompeur
    Je pensais qu’il s’agissait d’un scan à des fins d’entraînement ou de test, mais c’était une fonctionnalité qui résume l’article que l’utilisateur est en train de consulter
    Du coup, le terme « caught » est malhonnête
    On ne dit pas qu’on a « pris » quelqu’un en train de faire quelque chose qu’il avait annoncé faire

    • Comme l’autorisation était désactivée, quoi qu’il ait fait avec le document, cela a été fait sans permission
      Le titre est correct
  • Ce n’est qu’une question de temps avant que quelqu’un n’extraie quelque chose de valeur des modèles de Google
    Cela pourrait être un mot de passe bancaire ou des clés de cryptomonnaie
    L’affaire de la pizza à la colle montre qu’ils avancent simplement à l’arrache

  • Cela ressemble à la bataille autour des données de santé pendant la période du Covid
    Plusieurs groupes ont profité de la crise pour essayer de faire sortir les données du tube une bonne fois pour toutes, et certains y sont parvenus
    Parce que le coût de se faire réprimander est faible, tandis que la valeur de s’emparer des données est élevée
    Au fond, c’est un passage en force bureaucratique
    Pour quelqu’un qui a travaillé dans le domaine de la confidentialité, c’est décevant mais prévisible, et la plupart feront semblant d’être surpris avant de passer à autre chose
    Parce que leur carrière dépend de leur capacité à continuer d’entretenir un récit absurde de « bonnes intentions »
    Les SMS piratés chez AT&T seront probablement les prochains, et si les frappes clavier sur mobile sont compromises, ou si une mise à jour d’OS d’une plateforme commerciale ajoute un agent de collecte pour l’entraînement de modèles, tout le monde sera tout aussi « surpris »
    Bien sûr, le tout sera présenté comme une amélioration de la confidentialité au service de la satisfaction utilisateur
    Si les chefs de produit et ingénieurs qui ont créé cela ne sont pas pris pour exemple, la prochaine fois ce sera répété en pire et à plus grande échelle

  • Le tweet original et cet article mélangent délibérément les termes pour induire en erreur
    Ils cherchent à faire croire qu’un grand modèle de langage qui accède d’une manière ou d’une autre à un document, et le fait que ce document soit inclus dans le jeu de données d’entraînement du modèle, sont une seule et même chose
    C’est le piège de l’article et du tweet original, mais le fil finit par reconnaître la différence avant de se réorienter vers une colère contre l’existence même des fonctionnalités d’IA
    Il n’y a rien de substantiel dans cette histoire, si ce n’est qu’un utilisateur de Twitter agacé par une popup d’IA a écrit un fil destiné à provoquer l’indignation en le présentant comme quelque chose de bien plus sinistre

  • Il est surprenant que, même sur HN, autant de gens puissent être aussi facilement induits en erreur sur ce qui se passe réellement
    Je me demande s’il reste encore des gens qui lisent l’article avant de poster

  • Est-ce vraiment surprenant que Google n’aille pas assez loin en matière de confidentialité et d’accès aux données ?
    Ils en parlent, mais ils n’iront jamais jusqu’au point où leurs propres services ne pourraient plus accéder aux données
    Il faudrait en arriver à un point où toutes les données stockées à distance ne peuvent pas être déchiffrées par le serveur et ne sont déchiffrées que sur nos appareils
    Sinon, cela revient à autoriser l’entreprise à exploiter les données autant qu’elle le souhaite, sans que nous ayons le moindre moyen de savoir ce qu’elle en fait
    Bien sûr, il reste le problème de devoir croire qu’elles ne peuvent réellement pas être déchiffrées, et il n’existe pas de bonne solution à cela
    L’accès de l’IA aux données personnelles devrait être traité sur l’appareil, et si un traitement côté serveur est nécessaire, il faut espérer que ce soit un problème temporaire, tout en indiquant clairement que les données sont envoyées hors de l’appareil
    Même si elles ne servent pas à l’entraînement des modèles pour l’instant, il n’est pas irrationnel de penser que des données passées par Gemini ou par un serveur distant puissent être journalisées puis utilisées plus tard pour un entraînement supplémentaire, rester dans des logs en clair, ou être consultées par des testeurs

    • C’est là, au final, que tout s’effondre
      À la fin, la structure revient à ce que l’entreprise dise : « faites-nous confiance », et il est très clair que les entreprises ne sont pas dignes de confiance pour ce genre de choses