1 points par GN⁺ 2024-01-29 | 1 commentaires | Partager sur WhatsApp
  • À partir de la version v1.62 du navigateur desktop Brave, le LLM par défaut de Leo, l’assistant IA de navigateur axé sur la protection de la vie privée, devient Mixtral 8x7B
  • Mixtral 8x7B est un LLM open source publié en décembre par Mistral AI ; sa vitesse, ses performances et son caractère de modèle ouvert correspondent à l’orientation produit de Brave, ce qui a conduit à son intégration dans Leo
  • Brave explique que Mixtral 8x7B devance ChatGPT 3.5, Claude Instant, Llama 2 et d’autres sur le LMSYS Chatbot Arena Leaderboard, et qu’il montre des améliorations en matière de réduction des hallucinations et des biais sur le benchmark BBQ
  • Leo gratuit comme l’offre Premium à 15 dollars par mois proposent Mixtral 8x7B par défaut, mais la version gratuite applique des limites d’usage plus strictes, tandis que Premium offre des limites plus élevées
  • Leo anonymise les requêtes via un proxy inverse, ne stocke pas les conversations et ne les utilise pas pour l’entraînement des modèles ; il est utilisable depuis la barre d’adresse ou la barre latérale, sans application séparée

Le modèle par défaut de Leo passe à Mixtral 8x7B

  • Avec la mise à jour v1.62 de son navigateur desktop, Brave remplace le grand modèle de langage par défaut de Leo par Mixtral 8x7B
  • Leo est l’assistant IA de navigateur axé sur la protection de la vie privée proposé par Brave, qui permet d’utiliser des fonctions d’IA directement dans le navigateur
  • Outre le changement de modèle, cette mise à jour comprend un onboarding plus clair, un contrôle du contexte, des formats d’entrée et de réponse, ainsi que des améliorations générales de l’interface utilisateur

Pourquoi choisir Mixtral 8x7B

  • Mixtral 8x7B est un LLM open source publié en décembre par Mistral AI ; son adoption a rapidement progressé dans la communauté des développeurs grâce à sa vitesse et à ses performances
  • D’après le LMSYS Chatbot Arena Leaderboard, il affiche de meilleures performances que ChatGPT 3.5, Claude Instant, Llama 2 et d’autres
  • D’après le benchmark BBQ, il apporte aussi des améliorations en matière de réduction des hallucinations et des biais
  • Ses principales fonctionnalités sont les suivantes
    • Traitement d’un contexte plus large
    • Interactions en anglais, français, allemand, italien et espagnol
    • Génération de code

Utilisation de Mixtral dans les produits Brave

  • Brave utilise déjà Mixtral dans Code LLM, la fonctionnalité de Brave Search dédiée aux requêtes liées à la programmation
  • Les performances de Mixtral et son caractère open source s’inscrivent dans le soutien de Brave aux modèles ouverts et à la communauté open source
  • Brian Bondy, CTO et cofondateur de Brave, a indiqué que Leo avait été adopté par des dizaines de milliers d’utilisateurs gratuits et d’abonnés payants, et qu’il s’attendait à une adoption plus large grâce à l’intégration de Mixtral
  • Arthur Mensch, CEO de Mistral AI, a salué l’utilisation de Mixtral dans CodeLLM de Brave Search et dans Brave Leo

Choix de modèles en version gratuite et Premium

  • Leo permet de choisir entre plusieurs modèles selon les besoins et le budget
  • Mixtral 8x7B est proposé comme LLM par défaut dans la version gratuite comme dans Premium
  • Les deux offres prennent aussi en charge Claude Instant d’Anthropic et Llama 2 13B de Meta
  • Les conditions d’utilisation de Leo gratuit sont les suivantes
    • Mixtral 8x7B et Claude Instant sont soumis à des limites d’usage strictes
    • Llama 2 13B dispose de limites d’usage plus élevées
    • Une fois la limite d’usage de Mixtral atteinte, il est possible de revenir à Llama 2, l’expérience Leo précédente, pour continuer à utiliser l’IA
  • Leo Premium coûte 15 dollars par mois et propose Mixtral 8x7B, Claude Instant et Llama 2 13B avec des limites d’usage plus élevées

Mode de protection de la vie privée

  • Les chats de Leo sont conçus sur le principe d’une utilisation privée, anonyme et sécurisée
  • Les conversations ne sont pas enregistrées, ne sont pas utilisées pour l’entraînement des modèles, et aucun compte ni connexion n’est nécessaire pour l’utiliser
  • Les dispositifs de protection de la vie privée sont les suivants
    • Proxy inverse : toutes les requêtes passent par un serveur d’anonymisation, ce qui empêche d’associer une requête à l’adresse de l’utilisateur
    • Suppression immédiate des réponses : les réponses de Leo sont supprimées juste après leur génération, et aucune conversation n’est stockée sur les serveurs de Brave
    • Aucune collecte d’identifiants : les identifiants pouvant être reliés à l’utilisateur, comme l’adresse IP, ne sont pas collectés
    • Aucune conservation par des fournisseurs tiers : les modèles d’IA ou fournisseurs de modèles tiers ne conservent pas les données personnelles
    • Aucun compte requis : Leo peut être utilisé sans créer de compte Brave
    • Jeton d’abonnement non corrélable : lors de l’abonnement à Leo Premium, l’abonnement est vérifié au moyen d’un jeton qui ne permet pas de relier les informations d’achat à l’utilisation du produit

Utilisation et disponibilité

  • Leo est intégré au navigateur et peut être utilisé sans application ni extension séparée
  • Les utilisateurs de Brave desktop peuvent saisir une question dans la barre d’adresse puis cliquer sur « Ask Leo », ou ouvrir Leo depuis la Brave Sidebar
  • Les fonctions d’IA sont accessibles via une barre latérale de chat à côté d’une page web ou depuis la barre d’adresse
  • Dans le contexte d’une page, les tâches suivantes sont prises en charge
    • Résumés en temps réel de pages web ou de vidéos
    • Réponses aux questions sur le contenu
    • Création de nouveaux contenus
    • Traduction de pages
    • Analyse de pages
    • Réécriture de phrases
    • Aide à l’écriture de code
  • Leo est disponible pour les utilisateurs de Brave desktop depuis novembre, dans la version 1.60
  • Leo pour Android et iOS sera disponible prochainement

1 commentaires

 
GN⁺ 2024-01-29
Avis sur Hacker News
  • Pour exécuter Mixtral 8x7B en local, on peut utiliser llama.cpp et, avec des bibliothèques/interfaces compatibles comme text-generation-webui, utiliser https://huggingface.co/TheBloke/Nous-Hermes-2-Mixtral-8x7B-S...
    Même la plus petite version en quantification 2 bits nécessite 20 Go de RAM, et peut être déchargée dans la VRAM d’un bon GPU 4090
    La version en quantification 4 bits est le plus gros modèle qui rentre de justesse dans un système de 32 Go, et utilise environ 29 à 31 Go
    Le 6 bits demande 41 Go et le 8 bits 52 Go, donc un système de 64 Go est nécessaire ; pour décharger les modèles de plus haute précision dans la VRAM, il faut plusieurs GPU avec mémoire partagée
    J’ai essayé les modèles 7B et 13B, mais pas encore celui-ci ni d’autres grands modèles

    • Si vous voulez de meilleures performances liées au code, vous pouvez aussi essayer le fine-tuning dolphin-mixtral : https://huggingface.co/TheBloke/dolphin-2.7-mixtral-8x7b-GGU...
    • Une machine Apple Silicon puissante peut aussi suffire au lieu de plusieurs GPU
      J’ai essayé dolphin mixtral 4 bits sur un MacBook M3 avec 36 Go de RAM, et l’inférence était très rapide
    • Le 2 bits est assez médiocre, difficile de le recommander pour un usage sérieux
    • Je préfère koboldcpp à llama.cpp
      Il est plus facile de faire tourner des modèles plus grands que la VRAM en les répartissant entre GPU et CPU
    • Quand on parle des besoins mémoire, il faut aussi prendre en compte la longueur de séquence
      Mixtral prend en charge 32 000 tokens, ce qui peut représenter une part assez importante de la mémoire utilisée
  • Brave mérite des éloges pour cette fonctionnalité et ses autres fonctions de protection de la vie privée
    Avec le système de jetons d’abonnement non corrélables, lorsqu’on s’abonne à Leo Premium, un jeton servant à vérifier l’abonnement lors de l’utilisation de Leo est émis, et Brave ne peut pas relier les informations de paiement à l’utilisation du produit
    Même l’e-mail utilisé pour créer le compte n’est pas associé à l’usage quotidien de Leo : c’est une approche d’identifiants privés assez originale

    • C’est vraiment cool, et j’aimerais l’intégrer à mon application
      Je me demande si quelqu’un sait exactement comment cela fonctionne sans utiliser de clés étrangères
  • J’ai l’impression d’avoir manqué la première annonce de Leo, mais c’est intéressant, et j’aime le design pensé pour la protection de la vie privée
    Le fait de ne pas conserver l’historique des conversations est exactement ce que je voulais

  • Je me demande quels sont les bons fournisseurs d’API proposant Mixtral
    Je ne connais qu’OctoAI, qui a l’air correct, et j’aimerais connaître des alternatives

    • Le créateur du modèle exploite aussi sa propre plateforme, où ce modèle et d’autres sont disponibles via API : https://console.mistral.ai/
    • Je viens de découvrir Groq, qui annonce 485,08 tokens/seconde sur mixtral 8x7B-32k
      Je ne connais pas les prix, mais il semble qu’il faille envoyer un e-mail à api@groq.com
    • OpenRouter est globalement une bonne option, et le mieux est qu’il propose une API unifiée pour tous les LLM
      Les prix sont les mêmes que ceux des fournisseurs eux-mêmes
      En revanche, pour les modèles OpenAI/Anthropic, ils ont dû activer le filtrage des entrées/sorties en raison des exigences de ces entreprises
    • Ce sont des services déjà mentionnés, mais j’utilise Anyscale Endpoints avec de très bons résultats
      C’est très rapide et, avec les réglages par défaut, cela traite déjà 10 tâches en parallèle
      Together.ai avait aussi l’air correct lors des premiers tests, mais je ne l’ai pas encore utilisé à grande échelle
    • J’ai utilisé à la fois l’API commerciale de Mistral et celle d’AnyScale avec mixtral-8-7b, et les deux étaient faciles à utiliser
      Je fais aussi tourner une version en quantification 3 bits de mixtral-8-7b sur un système M2 Pro avec 32 Go de mémoire, et c’est plutôt rapide
      C’est une bonne chose d’avoir plusieurs options
  • La semaine dernière, j’ai testé les versions disponibles sur poe et chat.groq.com
    C’est nettement meilleur que llama 70b

  • Je trouve intéressant qu’ils aient permis de faire une requête LLM directement depuis la barre d’adresse
    Je me demande s’ils créeront plus tard une heuristique pour décider s’il faut envoyer la requête directement au LLM ou utiliser le moteur de recherche par défaut

  • Quand on passe de gpt4 à mistral, on a l’impression de quitter un écran Retina pour revenir à un écran basse résolution
    On se retrouve constamment à penser : « mais GPT4, lui, saurait faire ça »

    • Je me demande si tu as essayé mixtral
  • J’exécute Mixtral en local avec ollama

  • Je me demande s’il existe une bonne extension Chrome qui résume les pages avec l’IA
    J’ai essayé quelques-uns des premiers résultats Google, et même s’ils fonctionnaient bien, ils étaient trop lourds avec beaucoup trop de fonctions inutiles