- À partir de la version v1.62 du navigateur desktop Brave, le LLM par défaut de Leo, l’assistant IA de navigateur axé sur la protection de la vie privée, devient Mixtral 8x7B
- Mixtral 8x7B est un LLM open source publié en décembre par Mistral AI ; sa vitesse, ses performances et son caractère de modèle ouvert correspondent à l’orientation produit de Brave, ce qui a conduit à son intégration dans Leo
- Brave explique que Mixtral 8x7B devance ChatGPT 3.5, Claude Instant, Llama 2 et d’autres sur le LMSYS Chatbot Arena Leaderboard, et qu’il montre des améliorations en matière de réduction des hallucinations et des biais sur le benchmark BBQ
- Leo gratuit comme l’offre Premium à 15 dollars par mois proposent Mixtral 8x7B par défaut, mais la version gratuite applique des limites d’usage plus strictes, tandis que Premium offre des limites plus élevées
- Leo anonymise les requêtes via un proxy inverse, ne stocke pas les conversations et ne les utilise pas pour l’entraînement des modèles ; il est utilisable depuis la barre d’adresse ou la barre latérale, sans application séparée
Le modèle par défaut de Leo passe à Mixtral 8x7B
- Avec la mise à jour v1.62 de son navigateur desktop, Brave remplace le grand modèle de langage par défaut de Leo par Mixtral 8x7B
- Leo est l’assistant IA de navigateur axé sur la protection de la vie privée proposé par Brave, qui permet d’utiliser des fonctions d’IA directement dans le navigateur
- Outre le changement de modèle, cette mise à jour comprend un onboarding plus clair, un contrôle du contexte, des formats d’entrée et de réponse, ainsi que des améliorations générales de l’interface utilisateur
Pourquoi choisir Mixtral 8x7B
- Mixtral 8x7B est un LLM open source publié en décembre par Mistral AI ; son adoption a rapidement progressé dans la communauté des développeurs grâce à sa vitesse et à ses performances
- D’après le LMSYS Chatbot Arena Leaderboard, il affiche de meilleures performances que ChatGPT 3.5, Claude Instant, Llama 2 et d’autres
- D’après le benchmark BBQ, il apporte aussi des améliorations en matière de réduction des hallucinations et des biais
- Ses principales fonctionnalités sont les suivantes
- Traitement d’un contexte plus large
- Interactions en anglais, français, allemand, italien et espagnol
- Génération de code
Utilisation de Mixtral dans les produits Brave
- Brave utilise déjà Mixtral dans Code LLM, la fonctionnalité de Brave Search dédiée aux requêtes liées à la programmation
- Les performances de Mixtral et son caractère open source s’inscrivent dans le soutien de Brave aux modèles ouverts et à la communauté open source
- Brian Bondy, CTO et cofondateur de Brave, a indiqué que Leo avait été adopté par des dizaines de milliers d’utilisateurs gratuits et d’abonnés payants, et qu’il s’attendait à une adoption plus large grâce à l’intégration de Mixtral
- Arthur Mensch, CEO de Mistral AI, a salué l’utilisation de Mixtral dans CodeLLM de Brave Search et dans Brave Leo
Choix de modèles en version gratuite et Premium
- Leo permet de choisir entre plusieurs modèles selon les besoins et le budget
- Mixtral 8x7B est proposé comme LLM par défaut dans la version gratuite comme dans Premium
- Les deux offres prennent aussi en charge Claude Instant d’Anthropic et Llama 2 13B de Meta
- Les conditions d’utilisation de Leo gratuit sont les suivantes
- Mixtral 8x7B et Claude Instant sont soumis à des limites d’usage strictes
- Llama 2 13B dispose de limites d’usage plus élevées
- Une fois la limite d’usage de Mixtral atteinte, il est possible de revenir à Llama 2, l’expérience Leo précédente, pour continuer à utiliser l’IA
- Leo Premium coûte 15 dollars par mois et propose Mixtral 8x7B, Claude Instant et Llama 2 13B avec des limites d’usage plus élevées
Mode de protection de la vie privée
- Les chats de Leo sont conçus sur le principe d’une utilisation privée, anonyme et sécurisée
- Les conversations ne sont pas enregistrées, ne sont pas utilisées pour l’entraînement des modèles, et aucun compte ni connexion n’est nécessaire pour l’utiliser
- Les dispositifs de protection de la vie privée sont les suivants
- Proxy inverse : toutes les requêtes passent par un serveur d’anonymisation, ce qui empêche d’associer une requête à l’adresse de l’utilisateur
- Suppression immédiate des réponses : les réponses de Leo sont supprimées juste après leur génération, et aucune conversation n’est stockée sur les serveurs de Brave
- Aucune collecte d’identifiants : les identifiants pouvant être reliés à l’utilisateur, comme l’adresse IP, ne sont pas collectés
- Aucune conservation par des fournisseurs tiers : les modèles d’IA ou fournisseurs de modèles tiers ne conservent pas les données personnelles
- Aucun compte requis : Leo peut être utilisé sans créer de compte Brave
- Jeton d’abonnement non corrélable : lors de l’abonnement à Leo Premium, l’abonnement est vérifié au moyen d’un jeton qui ne permet pas de relier les informations d’achat à l’utilisation du produit
Utilisation et disponibilité
- Leo est intégré au navigateur et peut être utilisé sans application ni extension séparée
- Les utilisateurs de Brave desktop peuvent saisir une question dans la barre d’adresse puis cliquer sur « Ask Leo », ou ouvrir Leo depuis la Brave Sidebar
- Les fonctions d’IA sont accessibles via une barre latérale de chat à côté d’une page web ou depuis la barre d’adresse
- Dans le contexte d’une page, les tâches suivantes sont prises en charge
- Résumés en temps réel de pages web ou de vidéos
- Réponses aux questions sur le contenu
- Création de nouveaux contenus
- Traduction de pages
- Analyse de pages
- Réécriture de phrases
- Aide à l’écriture de code
- Leo est disponible pour les utilisateurs de Brave desktop depuis novembre, dans la version 1.60
- Leo pour Android et iOS sera disponible prochainement
1 commentaires
Avis sur Hacker News
Pour exécuter Mixtral 8x7B en local, on peut utiliser llama.cpp et, avec des bibliothèques/interfaces compatibles comme text-generation-webui, utiliser https://huggingface.co/TheBloke/Nous-Hermes-2-Mixtral-8x7B-S...
Même la plus petite version en quantification 2 bits nécessite 20 Go de RAM, et peut être déchargée dans la VRAM d’un bon GPU 4090
La version en quantification 4 bits est le plus gros modèle qui rentre de justesse dans un système de 32 Go, et utilise environ 29 à 31 Go
Le 6 bits demande 41 Go et le 8 bits 52 Go, donc un système de 64 Go est nécessaire ; pour décharger les modèles de plus haute précision dans la VRAM, il faut plusieurs GPU avec mémoire partagée
J’ai essayé les modèles 7B et 13B, mais pas encore celui-ci ni d’autres grands modèles
J’ai essayé dolphin mixtral 4 bits sur un MacBook M3 avec 36 Go de RAM, et l’inférence était très rapide
Il est plus facile de faire tourner des modèles plus grands que la VRAM en les répartissant entre GPU et CPU
Mixtral prend en charge 32 000 tokens, ce qui peut représenter une part assez importante de la mémoire utilisée
Brave mérite des éloges pour cette fonctionnalité et ses autres fonctions de protection de la vie privée
Avec le système de jetons d’abonnement non corrélables, lorsqu’on s’abonne à Leo Premium, un jeton servant à vérifier l’abonnement lors de l’utilisation de Leo est émis, et Brave ne peut pas relier les informations de paiement à l’utilisation du produit
Même l’e-mail utilisé pour créer le compte n’est pas associé à l’usage quotidien de Leo : c’est une approche d’identifiants privés assez originale
Je me demande si quelqu’un sait exactement comment cela fonctionne sans utiliser de clés étrangères
J’ai l’impression d’avoir manqué la première annonce de Leo, mais c’est intéressant, et j’aime le design pensé pour la protection de la vie privée
Le fait de ne pas conserver l’historique des conversations est exactement ce que je voulais
C’est comme les promesses de no-log des services VPN : on ne peut pas les vérifier
https://www.spacebar.news/p/stop-using-brave-browser
Je me demande quels sont les bons fournisseurs d’API proposant Mixtral
Je ne connais qu’OctoAI, qui a l’air correct, et j’aimerais connaître des alternatives
Je ne connais pas les prix, mais il semble qu’il faille envoyer un e-mail à api@groq.com
Les prix sont les mêmes que ceux des fournisseurs eux-mêmes
En revanche, pour les modèles OpenAI/Anthropic, ils ont dû activer le filtrage des entrées/sorties en raison des exigences de ces entreprises
C’est très rapide et, avec les réglages par défaut, cela traite déjà 10 tâches en parallèle
Together.ai avait aussi l’air correct lors des premiers tests, mais je ne l’ai pas encore utilisé à grande échelle
Je fais aussi tourner une version en quantification 3 bits de mixtral-8-7b sur un système M2 Pro avec 32 Go de mémoire, et c’est plutôt rapide
C’est une bonne chose d’avoir plusieurs options
La semaine dernière, j’ai testé les versions disponibles sur poe et chat.groq.com
C’est nettement meilleur que llama 70b
Je trouve intéressant qu’ils aient permis de faire une requête LLM directement depuis la barre d’adresse
Je me demande s’ils créeront plus tard une heuristique pour décider s’il faut envoyer la requête directement au LLM ou utiliser le moteur de recherche par défaut
Quand on passe de gpt4 à mistral, on a l’impression de quitter un écran Retina pour revenir à un écran basse résolution
On se retrouve constamment à penser : « mais GPT4, lui, saurait faire ça »
J’exécute Mixtral en local avec ollama
Je me demande s’il existe une bonne extension Chrome qui résume les pages avec l’IA
J’ai essayé quelques-uns des premiers résultats Google, et même s’ils fonctionnaient bien, ils étaient trop lourds avec beaucoup trop de fonctions inutiles
https://kagi.com/summarizer/index.html
https://help.kagi.com/kagi/api/summarizer.html
Ou utilisez l’extension de navigateur Kagi Search (Chrome/Firefox), qui permet d’utiliser directement dans l’extension le modèle Muriel, le plus avancé