1 points par GN⁺ 4 시간 전 | 1 commentaires | Partager sur WhatsApp
  • Nativ est une application open source sous licence MIT qui permet de télécharger et d’exécuter des modèles d’IA ouverts sur les Mac Apple Silicon, sans compte, sans abonnement et sans cloud
  • Elle propose des modèles de Google, Cohere, Liquid AI et d’autres, recommande ceux adaptés au matériel du Mac et génère toutes les réponses en local
  • Le chat prend en charge le streaming, le Markdown, la coloration du code et l’entrée d’images, avec affichage en temps réel de l’état des performances, comme le nombre de tokens par seconde et la pression mémoire
  • Optimisée pour la mémoire unifiée et Metal des puces de série M avec MLX-VLM, elle gère les tâches de langage, vision, vidéo, code et audio
  • Il est possible de connecter le serveur local de modèles à Pi, Codex, Claude Code, Hermes et OpenCode, et l’intégralité du code de l’application et du chargeur de modèles est également publiée

Exécution locale de modèles optimisée pour Mac

  • Application macOS universelle compatible Apple Silicon M1 et plus, elle exécute les vrais modèles directement sur Mac, sans cloud ni couche de conversion supplémentaire
  • Une bibliothèque sélectionnée permet de choisir des modèles ouverts de Google, Cohere et Liquid AI, avec recommandation des modèles adaptés au matériel
  • L’interface de chat propose les fonctions suivantes
    • Réponses en streaming et métriques de performance par message
    • Markdown et coloration syntaxique du code
    • Entrée d’images
  • Les mesures de performance en temps réel permettent de vérifier le nombre de tokens par seconde, la pression mémoire, l’état thermique et le temps jusqu’au premier token
  • Basé sur MLX-VLM, il est ajusté pour la mémoire unifiée et Metal des puces de série M
  • Prend en charge le chat avec LLM, la génération de légendes d’images, le résumé vidéo, l’autocomplétion de code, ainsi que la conversion et la génération vocales
  • Aucun compte, crédit ou abonnement n’est nécessaire, et les données utilisateur ne sont pas revendues

Intégration avec les outils de développement et principes open source

  • Grâce à un endpoint local unique de Nativ, il est possible de relier des agents de codage existants aux modèles locaux exécutés sur Mac
    • Pi
    • Codex
    • Claude Code
    • Hermes
    • OpenCode
  • L’intégralité du code, y compris l’application desktop, le chargeur de modèles et les graphiques de mesures de performance, est publiée et peut être consultée, forkée et faire l’objet de Pull Requests
  • Distribué sous licence MIT, sans feuille de route pilotée par le capital-risque, sans offre enterprise et sans dark patterns transformant les prompts en données d’entraînement
  • La bibliothèque complète de modèles est disponible sur Hugging Face

1 commentaires

 
GN⁺ 4 시간 전
Avis sur Hacker News
  • Cette application sous licence MIT a été créée par Prince Canuma, qui maintient la bibliothèque populaire MLX-VLM. MLX-VLM peut offrir une inférence plus rapide que llama.cpp sur les appareils Apple, et sert depuis longtemps de dépendance à des outils comme LM Studio.
    L’écosystème MLX est plus petit que CUDA, mais il prend très rapidement en charge les nouveaux modèles, en particulier les modèles multimodaux comme la vision, la reconnaissance vocale, la synthèse vocale et la génération vidéo. mlx-audio-swift mérite aussi le détour, et il ne serait pas surprenant de voir ce type de modèles intégré à cette UI.
    La landing page porte peut-être quelques traces de vibe coding, mais la majeure partie de l’application est écrite en Swift, ce qui semble aussi faciliter le portage de cette pile d’inférence vers l’iPad et l’iPhone.

    • Aujourd’hui, Hugging Face propose des versions MLX de presque tous les modèles populaires. Par exemple, depuis la page principale de Qwen 3.6 35B-A3B, il suffit de suivre les liens de quantification et de choisir une variante MLX réputée et populaire.
    • J’ai été content de voir blaizzy dans le domaine. Le travail de Prince Canuma autour de MLX est particulièrement qualitatif.
    • Le dépôt GitHub indique que la prise en charge de modèles dédiés à l’audio et à la génération d’images arrivera bientôt. Prince Canuma répond très vite sur X et dans les issues GitHub, et j’utilise presque tous les jours mlx-audio avec mlx-community/Qwen3-TTS-12Hz-1.7B-Base-bf16 pour du clonage vocal.
    • La première question qui m’est venue est : qu’est-ce qui le différencie d’Unsloth ?
    • Comme vllm ou sglang, mlx-vlm a une prise en charge très médiocre des samplers récents, si bien que migrer vers lui peut être contre-productif. Je suis l’un des auteurs de l’article sur min_p, et si min_p est la meilleure option alors que llama.cpp prend en charge un top-n-sigma bien supérieur, il n’y a aucune raison de changer, même si la vitesse est meilleure.
      Pour prendre en charge les samplers modernes, on peut commencer par regarder l’article 1, l’article 2 et l’article 3.
  • Le terme frontier me semble galvaudé. Je pensais qu’il désignait des modèles au tout meilleur niveau, comme Fable aujourd’hui, mais ces modèles exigent énormément de RAM et des GPU coûteux, ce qui les rend difficiles à auto-héberger.

    • Ici, il semble s’agir du front de Pareto, c’est-à-dire l’ensemble des meilleures solutions à un problème d’optimisation multi-objectifs. Si l’on prend comme critères l’intelligence et le prix, un modèle appartient au frontier lorsqu’aucun autre modèle n’offre une intelligence égale ou supérieure pour moins cher, ni une intelligence supérieure à prix égal ou inférieur.
      Le graphique d’Artificial Analysis rend cela assez intuitif. Par exemple, comme aucun modèle n’est aussi intelligent que DeepSeek V4 Pro tout en étant moins cher, on peut le considérer comme un modèle frontier. Les solutions du front de Pareto sont les meilleures de leur catégorie : on ne peut pas les remplacer par une meilleure alternative sans renoncer à autre chose.
    • Cet usage prête à confusion et j’ai du mal à y adhérer, mais en général il peut y avoir plusieurs frontiers, et celui des petits modèles locaux à poids ouverts me semble le plus important et le plus intéressant.
      Chaque fois que j’utilise Gemma 4 12B, je trouve qu’il est petit, malin et efficace, tout en ayant l’impression que l’énergie de l’industrie de l’IA part complètement dans la mauvaise direction. Si les budgets de recherche se concentraient sur l’amélioration des modèles capables de tourner sur des systèmes à 16 Go de mémoire unifiée, des progrès importants seraient possibles.
      Qwen 3.6 et les fine-tunes 27B de BottleCap sont bons eux aussi, mais les performances étonnantes des petits modèles Gemma 4 ne sont pas assez connues. Même si l’emploi du terme frontier par ce site pour Qwen 3.6 27B paraît inapproprié, ce n’est pas non plus totalement déconnecté de ses performances.
    • Un frontier se définit comme une combinaison optimale sur plusieurs dimensions : nombre de paramètres, performances par tâche, vitesse de génération de tokens sur le même matériel, besoins en mémoire active, etc. Parmi les options actuelles, un modèle appartient au frontier si améliorer un indicateur implique d’en dégrader au moins un autre.
    • Un frontier est une courbe, autrement dit un front de Pareto.
    • L’écart entre l’open source et l’état de l’art se réduit avec des modèles comme Kimi K3, mais Kimi K3 dépasse les 2 000 milliards de paramètres. Des modèles réellement exécutables sur un Mac ordinaire, comme Gemma 4, ne jouent pas dans la même catégorie.
  • Je suis surpris que la page d’accueil présente les choses comme si des applications existantes comme LM Studio n’existaient pas. À première vue, ce qui est différent n’est pas clair, et Open WebUI est aussi absent.
    Sur mon MacBook Pro, je fais tourner DeepSeek V4 Flash en local depuis plusieurs semaines avec Open WebUI et DS4.

    • LM Studio est un logiciel propriétaire construit sur du code publié par le développeur de Nativ.
    • LM Studio fait la même chose, mais il n’est pas open source. Nativ apporte donc bien un élément différenciant.
    • La phrase « les autres applications d’IA locale dont vous avez entendu parler sont des shells propriétaires construits sur des moteurs open source qu’elles ne possèdent pas » vise LM Studio à mots couverts.
    • Je suis curieux de connaître la configuration du MacBook. Sur mon Strix Halo, DeepSeek V4 Flash est trop lent pour un usage agentique.
  • Frontier est désormais devenu un mot galvaudé, comme load-bearing pour les utilisateurs de Claude Code. Surtout que cette application ne permet pas vraiment d’exécuter localement les meilleurs modèles sur Mac ; j’aimerais donc qu’on arrête de l’utiliser.

  • Je n’aime pas les formules marketing du type « pourquoi nous sommes open source alors que personne d’autre ne le fait ». J’utilise oMLX, qui est open source et semble proposer toutes les fonctionnalités de Nativ.
    J’aimerais une vraie comparaison avec les concurrents open source existants, plutôt que de faire comme s’ils n’existaient pas.

    • Ils voulaient probablement expliquer pourquoi des options comme LM Studio ne sont pas open source.
  • Je me demande à quoi servent vraiment les petits modèles locaux. Ils sont devenus assez capables, mais il est encore difficile de leur faire confiance pour du travail réel, en dehors de quelques projets jouets faits pour s’amuser
    Je me demande si les gens les utilisent vraiment comme agents de codage, ou plutôt pour d’autres usages

    • J’ai déjà déployé en production du code généré par Qwen3.6 27B dans OpenCode. Son périmètre de connaissances n’est pas aussi large que celui d’Opus, mais s’il peut déduire entièrement les changements à partir du prompt et du code environnant, il fonctionne très bien
      Il a du mal à écrire de zéro du code nécessitant une expertise spécialisée, comme un moteur d’inférence haute performance pour GPU Blackwell, mais pour une PR classique qui ajoute un cas d’usage à un projet existant, il est à peu près au niveau de Sonnet. Il faut la bonne configuration : les réglages de temperature et de top-p recommandés, une quantification pas excessive, et au moins 150 000 tokens de contexte
    • J’utilise Gemma 4 en local pour l’extraction de graphe de mémoire de mon agent personnel. Il découpe les messages en sujets, sources, faits, entités, etc., puis les insère dans un graphe de recherche basé sur NLEmbeddings
      L’agent cible utilise DeepSeek V4 Flash ; le modèle local est trop lent pour servir d’agent de chat, mais il fonctionne plutôt bien pour l’extraction de mémoire et réduit la consommation d’API à chaque tour de conversation
    • Je ne les utilise pas comme agents de codage, mais ils sont très utiles pour la transformation de texte, le résumé et l’extraction d’informations. Si vous êtes déjà abonné à des modèles payants, il n’y a peut-être pas d’avantage particulier en dehors de la confidentialité, mais ce n’est pas négligeable pour autant
    • Même les petits modèles gèrent suffisamment bien les tâches répétitives comme les mises à jour de dépendances, la résolution de conflits de merge, --help, Markdown ou la rédaction de README. En cas d’échec, on peut revenir en arrière avec git restore ou refuser la PR, puis confier la tâche à un meilleur modèle
    • Qwen35ba3b peut effectuer un nettoyage de données à grande échelle même sur du matériel relativement ordinaire. Avec deux GPU 3090, il a déjà traité environ 100 milliards de tokens
  • Je me demande ce que cela apporte par rapport à LM Studio, et si cela exécute aussi les modèles MTP. À ma connaissance, les modèles MTP sont au format GGUF

  • J’ai essayé MLX via Rapid MLX, mais Qwen se coupait sans arrêt et répétait les mêmes choses. En passant à llama.cpp, la génération de tokens en MTP est devenue plus rapide et le modèle était aussi plus stable
    Je suis curieux de savoir quels résultats les autres ont obtenus en comparant MLX et llama.cpp

    • Sur un M1 Max, je n’ai presque pas vu d’avantage à MLX. Les changements de l’Apple Neural Engine pourraient rendre les gains plus importants à partir du M3
      Sur les modèles que j’ai testés, les performances GGUF de llama.cpp étaient parfois meilleures. Le MTP de Gemma 4 n’avait pas beaucoup d’intérêt, mais sur Qwen 3.6 MoE, il y avait une différence mesurable, qui pourrait être plus significative avec du matériel récent
    • J’ai testé MLX à deux moments différents, mais à chaque fois ses performances étaient nettement inférieures à celles de llama.cpp
  • Je me demande quelle configuration de Mac milieu de gamme conviendrait pour cet usage. J’hésite entre un M5 Pro 64 Go et un M5 Air d’entrée de gamme avec paiement des tokens cloud
    Au lieu de dépenser 2 000 à 3 000 dollars de plus pour faire tourner localement des modèles moins performants, on peut acheter une quantité importante de tokens cloud

    • Même sur un M1 Max 64 Go, on peut exécuter pas mal de ces modèles
  • Je me demande pourquoi ils ne font pas tourner DeepSeek V4 sur ds4. Les résultats pourraient être assez bons

    • Nativ ne semble pas prendre en charge le streaming depuis SSD comme DwarfStar