- Nativ est une application open source sous licence MIT qui permet de télécharger et d’exécuter des modèles d’IA ouverts sur les Mac Apple Silicon, sans compte, sans abonnement et sans cloud
- Elle propose des modèles de Google, Cohere, Liquid AI et d’autres, recommande ceux adaptés au matériel du Mac et génère toutes les réponses en local
- Le chat prend en charge le streaming, le Markdown, la coloration du code et l’entrée d’images, avec affichage en temps réel de l’état des performances, comme le nombre de tokens par seconde et la pression mémoire
- Optimisée pour la mémoire unifiée et Metal des puces de série M avec MLX-VLM, elle gère les tâches de langage, vision, vidéo, code et audio
- Il est possible de connecter le serveur local de modèles à Pi, Codex, Claude Code, Hermes et OpenCode, et l’intégralité du code de l’application et du chargeur de modèles est également publiée
Exécution locale de modèles optimisée pour Mac
- Application macOS universelle compatible Apple Silicon M1 et plus, elle exécute les vrais modèles directement sur Mac, sans cloud ni couche de conversion supplémentaire
- Une bibliothèque sélectionnée permet de choisir des modèles ouverts de Google, Cohere et Liquid AI, avec recommandation des modèles adaptés au matériel
- L’interface de chat propose les fonctions suivantes
- Réponses en streaming et métriques de performance par message
- Markdown et coloration syntaxique du code
- Entrée d’images
- Les mesures de performance en temps réel permettent de vérifier le nombre de tokens par seconde, la pression mémoire, l’état thermique et le temps jusqu’au premier token
- Basé sur MLX-VLM, il est ajusté pour la mémoire unifiée et Metal des puces de série M
- Prend en charge le chat avec LLM, la génération de légendes d’images, le résumé vidéo, l’autocomplétion de code, ainsi que la conversion et la génération vocales
- Aucun compte, crédit ou abonnement n’est nécessaire, et les données utilisateur ne sont pas revendues
Intégration avec les outils de développement et principes open source
- Grâce à un endpoint local unique de Nativ, il est possible de relier des agents de codage existants aux modèles locaux exécutés sur Mac
- Pi
- Codex
- Claude Code
- Hermes
- OpenCode
- L’intégralité du code, y compris l’application desktop, le chargeur de modèles et les graphiques de mesures de performance, est publiée et peut être consultée, forkée et faire l’objet de Pull Requests
- Distribué sous licence MIT, sans feuille de route pilotée par le capital-risque, sans offre enterprise et sans dark patterns transformant les prompts en données d’entraînement
- La bibliothèque complète de modèles est disponible sur Hugging Face
1 commentaires
Avis sur Hacker News
Cette application sous licence MIT a été créée par Prince Canuma, qui maintient la bibliothèque populaire MLX-VLM. MLX-VLM peut offrir une inférence plus rapide que llama.cpp sur les appareils Apple, et sert depuis longtemps de dépendance à des outils comme LM Studio.
L’écosystème MLX est plus petit que CUDA, mais il prend très rapidement en charge les nouveaux modèles, en particulier les modèles multimodaux comme la vision, la reconnaissance vocale, la synthèse vocale et la génération vidéo. mlx-audio-swift mérite aussi le détour, et il ne serait pas surprenant de voir ce type de modèles intégré à cette UI.
La landing page porte peut-être quelques traces de vibe coding, mais la majeure partie de l’application est écrite en Swift, ce qui semble aussi faciliter le portage de cette pile d’inférence vers l’iPad et l’iPhone.
blaizzydans le domaine. Le travail de Prince Canuma autour de MLX est particulièrement qualitatif.mlx-community/Qwen3-TTS-12Hz-1.7B-Base-bf16pour du clonage vocal.Pour prendre en charge les samplers modernes, on peut commencer par regarder l’article 1, l’article 2 et l’article 3.
Le terme frontier me semble galvaudé. Je pensais qu’il désignait des modèles au tout meilleur niveau, comme Fable aujourd’hui, mais ces modèles exigent énormément de RAM et des GPU coûteux, ce qui les rend difficiles à auto-héberger.
Le graphique d’Artificial Analysis rend cela assez intuitif. Par exemple, comme aucun modèle n’est aussi intelligent que DeepSeek V4 Pro tout en étant moins cher, on peut le considérer comme un modèle frontier. Les solutions du front de Pareto sont les meilleures de leur catégorie : on ne peut pas les remplacer par une meilleure alternative sans renoncer à autre chose.
Chaque fois que j’utilise Gemma 4 12B, je trouve qu’il est petit, malin et efficace, tout en ayant l’impression que l’énergie de l’industrie de l’IA part complètement dans la mauvaise direction. Si les budgets de recherche se concentraient sur l’amélioration des modèles capables de tourner sur des systèmes à 16 Go de mémoire unifiée, des progrès importants seraient possibles.
Qwen 3.6 et les fine-tunes 27B de BottleCap sont bons eux aussi, mais les performances étonnantes des petits modèles Gemma 4 ne sont pas assez connues. Même si l’emploi du terme frontier par ce site pour Qwen 3.6 27B paraît inapproprié, ce n’est pas non plus totalement déconnecté de ses performances.
Je suis surpris que la page d’accueil présente les choses comme si des applications existantes comme LM Studio n’existaient pas. À première vue, ce qui est différent n’est pas clair, et Open WebUI est aussi absent.
Sur mon MacBook Pro, je fais tourner DeepSeek V4 Flash en local depuis plusieurs semaines avec Open WebUI et DS4.
Frontier est désormais devenu un mot galvaudé, comme
load-bearingpour les utilisateurs de Claude Code. Surtout que cette application ne permet pas vraiment d’exécuter localement les meilleurs modèles sur Mac ; j’aimerais donc qu’on arrête de l’utiliser.Je n’aime pas les formules marketing du type « pourquoi nous sommes open source alors que personne d’autre ne le fait ». J’utilise oMLX, qui est open source et semble proposer toutes les fonctionnalités de Nativ.
J’aimerais une vraie comparaison avec les concurrents open source existants, plutôt que de faire comme s’ils n’existaient pas.
Je me demande à quoi servent vraiment les petits modèles locaux. Ils sont devenus assez capables, mais il est encore difficile de leur faire confiance pour du travail réel, en dehors de quelques projets jouets faits pour s’amuser
Je me demande si les gens les utilisent vraiment comme agents de codage, ou plutôt pour d’autres usages
Il a du mal à écrire de zéro du code nécessitant une expertise spécialisée, comme un moteur d’inférence haute performance pour GPU Blackwell, mais pour une PR classique qui ajoute un cas d’usage à un projet existant, il est à peu près au niveau de Sonnet. Il faut la bonne configuration : les réglages de temperature et de top-p recommandés, une quantification pas excessive, et au moins 150 000 tokens de contexte
L’agent cible utilise DeepSeek V4 Flash ; le modèle local est trop lent pour servir d’agent de chat, mais il fonctionne plutôt bien pour l’extraction de mémoire et réduit la consommation d’API à chaque tour de conversation
--help, Markdown ou la rédaction de README. En cas d’échec, on peut revenir en arrière avecgit restoreou refuser la PR, puis confier la tâche à un meilleur modèleJe me demande ce que cela apporte par rapport à LM Studio, et si cela exécute aussi les modèles MTP. À ma connaissance, les modèles MTP sont au format GGUF
J’ai essayé MLX via Rapid MLX, mais Qwen se coupait sans arrêt et répétait les mêmes choses. En passant à llama.cpp, la génération de tokens en MTP est devenue plus rapide et le modèle était aussi plus stable
Je suis curieux de savoir quels résultats les autres ont obtenus en comparant MLX et llama.cpp
Sur les modèles que j’ai testés, les performances GGUF de llama.cpp étaient parfois meilleures. Le MTP de Gemma 4 n’avait pas beaucoup d’intérêt, mais sur Qwen 3.6 MoE, il y avait une différence mesurable, qui pourrait être plus significative avec du matériel récent
Je me demande quelle configuration de Mac milieu de gamme conviendrait pour cet usage. J’hésite entre un M5 Pro 64 Go et un M5 Air d’entrée de gamme avec paiement des tokens cloud
Au lieu de dépenser 2 000 à 3 000 dollars de plus pour faire tourner localement des modèles moins performants, on peut acheter une quantité importante de tokens cloud
Je me demande pourquoi ils ne font pas tourner DeepSeek V4 sur ds4. Les résultats pourraient être assez bons