- Le TII d’Abu Dhabi a dévoilé la série Falcon 2, mettant en avant des modèles multilingues et multimodaux dans la concurrence des LLM open source
- Falcon 2 11B est un modèle de 11 milliards de paramètres entraîné sur 5,5 billions de tokens, qui devance Meta Llama 3 8B sur le leaderboard de Hugging Face
- Falcon 2 11B VLM est le premier modèle multimodal du TII, capable de convertir des entrées visuelles en texte, avec des applications possibles dans de nombreux secteurs
- Les deux modèles sont proposés en open source sous la TII Falcon License 2.0, et conçus pour être plus faciles à déployer et à intégrer par les développeurs, même sur une infrastructure plus légère
- Le TII prévoit d’étendre Falcon 2 à plusieurs tailles et étudie l’approche Mixture of Experts pour améliorer les performances et la qualité des réponses
Présentation de Falcon 2 et composition de la gamme
- Le Technology Innovation Institute, organisation de recherche appliquée rattachée à l’Advanced Technology Research Council d’Abu Dhabi, a lancé le grand modèle de langage Falcon 2 le 13 mai 2024
- Cette série se compose de deux modèles
- Falcon 2 11B : un LLM de 11 milliards de paramètres entraîné sur 5,5 billions de tokens
- Falcon 2 11B VLM : un modèle vision-vers-langage qui convertit des entrées visuelles en sorties textuelles
- Les deux modèles prennent en charge le multilingue, et Falcon 2 11B VLM est le premier modèle multimodal du TII
- Le TII présente Falcon 2 11B VLM comme le seul modèle actuellement disponible sur le segment haut de gamme du marché à proposer une fonction de conversion image-vers-texte
Comparaison des performances et champ d’application
- Falcon 2 11B a été comparé à la catégorie des modèles préentraînés sur le leaderboard d’évaluation des LLM ouverts de Hugging Face
- Il affiche de meilleures performances que Llama 3 8B de Meta
- Il se situe dans le groupe de tête avec un score presque identique à Gemma 7B de Google
- Les scores sont de 64,28 pour Falcon 2 11B et 64,29 pour Gemma 7B
- Le modèle Falcon 2 11B traite des tâches en anglais, français, espagnol, allemand, portugais et dans plusieurs autres langues
- Falcon 2 11B VLM peut identifier et interpréter des images ainsi que des éléments visuels de l’environnement
- Les domaines d’application cités incluent la santé, la finance, le e-commerce, l’éducation et le droit
- Les cas d’usage mentionnés incluent aussi la gestion documentaire, l’archivage numérique, l’indexation contextuelle et l’assistance aux personnes malvoyantes
Modalités de publication et prochaines étapes
- Falcon 2 11B et Falcon 2 11B VLM sont tous deux proposés en open source et accessibles aux développeurs
- Les deux modèles sont présentés comme pouvant fonctionner efficacement sur un seul GPU, ce qui facilite leur déploiement et leur intégration sur une infrastructure plus légère, comme des ordinateurs portables et d’autres appareils
- Falcon 2 11B est proposé sous la TII Falcon License 2.0, une licence logicielle permissive basée sur Apache 2.0
- Elle inclut une politique d’usage autorisé visant à encourager une utilisation responsable de l’IA
- Le TII prévoit à l’avenir de décliner la prochaine génération de Falcon 2 en plusieurs tailles et étudie l’introduction de l’approche Mixture of Experts
- Mixture of Experts consiste à combiner de petits réseaux aux expertises différentes afin de produire des réponses plus fines et mieux adaptées
- Le TII estime que cette approche peut améliorer la précision et accélérer la prise de décision
- Les informations sur les nouveaux modèles sont disponibles sur FalconLLM.TII.ae
1 commentaires
Avis de Hacker News
Les résultats des benchmarks semblent à peu près comparables à ceux de Mistral 7B et Llama 3 8B ; compte tenu de la taille accrue du modèle, ça ne paraît pas très impressionnant
https://huggingface.co/tiiuae/falcon-11B
https://huggingface.co/meta-llama/Meta-Llama-3-8B
https://mistral.ai/news/announcing-mistral-7b/
Cette fois, ils affirment que falcon-11b est meilleur que Llama 3 8b, mais on voit déjà plusieurs problèmes. falcon-11b est environ 40 % plus gros que Llama 3 8b, ce qui rend difficile une comparaison dans la même catégorie de taille, et l’affirmation s’appuie sur des benchmarks automatisés, alors qu’il est clair depuis longtemps que les benchmarks automatisés seuls ne suffisent pas pour tirer une telle conclusion
Certains scores de benchmarks automatisés sont bien inférieurs à ceux de Llama 3 8b, et il ne le dépasse que de justesse sur un seul benchmark. Il est possible de faire en sorte qu’un modèle paraisse être le meilleur de tous les temps sur un benchmark donné, mais cela ne signifie absolument pas que c’est un bon modèle
Sans aucune évaluation humaine, ils ont tout de même utilisé volontairement un titre putaclic avec une affirmation hâtive, et en disant qu’il est meilleur que Llama 3, ils ignorent complètement Llama 3 70b
Franchement, ça m’agace que tiiuae continue à recevoir autant d’attention alors qu’ils ne sortent rien d’utile et poursuivent ce genre de bait trompeur
Leur jeu de données web nettoyé est fortement censuré, et cela peut aussi jouer. Il est moralement très conservateur et exclut complètement la pornographie ainsi que de nombreux sujets
Il ne serait donc pas surprenant qu’une partie du problème vienne du fait qu’ils filtrent trop de contenu et ajoutent surtout davantage de choses similaires
Le modèle est certes plus grand, mais son entraînement a nécessité moins de tokens que Llama 3. Le problème, c’est qu’en l’absence de jeu de données public, il est difficile de comparer et de reproduire correctement
Difficile de savoir si cela vient de l’architecture du modèle, de la qualité du jeu de données, de la taille du modèle, d’une combinaison de ces facteurs ou d’autre chose
La licence n’est pas bonne : https://falconllm-staging.tii.ae/falcon-2-terms-and-conditio...
C’est une licence Apache 2 modifiée avec des clauses supplémentaires, qui incluent l’obligation de respecter une politique d’utilisation acceptable : https://falconllm-staging.tii.ae/falcon-2-acceptable-use-pol...
Or cette licence Apache 2 modifiée indique que « la politique d’utilisation acceptable peut être mise à jour de temps à autre, et vous devez surveiller l’adresse web où elle est hébergée afin de vous assurer que votre utilisation de l’œuvre ou des œuvres dérivées respecte la politique mise à jour »
Quelle que soit la manière dont on considère la politique d’utilisation acceptable actuelle, ils se réservent le droit de la modifier à leur guise à l’avenir, et les utilisateurs devront respecter la nouvelle politique
Cela illustre bien pourquoi je n’aime pas cette tendance à qualifier d’open source des licences qui ne sont pas compatibles avec la définition de l’OSI
Il y a une phrase disant que « le nouveau Falcon 2 11B dépasse Llama 3 8B de Meta et offre des performances équivalentes au modèle Google Gemma 7B de référence », alors que j’avais vraiment en tête que Llama 3 8B devançait Gemma 7B sur presque toutes les métriques
Cela dit, d’après mon usage, le modèle chat Gemma 1.1 était plutôt correct, et je pense bien que le modèle chat Llama3 8B est nettement meilleur
CodeGemma 1.1 7B est particulièrement sous-estimé par rapport aux modèles de codage comparables. Le modèle de base CodeGemma 7B faisait partie des meilleurs modèles que j’ai testés pour la complétion de code, et le modèle chat faisait aussi partie des meilleurs que j’ai testés pour écrire du code
Les autres modèles semblent mieux optimiser les benchmarks, mais en usage réel ils ne tiennent pas aussi bien que CodeGemma. J’ai hâte de voir ce que donnera CodeLlama3, mais il n’existe pas encore
Ces temps-ci, je ne suis plus beaucoup les benchmarks et je me consacre entièrement au basket
Pour info, je suis en fait un peu meilleur que Lebron. Lebron est même bien moins bon que ma fille de trois ans, et il m’arrive de battre ma fille. Au basket
Soupir, j’ai cru que c’était un article sur Falcon AT de Spectrum Holobyte. D’après MyAbandonware.com :
« Essentiellement Falcon 2, mais commercialisé différemment d’une manière ou d’une autre, Falcon AT est la deuxième sortie de la série Falcon de Spectrum Holobyte, une simulation de vol hardcore révolutionnaire. Contrairement à l’idée reçue selon laquelle Falcon 3.0 marquerait le début des simulations de vol modernes, Falcon AT constituait déjà une nette avancée par rapport à Falcon, avec des graphismes EGA nets, de nombreuses options réalistes et une campagne largement étoffée. Ce jeu est une simulation de combat aérien moderne, avec les excellents tutoriels, la variété des missions et la précision de la dynamique de vol que les fans de Falcon ont appris à connaître et à aimer. Parmi ses nombreuses innovations figuraient aussi des options multijoueur étonnamment jouables en hotseat et par modem. Aujourd’hui largement oublié, Falcon AT explique l’écart difficile à comprendre entre Falcon et Falcon 3.0 »
Je ne comprends pas ce que veut dire la formule « le seul modèle d’IA doté de capacités vision-langage ». Ce n’est pas à peu près ce que font GPT-4 Vision et LLaVA ?
Peut-être qu’on pourrait dire que LLaVA est un modèle langage-vision, mais même en l’interprétant comme ça je n’arrivais pas à rendre la phrase cohérente
Peut-être que c’est juste un mensonge
Les modèles ouverts sont bienvenus, mais comme cela a déjà été souligné ici, les modèles Falcon ne sont pas si ouverts que ça. Le Falcon original ne fonctionnait pas non plus aussi bien que ses chiffres de benchmark le laissaient entendre. Il a été présenté comme une grande avancée, mais à sa sortie je n’ai pas eu l’impression qu’il surpassait les modèles ouverts concurrents
Le discours marketing selon lequel le modèle 11B devancerait des modèles 7B et 8B de « même catégorie » semble un peu forcé. Je vais suivre ça, et je compte clairement l’essayer en inférence locale. Mais à l’intuition, un llama 3 8B finement ajusté est probablement le meilleur de sa catégorie cette semaine
Ce genre de rappel, que l’IA sera utilisée non seulement par des pays démocratiques qui tentent au moins une certaine surveillance éthique, mais aussi par les pires dictateurs, est vraiment glaçant
Son pays est l’un des rares pays développés dont l’économie continue de croître régulièrement, et il possède l’une des politiques d’immigration les plus libres au monde, tout en étant l’un des pays les plus sûrs hors d’Asie de l’Est
Plutôt que de figurer parmi les pires dictateurs, il est beaucoup plus proche d’un candidat au titre de meilleur dictateur
Il y a quelque chose que j’aimerais comprendre. Ce modèle a bien été entraîné en grande partie sur des jeux de données publics, avec du matériel AWS, et en utilisant des algorithmes et techniques bien connus, non ? En quoi est-il différent des autres modèles que n’importe qui disposant de suffisamment d’argent pourrait entraîner ?
Avec mon regard sceptique, voire presque hostile, j’y vois seulement de la démonstration de prestige et une tentative de paraître pertinent. Est-ce qu’il y a quelque chose qui m’échappe dans ce type d’initiative ?
Même si le résultat final n’est généralement pas particulièrement intéressant, c’est positif qu’il y ait des gens qui travaillent là-dessus
Pendant un instant, j’ai cru que ça avait un rapport avec le simulateur de vol classique :
https://en.wikipedia.org/wiki/Falcon_4.0
Le parti pris de l’article est tellement absurde qu’on a envie de dire aux Émirats arabes unis d’être un peu plus subtils. « bat llama 3 » est un résumé suspect tellement il est inutile, et la partie sur « le seul modèle d’IA doté de capacités vision-langage » est tout simplement déroutante