- Modèle de génération d’images de base de 3e génération de la série Qwen-Image, qui vise comme objectif central le « Real(实) », exploitable pour des tâches de productivité au-delà de la simple création de belles images
- Traite jusqu’à 4,5k tokens en entrée pour générer d’un seul coup des mises en page très riches en informations, comme des journaux, storyboards ou sujets d’examen, ainsi que des images où plusieurs concepts sont parallèles ou imbriqués
- Rend lisibles des caractères de 10 px, des formules LaTeX et des annotations manuscrites, tout en reproduisant des textures fines comme les pores, les cheveux, la peau ou les coups de pinceau
- Prend en charge 12 langues, plusieurs polices, plus de 100 styles artistiques, des UI web, de jeux et de livestreaming, et peut aussi rechercher des informations récentes sur Internet pour les intégrer aux images
- Un modèle qui cherche à étendre la génération d’images à un outil de productivité déployable pour le design, la création de contenu, l’éducation et l’e-commerce, notamment avec des PDF de journaux, des storyboards de mini-séries et des UI complexes
Un modèle de 3e génération orienté « Real »
- Qwen-Image-3.0 est le modèle de génération d’images de base de 3e génération de la série Qwen-Image
- Les axes clés de chaque génération sont les suivants
- Qwen-Image-1.0 : Precision
- Qwen-Image-2.0 : Precision, Variety, Completeness, Beauty, Authenticity
- Qwen-Image-3.0 : Real(实)
- « Real » repose sur trois capacités
- Contenu riche : prise en charge d’entrées jusqu’à 4,5k tokens et de mises en page complexes
- Détails réalistes : reproduction de caractères de 10 px et de micro-éléments comme les pores ou les cheveux
- Connaissances approfondies : génération s’appuyant sur 12 langues, des UI variées et des connaissances du monde
- L’objectif est de faire évoluer la génération d’images de « utilisable » à « pratique », et de « joli à regarder » à utile
Contenu riche et agencements complexes
- Dans des diapositives de mathématiques, le modèle peut rendre simultanément les relations spatiales, les symboles mathématiques, l’explication des théorèmes et la position relative de chaque élément
- Avec une consigne d’environ 3,7k tokens, il génère en une seule passe une grille 3×3, sans assembler plusieurs images
- Chaque cellule est une infographie complexe combinant phrases en chinois et en anglais, formules, graphiques et personnages de bande dessinée
- Il place dans une seule image une bande dessinée sur la sécurité des tunnels, un cours de géométrie dans l’espace, une analyse stylistique de « Chu Shi Biao », un mouvement parabolique, de la parasitologie, un schéma médical de douleur thoracique droite, le théorème de Sylow, le contrôle interne bancaire et une comparaison de structures d’ADN cellulaire
- Il accepte des consignes allant jusqu’à 4,5k tokens et comprend puis rend des mises en page visuelles à forte densité d’information
-
Mise à l’échelle horizontale
- Désigne la capacité à placer plusieurs éléments parallèles sur une même toile
- Utilise la juxtaposition sémantique et le contrôle spatial pour organiser plusieurs concepts sans qu’ils se gênent mutuellement
-
Profondeur verticale
- Capacité à décomposer le sens et à représenter étape par étape des interfaces logiquement imbriquées
- Génère, à partir d’une seule consigne, une structure multi-écrans superposant un écran de programmation VSCode, Qwen Chat, WeChat et une affiche de café filtre manuel
- Chaque couche conserve le style et les éléments détaillés de l’UI correspondante
Des petits caractères à la restauration picturale
-
Petits caractères et composition complexe
- Rend lisibles même les petits caractères de 10 px
- Peut générer des zones combinant beaucoup de texte et d’illustrations, comme une infographie de connaissances sur le requin-baleine
- Reproduit, sur une page d’article d’algèbre géométrique, des formules LaTeX, exposants et indices, lettres grecques, numéros de théorèmes, accolades, barres de fraction et alignements sur plusieurs lignes
- Maintient la lisibilité des formules et du corps de texte même avec une petite police
- Génère des images au format journal combinant une texture de papier réaliste et un texte dense
-
Édition et écriture manuscrite
- Peut ajouter des annotations manuscrites rouges sur une page de livre
- Inclut soulignements, traits ondulés, cercles, flèches et courtes notes
- Reproduit un style d’écriture manuscrite naturel, comme des notes de cours de lycéen
-
Rendu des textures et restauration
- Décrit dans les portraits des micro-éléments comme les pores, les cheveux et la texture de la peau, et peut aussi représenter les textures délicates d’autres objets
- Restaure des peintures traditionnelles endommagées ou partiellement disparues en respectant le style pictural et les coups de pinceau d’origine
- Dans une peinture de combat d’aigles, supprime les taches de moisissure et les traces de dégradation, complète les parties manquantes, tout en conservant les nuances d’encre, la texture des plumes et l’équilibre de la composition
Exploitation des langues, des UI et des connaissances du monde
- Prend en charge 12 langues, plusieurs polices, plus de 100 styles artistiques et diverses interfaces UI
- Inclut des exemples de rendu précis en japonais, coréen et espagnol
- Peut générer plusieurs types d’écrans UI réalistes : pages web, jeux, livestreaming, etc.
-
Infographies fondées sur les connaissances
- Étend une vraie photo d’insecte en infographie de recherche tout en conservant le sujet principal
- Inclut informations taxonomiques, annotations de caractéristiques morphologiques, vues détaillées agrandies et barre d’échelle
- Structure le résultat sous forme de figure de recherche directement exploitable pour une publication académique
-
Informations récentes et exploitation d’IP
- Au-delà des connaissances détenues par le modèle, il peut se connecter à Internet pour rechercher des informations récentes
- Il recherche la météo de Hangzhou le 21 juillet et génère une image de prévisions météo
- Il peut rechercher un personnage d’IP précis et créer une image à partir de celui-ci
- Il génère une scène où Qi Baishi et Van Gogh présentent Qwen-Image-3.0 dans une salle de livestreaming
Extension aux tâches de productivité
- Sur la base de ses trois capacités clés, il prend en charge des tâches à forte valeur comme des PDF de journaux, des storyboards de mini-séries et des interfaces UI complexes
- Son objectif est de relier les capacités de génération d’images à une valeur de productivité dans davantage de domaines, comme le design, la création de contenu, l’éducation et l’e-commerce
1 commentaires
Avis Hacker News
C'est étrange de voir ce genre de modèle poussé dans le e-commerce. Comme il retouche la façon dont les vêtements tombent sur le corps et rend même l'éclairage plus flatteur, il reste difficile de savoir comment le vêtement tombe et taille réellement, tout comme avant son adoption
Dans 50 ans, la « véracité de la publicité » pourrait elle-même être considérée comme un passé idéalisé impossible à retrouver
Mais pour une plateforme où 1 000 nouveaux produits sont mis en ligne chaque mois, des photos réelles et imparfaites semblent au contraire meilleures pour la conversion. Surtout que ces images au style 3D où toutes les variantes de couleur se ressemblent provoquent plutôt un rejet
Il est intéressant de voir plus de 100 entrées liées au contenu adulte comme hentai, nudes, etc. dans les meta keywords du HTML
En lançant
document.querySelector('meta[name="keywords"]').contentdans la console, on peut voir l'ensemble des tagsqwen, il a peut-être inclus jusqu'à des fautes de frappe commegwenoubendans des contextes adulteskeywords, et elle ajoute juste plus de 77 KB de données inutiles à la pageOn dirait un entraînement sur des sorties de GPT Image 1, avec cette teinte jaune caractéristique bien visible
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
L'arabe du titre de l'image principale est manifestement cassé, mais ce n'est pas le cas lors de l'utilisation réelle du modèle. Il se peut que l'image principale n'ait pas été générée avec Qwen Image 3.0
Ils disent qu'il faut 3 700 tokens pour décrire correctement toute la grille 3×3, mais comme ils ne publient pas le prompt, la démonstration perd en crédibilité
Il n'y a absolument rien sur si et quand les poids seront publiés, donc je me demande s'il y a des infos ailleurs
J'ai fourni 2 vrais logos, une spécification complète du langage visuel du design et 3 captures d'écran d'application, mais je n'ai obtenu que 3 images atroces, et aucune ne correspondait aux logos originaux transmis
Après test sur chat.qwen.ai, la composition comme la précision anatomique n'atteignent même pas le niveau de Qwen Image 1. On obtient des résultats avec trois jambes ou des yeux brillants, d'une qualité proche de Microsoft Lens avant son retrait
J'aurais aimé avoir un tel modèle à l'université. En tant qu'apprenant visuel, j'aurais compris certains sujets bien plus facilement grâce à des schémas et illustrations explicatives qu'avec de longs textes
J'ai demandé à Nano Banana 2 une « affiche infographique pour étudiants de premier cycle expliquant le fonctionnement d'un atome », et il a généré un modèle de Bohr digne d'un manuel de sciences de collège
Il reste toujours ce filtre jaunâtre un peu partout dans les images