2 points par GN⁺ 3 시간 전 | 1 commentaires | Partager sur WhatsApp
  • Modèle de génération d’images de base de 3e génération de la série Qwen-Image, qui vise comme objectif central le « Real(实) », exploitable pour des tâches de productivité au-delà de la simple création de belles images
  • Traite jusqu’à 4,5k tokens en entrée pour générer d’un seul coup des mises en page très riches en informations, comme des journaux, storyboards ou sujets d’examen, ainsi que des images où plusieurs concepts sont parallèles ou imbriqués
  • Rend lisibles des caractères de 10 px, des formules LaTeX et des annotations manuscrites, tout en reproduisant des textures fines comme les pores, les cheveux, la peau ou les coups de pinceau
  • Prend en charge 12 langues, plusieurs polices, plus de 100 styles artistiques, des UI web, de jeux et de livestreaming, et peut aussi rechercher des informations récentes sur Internet pour les intégrer aux images
  • Un modèle qui cherche à étendre la génération d’images à un outil de productivité déployable pour le design, la création de contenu, l’éducation et l’e-commerce, notamment avec des PDF de journaux, des storyboards de mini-séries et des UI complexes

Un modèle de 3e génération orienté « Real »

  • Qwen-Image-3.0 est le modèle de génération d’images de base de 3e génération de la série Qwen-Image
  • Les axes clés de chaque génération sont les suivants
    • Qwen-Image-1.0 : Precision
    • Qwen-Image-2.0 : Precision, Variety, Completeness, Beauty, Authenticity
    • Qwen-Image-3.0 : Real(实)
  • « Real » repose sur trois capacités
    • Contenu riche : prise en charge d’entrées jusqu’à 4,5k tokens et de mises en page complexes
    • Détails réalistes : reproduction de caractères de 10 px et de micro-éléments comme les pores ou les cheveux
    • Connaissances approfondies : génération s’appuyant sur 12 langues, des UI variées et des connaissances du monde
  • L’objectif est de faire évoluer la génération d’images de « utilisable » à « pratique », et de « joli à regarder » à utile

Contenu riche et agencements complexes

  • Dans des diapositives de mathématiques, le modèle peut rendre simultanément les relations spatiales, les symboles mathématiques, l’explication des théorèmes et la position relative de chaque élément
  • Avec une consigne d’environ 3,7k tokens, il génère en une seule passe une grille 3×3, sans assembler plusieurs images
    • Chaque cellule est une infographie complexe combinant phrases en chinois et en anglais, formules, graphiques et personnages de bande dessinée
    • Il place dans une seule image une bande dessinée sur la sécurité des tunnels, un cours de géométrie dans l’espace, une analyse stylistique de « Chu Shi Biao », un mouvement parabolique, de la parasitologie, un schéma médical de douleur thoracique droite, le théorème de Sylow, le contrôle interne bancaire et une comparaison de structures d’ADN cellulaire
  • Il accepte des consignes allant jusqu’à 4,5k tokens et comprend puis rend des mises en page visuelles à forte densité d’information
  • Mise à l’échelle horizontale

    • Désigne la capacité à placer plusieurs éléments parallèles sur une même toile
    • Utilise la juxtaposition sémantique et le contrôle spatial pour organiser plusieurs concepts sans qu’ils se gênent mutuellement
  • Profondeur verticale

    • Capacité à décomposer le sens et à représenter étape par étape des interfaces logiquement imbriquées
    • Génère, à partir d’une seule consigne, une structure multi-écrans superposant un écran de programmation VSCode, Qwen Chat, WeChat et une affiche de café filtre manuel
    • Chaque couche conserve le style et les éléments détaillés de l’UI correspondante

Des petits caractères à la restauration picturale

  • Petits caractères et composition complexe

    • Rend lisibles même les petits caractères de 10 px
    • Peut générer des zones combinant beaucoup de texte et d’illustrations, comme une infographie de connaissances sur le requin-baleine
    • Reproduit, sur une page d’article d’algèbre géométrique, des formules LaTeX, exposants et indices, lettres grecques, numéros de théorèmes, accolades, barres de fraction et alignements sur plusieurs lignes
    • Maintient la lisibilité des formules et du corps de texte même avec une petite police
    • Génère des images au format journal combinant une texture de papier réaliste et un texte dense
  • Édition et écriture manuscrite

    • Peut ajouter des annotations manuscrites rouges sur une page de livre
    • Inclut soulignements, traits ondulés, cercles, flèches et courtes notes
    • Reproduit un style d’écriture manuscrite naturel, comme des notes de cours de lycéen
  • Rendu des textures et restauration

    • Décrit dans les portraits des micro-éléments comme les pores, les cheveux et la texture de la peau, et peut aussi représenter les textures délicates d’autres objets
    • Restaure des peintures traditionnelles endommagées ou partiellement disparues en respectant le style pictural et les coups de pinceau d’origine
    • Dans une peinture de combat d’aigles, supprime les taches de moisissure et les traces de dégradation, complète les parties manquantes, tout en conservant les nuances d’encre, la texture des plumes et l’équilibre de la composition

Exploitation des langues, des UI et des connaissances du monde

  • Prend en charge 12 langues, plusieurs polices, plus de 100 styles artistiques et diverses interfaces UI
  • Inclut des exemples de rendu précis en japonais, coréen et espagnol
  • Peut générer plusieurs types d’écrans UI réalistes : pages web, jeux, livestreaming, etc.
  • Infographies fondées sur les connaissances

    • Étend une vraie photo d’insecte en infographie de recherche tout en conservant le sujet principal
    • Inclut informations taxonomiques, annotations de caractéristiques morphologiques, vues détaillées agrandies et barre d’échelle
    • Structure le résultat sous forme de figure de recherche directement exploitable pour une publication académique
  • Informations récentes et exploitation d’IP

    • Au-delà des connaissances détenues par le modèle, il peut se connecter à Internet pour rechercher des informations récentes
    • Il recherche la météo de Hangzhou le 21 juillet et génère une image de prévisions météo
    • Il peut rechercher un personnage d’IP précis et créer une image à partir de celui-ci
    • Il génère une scène où Qi Baishi et Van Gogh présentent Qwen-Image-3.0 dans une salle de livestreaming

Extension aux tâches de productivité

  • Sur la base de ses trois capacités clés, il prend en charge des tâches à forte valeur comme des PDF de journaux, des storyboards de mini-séries et des interfaces UI complexes
  • Son objectif est de relier les capacités de génération d’images à une valeur de productivité dans davantage de domaines, comme le design, la création de contenu, l’éducation et l’e-commerce

1 commentaires

 
GN⁺ 3 시간 전
Avis Hacker News
  • C'est étrange de voir ce genre de modèle poussé dans le e-commerce. Comme il retouche la façon dont les vêtements tombent sur le corps et rend même l'éclairage plus flatteur, il reste difficile de savoir comment le vêtement tombe et taille réellement, tout comme avant son adoption

    • L'objectif à court terme est de vendre des produits, mais l'objectif plus ambitieux à long terme est de brouiller la frontière entre publicité et réalité afin de changer les normes culturelles pour que les gens ordinaires ne se posent même plus cette question au moment de l'achat
      Dans 50 ans, la « véracité de la publicité » pourrait elle-même être considérée comme un passé idéalisé impossible à retrouver
    • Ce que certains veulent n'est peut-être pas l'IA générative elle-même, mais plutôt de la transformation d'image à image du type « fais en sorte que ça ait l'air d'avoir été photographié par un bon photographe »
      Mais pour une plateforme où 1 000 nouveaux produits sont mis en ligne chaque mois, des photos réelles et imparfaites semblent au contraire meilleures pour la conversion. Surtout que ces images au style 3D où toutes les variantes de couleur se ressemblent provoquent plutôt un rejet
    • C'est similaire sur les annonces de meubles d'occasion de Facebook Marketplace. La plupart des images sont arrangées par IA comme dans un catalogue Pottery Barn, puis ce n'est qu'à la fin qu'on voit la photo du vrai meuble, couvert de rayures et de dégâts, posé dans un garage en désordre
    • Je me demande vraiment si ce sera moins trompeur que la méthode classique où un photographe professionnel fait poser un modèle portant la chemise sous un éclairage parfait
  • Il est intéressant de voir plus de 100 entrées liées au contenu adulte comme hentai, nudes, etc. dans les meta keywords du HTML

    • Ces mots-clés semblent aussi appliqués globalement à des pages comme https://qwen.ai/usagepolicy qui demandent de ne pas utiliser le produit pour du contenu sexuel
      En lançant document.querySelector('meta[name="keywords"]').content dans la console, on peut voir l'ensemble des tags
    • On dirait qu'un outil de SEO a ajouté automatiquement certains meta keywords. En collectant les recherches courantes contenant qwen, il a peut-être inclus jusqu'à des fautes de frappe comme gwen ou ben dans des contextes adultes
    • Je ne sais pas quelle valeur a encore aujourd'hui la balise meta keywords, et elle ajoute juste plus de 77 KB de données inutiles à la page
    • L'équipe Qwen sait sûrement aussi que les communautés de contenu adulte adoptent rapidement les nouveaux modèles de génération d'image, comme on le voit sur Civitai. Cela ressemble à une stratégie de SEO visant à exposer le modèle dans les résultats de recherche qu'elles consultent déjà
  • On dirait un entraînement sur des sorties de GPT Image 1, avec cette teinte jaune caractéristique bien visible
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...

    • GPT Image 1 aussi a développé cette teinte jaune sans avoir été entraîné sur les sorties d'autres modèles de génération d'image. Comme les gens préfèrent les photos douces à la lumière de coucher de soleil et que les modèles de préférence captent facilement cela, optimiser l'attrait esthétique donne une légère teinte à toutes les images, sauf si on la réprime délibérément
    • Les teintes jaunes et rouges sont un problème très courant, indépendamment de la source des photos d'entraînement. Même dans des startups photo entraînées sur des images originales, cette teinte apparaissait, et il restait difficile de l'empêcher
    • Les images générées par IA font déjà partie du web, donc avec du web scraping classique, il est impossible d'éviter les images générées dans les données d'entraînement
  • L'arabe du titre de l'image principale est manifestement cassé, mais ce n'est pas le cas lors de l'utilisation réelle du modèle. Il se peut que l'image principale n'ait pas été générée avec Qwen Image 3.0

    • C'est un bon test de référence pour évaluer un nouveau modèle. Quand j'ai testé GPT Image 2 et Nano Banana Pro avec du tamoul et des versets du Coran en arabe, ils les ont générés correctement, probablement grâce à l'ampleur de leurs données d'entraînement
  • Ils disent qu'il faut 3 700 tokens pour décrire correctement toute la grille 3×3, mais comme ils ne publient pas le prompt, la démonstration perd en crédibilité

  • Il n'y a absolument rien sur si et quand les poids seront publiés, donc je me demande s'il y a des infos ailleurs

    • Les poids de Qwen-Image-2.0 n'ont pas non plus été publiés, donc cela semble peu probable cette fois aussi
    • Depuis Z-Image et le premier Qwen-Image, ils semblent être passés à des modèles totalement fermés. À en juger seulement par les images publiées, Qwen-Image 3.0 ressemble simplement à une alternative inférieure à des modèles propriétaires comme gpt-image-2 ou nb-pro
    • Les publier reviendrait juste à laisser Cursor, Azure et Amazon les monétiser, donc ils n'ont aucune raison de le faire. À moins qu'OpenAI ne s'ouvre réellement, cela paraît peu probable
  • J'ai fourni 2 vrais logos, une spécification complète du langage visuel du design et 3 captures d'écran d'application, mais je n'ai obtenu que 3 images atroces, et aucune ne correspondait aux logos originaux transmis

  • Après test sur chat.qwen.ai, la composition comme la précision anatomique n'atteignent même pas le niveau de Qwen Image 1. On obtient des résultats avec trois jambes ou des yeux brillants, d'une qualité proche de Microsoft Lens avant son retrait

  • J'aurais aimé avoir un tel modèle à l'université. En tant qu'apprenant visuel, j'aurais compris certains sujets bien plus facilement grâce à des schémas et illustrations explicatives qu'avec de longs textes

    • Mais les schémas générés ne sont que des simulacres. Même si on demande une affiche expliquant correctement les composants d'un atome, au lieu d'une représentation liée au nuage de probabilité, on obtient une image avec des balles de ping-pong rouges, bleues et grises tournant sur des orbites circulaires, et avec un peu de chance un diagramme de couches électroniques
      J'ai demandé à Nano Banana 2 une « affiche infographique pour étudiants de premier cycle expliquant le fonctionnement d'un atome », et il a généré un modèle de Bohr digne d'un manuel de sciences de collège
    • Ma femme a mis toutes les recettes dans le générateur d'images de ChatGPT pour en faire des pages au style magazine, et le résultat est excellent. Elle est en train de créer un livre de recettes familial pour que les enfants puissent connaître les plats qu'ils mangeaient quand ils étaient petits
  • Il reste toujours ce filtre jaunâtre un peu partout dans les images