1 points par sjh9714 2 시간 전 | Aucun commentaire pour le moment. | Partager sur WhatsApp

La plupart des catalogues de modèles d’image ne rassemblent que les résultats réussis. Ce dont on a vraiment besoin — « ça, ça ne marche pas » — n’y figure pas. J’ai donc lancé 561 générations, conservé 475 images, et publié aussi les 65 rejetées avec la raison de leur échec. Les images gardées comme celles écartées ont toutes leur seed, pour pouvoir les reproduire telles quelles.

Le coréen fonctionne. En revanche, les mots qu’il rate sont ratés de la même façon à chaque fois

Au début, après une seule image, j’avais écrit que « même si on lui donne du coréen, il l’écrit mal », mais après six essais, c’était une affirmation excessive. Quatre sont sorties correctement. Nouilles, bibliothèque, « sortie 3 » (chiffre + coréen), « menu recommandé du jour » (trois mots, six syllabes).

La longueur n’est pas une variable. Deux syllabes comme six syllabes passent, mais un mot de quatre syllabes a échoué.

Les deux erreurs sont intéressantes. « Nouilles honnêtes » est sorti sous la forme « nouilles calmes » ; même en changeant la seed, le résultat était identique (1167746582, 1910572019). La même faute deux fois. Ce n’est pas une question de chance liée à la seed, c’est un problème avec ce mot. « Restaurant Hanbat », lui, est devenu « restaurant Hanbbyot », une syllabe qui n’existe pas.

Dans les deux cas, ça s’est effondré au niveau de la consonne finale, mais comme d’autres syllabes avec consonne finale sont sorties correctement, je ne vais pas conclure sur la cause à partir de deux cas.

Donc, si ça se trompe, ne relancez pas une seed : changez le libellé. Même en relançant, ça se trompe au même endroit.

Les caractères que vous fournissez, il les dessine. Ceux qu’il doit inventer, il ne sait pas les dessiner

Pendant trois lots, j’ai cru à tort que le nombre de chaînes de caractères était la limite. Pour trouver cette limite, j’ai augmenté uniquement le nombre de chaînes sur la même plaque signalétique, de 1 à 8, et les huit étaient toutes exactes.

Le nombre n’était pas la variable. En revoyant les échecs précédents, le point de rupture est devenu clair.

  • Menu de café : les trois éléments indiqués dans le prompt sont exacts, le reste devient CAPEME, CABIELO
  • Timeline : en ne donnant qu’une plage d’années, les années apparaissent, mais les libellés échouent
  • Maquette Kanban : sans donner les noms des colonnes, les trois colonnes deviennent toutes « Kanban »

Écrivez dans le prompt, tel quel, tout le texte qui doit apparaître à l’écran. Huit n’est pas une limite, c’est simplement là où j’ai arrêté de tester.

Cela dit, fournir le texte ne suffit pas toujours. J’ai relancé les trois cas qui avaient échoué en indiquant seulement les chaînes : pour le menu, les dix lignes étaient correctes ; pour les dos de livres, 10 sur 12 l’étaient ; mais pour le plan de lignes, seulement 4 sur 9. Si le texte est petit et tourné selon plusieurs angles, une deuxième contrainte entre en jeu.

J’ai écrit que « les mains marchent globalement », puis je me suis rétracté trois heures plus tard

En fixant l’éclairage et la composition, puis en augmentant seulement la difficulté des mains sur 8 niveaux, j’ai zoomé à 1,5–2× et écrit que « 7 sur 8 sont anatomiquement correctes ». Comme c’était contraire à l’idée reçue, c’était la phrase qui allait le mieux circuler.

Deux heures après l’avoir posté sur r/StableDiffusion, un commentaire est arrivé : « Celle avec trois doigts en a six. » En zoomant à 4×, c’était vrai. Vingt minutes plus tard, quelqu’un d’autre a signalé les mains superposées : « Celle-là aussi est fausse, il n’y en a que quatre. »

Sur 8 images, deux personnes ont trouvé 3 erreurs en faisant une chose que je n’avais pas faite. Elles ont compté.

J’ai donc retiré toute la catégorie. Je n’ai pas renoté les images une par une. L’outil qui avait échoué, c’était mon œil ; juger les cinq restantes avec le même œil aurait été répéter la même erreur une troisième fois. J’ai déplacé les 8 images, avec leurs seeds, dans les éléments en échec.

Autres résultats de mesure

  • Il compte les objets, mais pas les attributs. Des œufs « exactement au nombre de N » étaient corrects de 2 à 8, mais « exactement deux couleurs » en a donné quatre. Si l’on peut pointer chaque élément, on peut demander un nombre ; si vous comptez des couleurs, des zones ou des sources lumineuses, recomptez vous-même le résultat.
  • Si vous nommez l’éclairage, le matériel d’éclairage entre dans l’image. Dans les deux prompts contenant « softbox », la softbox est devenue un sujet de l’image. Décrivez ce que fait la lumière.
  • Écrire « seamless » ne rend pas l’image carrelable. Sur 8 motifs, un seul se raccordait, et encore : il s’agissait de rayures verticales dont les bords tombaient automatiquement juste.
  • « straight down » est une demande, pas une instruction. Sur 8 vues aériennes, 5 sont arrivées en oblique. S’il y a quelque chose de vertical comme une grue ou une maison, la caméra descend pour le montrer.
  • Les comparaisons de taille remplacent le sujet. J’ai demandé un « scarabée de la taille d’un poney » et j’ai obtenu un poney avec un harnais. Pas de scarabée.
  • Mettre le même personnage dans une autre photo ne fonctionne pas. À strength 0.45, le visage reste, mais toute la composition suit ; à 0.72, c’est une autre personne. Il n’y a pas de valeur intermédiaire qui marche.
  • L’image-to-image ne sait pas ajouter ni retirer des objets. En revanche, la conversion de médium (photo → gouache, etc.) est stable, dans la plage strength 0.50–0.60.

Le coût total a été de 4,54 $ (fal.ai, 0,008 $ par mégapixel).

README en coréen : https://github.com/sjh9714/awesome-krea-2/blob/main/README_KO.md
Parcourir toutes les images : https://sjh9714.github.io/awesome-krea-2/
Recettes d’édition extraites sous forme de skill d’agent : https://github.com/sjh9714/same-frame

Aucun commentaire pour le moment.

Aucun commentaire pour le moment.