い
階段
いつも優しさ垂れ流し


プロンプト抽出ってどれくらい元画像に忠実なのかな?と思い立って実験 https://pixai.art/ja/artwork/2054750270785202437から抽出 候補4つのうち、 1つ目は最低限度の描写に留まる(プロンプトが短いしパッと見で要素の漏れがある) 2つ目は"アニメ●●のキャラクター■■"、"▲▲のタイトルロゴ"等、謎の条件を提示し始めるが、画像から必要なタグを拾い出している 3つ目/4つ目は2つ目のプロンプトに近いが場所、シチュエーションに謎のアレンジが入る 無難なのが2つ目のプロンプトだけど、 元画像が"画面奥まで伸びる昇り階段、座る少女と振り返る少女"なのに、 生成結果が"画像中央で終わる階段、2人共階段に座る"なのでプロンプト抽出はポン出しでは使えないっぽい… 後、気付いた点として ●タグ形式(SDXLモデル用プロンプト)とフレーズ形式(DiTモデル用プロンプト)がランダムに出現する ●タグ形式はタグの順番を整列しないと役に立たない場合が有る(例:茶色い長髪、黒い髪結いリボンの画像から"長髪、茶色い髪、ブラウス、黒いリボン"のタグの並びだと胸元のリボンを黒くする等) …意外と画像の読み取り精度に幅が有るんだな