arXiv (CV)AI
ファッション専門の基盤モデル「Oxygen-TryOn」:あらゆる衣料品の仮想試着を実現
Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
ファッション業界向けの新しいAIモデル「Oxygen-TryOn」が開発されました。このモデルは、汎用の画像編集ツールではなく、仮想試着に特化して設計されたファッション専門の基盤モデルです。ユーザーが提供する1枚以上の参照画像(清潔な商品写真または実際に着用した写真)と対象人物の画像を入力することで、その人物があらゆるファッションカテゴリーの衣料品を着用した写真現実的な画像を生成します。
従来のシステムではスタジオ撮影環境での単一のガーメント(衣料品)カテゴリーのみの処理に限定されていました。一方、Oxygen-TryOnは多様なアイテムと場面に対応し、全身及び半身の表示、複数の参照画像、自由な複数アイテムの組み合わせをサポートします。同時に人物の顔や特徴、衣料品の外観を忠実に保持することが可能です。
開発チームはマスクベースのインペインティングではなく、マルチリファレンス理解駆動型の生成タスクとして仮想試着を再構成しました。高品質な試着データを大規模に収集、製造、注釈付け、フィルタリングするための専門的なデータエンジンを構築し、継続事前学習(CPT)、教師あり微調整(SFT)、強化学習(RL)の3段階のトレーニング手法を採用しました。RL段階では、専門の試着報酬モデルと汎用モデルを組み合わせたハイブリッド報酬を使用し、細粒度の一貫性と指示レベルの品質を監督します。
公開ベンチマークと独自のOxygen-TryOn Benchでの評価結果により、単一アイテムの試着では最先端の一貫性とリアリズムを達成し、複数アイテム試着ではNano Banana ProやGPT-Image-2、Seedream5 Lite、FLUX.2などの主要な商用システムやオープンソースモデルと同等かそれ以上の性能を発揮しています。