arXiv (CV)AI
TITLE_JA: Hunyuan3D-Buffalo 1.0:スケーラブルな3D生成・理解・編集を実現する統合マルチモーダルモデル
Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
近年の画像生成技術の発展により、理解・生成・編集を統合したマルチモーダルモデルの可能性が示されてきました。しかし、3Dモデリング分野ではこうした統合的なアプローチがまだ十分に進んでいません。その最大の理由は、大規模で幾何学的に一貫性のある3D編集データが極めて不足していることにあります。テンセント(Tencent)のAI研究チームが発表したHunyuan3D-Buffalo 1.0は、こうした課題に対する包括的なソリューションとなるものです。
このフレームワークは、3D理解、テキストから3D生成、指示ベースの3D編集、テキストで指定された部分生成という4つの機能を単一のアーキテクチャで実現します。スケーラブルな学習を可能にするため、研究チームは87百万規模の3Dマルチモーダルコーパスを構築しました。これは2,500万の理解サンプル、5,000万のテキスト・3Dペア、そしてNano3D-v2を使用して生成された1,200万の編集ペアで構成されています。
アーキテクチャ面では、Hunyuan3D-VLMが意味論的・構造的・空間的理解を担当し、Hunyuan3D DiTが高忠実度の3D合成を実行する仕組みになっています。VLMは生成プロセスに対してマルチモーダルな意味条件を提供し、編集および部分生成では拡散モデル(diffusion process)にソースオブジェクト表現を条件として加えることで、全体的な構造と編集されていない領域を保持するという工夫が施されています。
広範な実験の結果、Hunyuan3D-Buffalo 1.0はテキスト・3D生成と3D編集のベンチマークで最先端あるいは最高水準のパフォーマンスを達成しており、同時に強力な理解機能と部分生成能力を示しています。さらに興味深いことに、生成機能と理解機能の両方が編集性能を向上させることが確認され、統合的な3Dマルチモーダル学習の有効性が実証されました。