カテゴリ

画像・動画生成の記事一覧

3件の記事があります。

画像・動画生成

Representation Autoencodersとは?VAEに頼らずDiffusion Transformerの潜在空間を高品質化する画像生成技術

Representation Autoencodersは、DINOv2などの事前学習済み表現エンコーダを画像生成用の潜在空間として使い、Diffusion Transformerの収束速度と生成品質を改善する技術です。仕組み、実験結果、AI開発への応用を解説します。

参照論文:Diffusion Transformers with Representation Autoencoders

画像・動画生成

DreamBoothとは?少数画像で被写体を学習し、本人・商品・キャラクターを生成できる技術

DreamBoothは、3〜5枚ほどの画像から特定の被写体を拡散モデルに学習させ、別の構図や背景でも同じ対象を生成できる画像生成技術です。識別子トークン、prior preservation loss、仕組み、実験結果、実務での使い道を日本語で解説します。

参照論文:DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation

画像・動画生成

ControlNetとは?画像生成を構図や線画で制御できる拡散モデル拡張の仕組みと使い道

ControlNetは、既存の拡散モデルを凍結しつつ、エッジ・深度・ポーズなどの空間条件を追加して画像生成を細かく制御する技術です。なぜプロンプトだけでは足りないのか、どう実装されているのか、開発でどこに応用できるのかを技術的に解説します。

参照論文:Adding Conditional Control to Text-to-Image Diffusion Models