タグ
#Vision Transformerの記事一覧
2件の記事があります。
学習・ファインチューニング
Masked Autoencoders(MAE)とは?画像の75%を隠して表現学習する自己教師あり技術
Masked Autoencoders(MAE)は、画像の大部分を隠して欠けた部分を復元することで、ラベルなしデータから強い視覚表現を学ぶ自己教師あり学習技術です。非対称エンコーダ・デコーダ構造、高マスク率の意味、実験結果、実務での使い道を日本語で解説します。
参照論文:Masked Autoencoders Are Scalable Vision Learners
推論最適化
Token Mergingとは?Vision Transformerを高速化するトークン統合の仕組みと使い道
Token Merging(ToMe)は、Vision Transformerの似たトークンを段階的に統合し、再学習なしでも推論を大きく高速化できる手法です。なぜトークン削減が効くのか、どのように精度低下を抑えるのか、画像・動画・音声や生成AIへどう応用できるのかを解説します。
参照論文:Token Merging: Your ViT But Faster