タグ

#Vision Transformerの記事一覧

2件の記事があります。

学習・ファインチューニング

Masked Autoencoders(MAE)とは?画像の75%を隠して表現学習する自己教師あり技術

Masked Autoencoders(MAE)は、画像の大部分を隠して欠けた部分を復元することで、ラベルなしデータから強い視覚表現を学ぶ自己教師あり学習技術です。非対称エンコーダ・デコーダ構造、高マスク率の意味、実験結果、実務での使い道を日本語で解説します。

参照論文:Masked Autoencoders Are Scalable Vision Learners

推論最適化

Token Mergingとは?Vision Transformerを高速化するトークン統合の仕組みと使い道

Token Merging(ToMe)は、Vision Transformerの似たトークンを段階的に統合し、再学習なしでも推論を大きく高速化できる手法です。なぜトークン削減が効くのか、どのように精度低下を抑えるのか、画像・動画・音声や生成AIへどう応用できるのかを解説します。

参照論文:Token Merging: Your ViT But Faster