DCGAN(Deep Convolutional GAN)は、2015年にA.Radfordらによって発表された敵対的生成ネットワークの一種であり、生成ネットワーク(generator)と識別ネットワーク(discriminator)の2つのネットワークに畳み込みニューラルネットワーク(CNN)を用いたモデルのことである。
DCGANにおける生成モデルは100次元の一様分布Zを入力とし、転置畳み込みによって徐々に画像空間へ投影していく仕組みである。また識別モデルは同じくプーリング層を使わずに畳み込みによってダウンサンプリングしていき、活性化関数にはReLUの代わりに漏洩ReLU(Leaky ReLU)を使用する。
プーリング層や全結合層を使わずにCNNによって学習を進めることで、通常のGANよりも鮮明な画像の生成が可能になった。
さらにDCGANによる生成は、その入力のベクトル空間的な性質が極めて良いことが明らかになり、値の近い入力同士なら似たような画像を生成し、二つの入力の間の値によって生成される画像は二つの画像の意味的な中間となる。これにより、入力を適切に調整することでより高次な特徴レベルの画像をコントロールすることができる。[1]
LSGAN(Least Square GAN)では、識別ネットワークの最終層の活性化関数である標準シグモイド関数を無効化し、損失関数を平均二乗誤差に置き換えたものである。通常のDCGANに比べ、安定性が大幅に上昇したことが報告されている。[2]
WGAN(Wasserstein GAN)は名称の通り識別ネットワークをワッサースタイン距離関数に近づけるため、重みのクリッピング及び損失関数の再設計を行い、識別ネットワークのリプリッツ連続性を担保する手法である。通常のDCGAN及び先述したLSGANに比べ、クオリティの高い画像が生成されたことが報告されている。[3]損失関数の設計を改良したWGAN-gpが存在する。[4]
PGGAN(Progressive Growing GAN)はWGANの着想をさらに発展させ、ミニバッチ内の標準偏差を算出する機構を識別ネットワークに導入し、さらに識別ネットワーク・生成ネットワークの両方を複数の段階に分割して学習をするようにしたものである。[5]
未登録
IPFS未登録
📡 0ピア
N=1
CRITICAL
PQS D34