cross entropy
cross entropyは、主に機械学習の分野で、モデルが予測した確率分布と実際の正解ラベル(真の分布)との間の距離や差異を測定するために用いられます。予測が正解から離れているほどこの値は大きくなり、正解に近づくほど値は小さくなります。そのため、ニューラルネットワークの学習において、この値を最小化することを目的とした損失関数として広く採用されています。
KLダイバージェンスとの関係cross entropyは、情報理論におけるKL divergence(カルバック・ライブラー情報量)と密接に関連しています。具体的には、cross entropyは真の分布のエントロピーと真の分布から予測分布へのKL divergenceの和として定義されます。実務上の最適化においては、真の分布のエントロピーは定数であるため、cross entropyを最小化することは、結果的にKL divergenceを最小化することと同義になります。
平均二乗誤差との使い分け
回帰問題でよく使われるmean squared error(平均二乗誤差)とは異なり、cross entropyは分類問題、特にソフトマックス関数を用いた多クラス分類に最適です。これは、予測値が正解から大きく外れている場合に、より強いペナルティ(大きな勾配)を課すことができるため、学習の収束速度が向上するという特性があるためです。
意味
2つの確率分布の間の差異を定量化するために使用される情報理論の尺度であり、通常、機械学習において分類モデルの性能を測定するための損失関数として利用されること
The model's loss was calculated using cross entropy to determine how closely the predicted probability distribution matched the actual labels.
予測された確率分布が実際のラベルとどの程度一致しているかを判断するため、モデルの損失は交差エントロピーを用いて計算された。