training set
訓練セット
名詞
複数形: training sets
機械学習において、モデルにパターンを学習させるために提供されるデータの集合を指します。このデータセットは、入力データとそれに対する正解ラベルがペアになっており、モデルはこの正解に近づくように内部パラメータを調整します。一般的に、利用可能なデータ全体から大部分を training set として割り当て、残りを検証やテストに使用します。
テストセットとの決定的な違いtraining set はモデルが直接的に学習し、最適化を行うためのデータであるのに対し、 test set は学習済みのモデルが未知のデータに対してどれだけ正確に予測できるかを評価するためのデータです。もし training set と test set に同じデータが混入していると、モデルが単に正解を記憶しているだけの状態になり、正しく評価できなくなります。これを過学習(オーバーフィッティング)と呼びます。
実用的な運用のポイント
質の高い training set を構築するためには、以下の点に注意する必要があります。
データの多様性:特定の傾向に偏ったデータばかりを集めると、モデルに偏見(バイアス)が生じます。
データの量:一般的にデータ量が多いほど汎用的なモデルになりますが、計算コストとのトレードオフになります。
ラベルの正確性:正解ラベルに誤りがある場合、モデルは誤ったパターンを学習してしまいます。
意味
関連語
algorithmmachine learningmodeldatadatasetparameterweightbiasoverfittingunderfittinggeneralizationepochiterationbatchgradientoptimizationloss functionaccuracyprecisionrecallcross validationsupervisionlabelfeaturevectortensormatrixneural networkdeep learningregressionclassificationclusteringinferencepredictionsamplingstochasticbackpropagationactivation functionhyperparameterlearning rateconvergenceregularizationdropoutnormalizationstandardizationoutliernoiseaugmentationpattern recognitionartificial intelligenceheuristicprobabilitystatisticscorrelationvariancemeanmediandistributionentropymanifolddimensionembeddingcentroidkernelperceptronlayernodeedgegraphweightingtuningcalibrationevaluationmetricperformanceerrorresidualgradient descent