MLAMLモデルの開発
大手動画配信サービスが映画推薦システムを構築しています。ユーザー数1000万人・映画数5万本の評価マトリクスがあり、スパース率は99%(大多数のユーザーと映画の組み合わせは評価なし)です。ユーザーIDと映画IDをそれぞれone-hot符号化して入力とし、未評価映画の評価スコア(1〜5点)を予測する回帰モデルを構築します。このユースケースに最も適したSageMaker組み込みアルゴリズムはどれですか?
ASageMaker Factorization Machines(FM):スパースなone-hot入力から2次の特徴量間相互作用を潜在因子ベクトルで効率的にモデル化して評価スコアを予測する
✓ 正解
Factorization Machinesはスパースなone-hot特徴量から潜在因子ベクトルを学習し、全特徴量ペアの2次相互作用を効率的に計算します。99%スパースの評価マトリクスでも協調フィルタリングを実現でき、推薦システムに最適です。
BSageMaker Linear Learnerアルゴリズム:スパースデータに対応した線形回帰モデルでユーザーと映画の組み合わせから評価スコアを予測する
Linear Learnerはスパースデータに対応した線形モデルですが、ユーザーと映画の間の2次相互作用(潜在的な親和性)を捉える機能がありません。協調フィルタリングに必要な表現力が不足し、評価予測の精度に劣ります。
CSageMaker DeepARアルゴリズム:ユーザーの視聴・評価履歴を時系列データとしてモデル化して次に見るべき映画の評価値を予測する
DeepARは時系列の将来値を確率的に予測するアルゴリズムです。視聴順序の時系列モデリングには活用できますが、任意の(ユーザー、映画)ペアに対して評価スコアを直接予測するアーキテクチャではありません。
DSageMaker K-Meansクラスタリング:評価パターンが類似するユーザーをグループ化し、同クラスタのユーザーが高評価した映画を推薦する
K-Meansは教師なしクラスタリングアルゴリズムであり、評価パターンの類似ユーザーのグループ化には使えます。しかし未評価映画の評価スコアを直接予測する回帰モデルを構築する機能を持たず、精度の定量評価も困難です。
解説
SageMaker Factorization Machines(FM)は協調フィルタリングのような高スパース・高次元データに特化した組み込みアルゴリズムです。ユーザーIDと映画IDをone-hot符号化した入力から、潜在因子ベクトル(Latent Factor)を学習して全特徴量ペアの2次相互作用を効率的に計算します。99%のスパースデータでも行列分解と同等のユーザー×映画の潜在的な関係を回帰または分類として予測でき、推薦システムのベースラインアルゴリズムとして広く採用されています。
選択肢BのLinear Learnerはスパースデータに対応していますが、特徴量間の2次相互作用(ユーザーと映画の潜在的な親和性)を捉えられないため、協調フィルタリングに必要な表現力が不足します。
選択肢CのDeepARは時系列を予測する深層学習アルゴリズムです。視聴履歴の順序パターン予測には活用できますが、任意の(ユーザー、映画)ペアの評価スコアを直接予測する設計ではありません。
選択肢DのK-Meansは教師なしクラスタリングアルゴリズムです。ユーザーをグループ化することは可能ですが、未評価映画の評価スコアを定量的に予測する回帰モデルを直接構築することはできません。
ドメイン別正答率・予想スコアでリアルタイムに実力把握
無限ノックでMLAを徹底対策。全問AI生成のオリジナル問題。
無料で演習を始める →