強化学習とは?
強化学習とは、エージェントが環境の中で行動し、その結果として得られる報酬が最大になるように試行錯誤しながら方策を学ぶ方式。個々の行動に正解は与えられず、良し悪しは報酬という形で遅れて返ります。FEでは3方式の区別として出題されます。
基本情報技術者試験の過去問では1回出題されています。
きょうかがくしゅう
強化学習の意味
エージェントが環境の中で行動し、その結果として得られる報酬が最大になるように試行錯誤しながら方策を学ぶ方式。個々の行動に正解は与えられず、良し悪しは報酬という形で遅れて返ります。FEでは3方式の区別として出題されます。
強化学習の具体例
囲碁や将棋のAIは、勝てば正の報酬、負ければ負の報酬を受け取り、対局を何百万回も繰り返して強くなります。ロボットの歩行制御や、在庫の発注量の最適化のように「行動の連鎖の結果」が評価される問題に向きます。
強化学習は試験でどう引っ掛けられる?
報酬は「正解ラベル」ではありません。1手ごとの正解は誰も教えず、最終的な結果からさかのぼって評価する点が教師あり学習との決定的な違いです。大量の試行が必要でシミュレータ環境が要る点も特徴です。
強化学習と関連する用語
強化学習が出た過去問
大規模言語モデルを用いた自然言語処理において,事前学習済みのモデルに対して行う,ファインチューニングに関する記述として,最も適切なものはどれか。
正解:特定のデータを用いて追加で学習を行い,目的とするタスクに適用できるようにする。
要点:ファインチューニングは少量データでタスクに適応させる
ファインチューニングは、大量の汎用データで作られた事前学習済みモデルに対し、目的とする用途に合わせた比較的少量のデータで追加学習を行う手法である。ゼロから学習し直すより少ない計算資源で、特定タスクの精度を高められる点が利点になる。事前学習そのものや強化学習とは段階も目的も異なる。
出典:令和7年度 (公開問題) 基本情報技術者試験 kamokuA 問1(IPA)
最終更新:2026-08-25/解説は資格暗記が独自に作成しています。 過去問の出典は各問題に記載のとおりです。