RLHF(人間のフィードバックによる強化学習)とは

RLHF(Reinforcement Learning from Human Feedback)は、複数の応答を人が比較評価し、その評価を報酬としてモデルを調整する手法です。役に立ち、無害で、誠実な応答に寄せるために使われます。