強化学習では長期的な報酬の最大化の困難さが問題になっているけれども、人間でも同じことが言えるはずである。つまり報酬はできるだけ短いタイムスパンで明確に与えた方がよい。先日久しぶりにタイピングゲームをやっていてそれを実感した。ためしに細かい…
引用をストックしました
引用するにはまずログインしてください
引用をストックできませんでした。再度お試しください
限定公開記事のため引用できません。