FrozenLake Q-Learning이 자꾸 실패하는 이유: 탐험·학습률·DQN까지
FrozenLake에서 Q-Learning이 실패하는 가장 흔한 이유는 현재 가장 좋아 보이는 행동만 반복하거나, 불확실한 환경에서도 Q값을 한 번의 결과로 덮어쓰기 때문입니다. Q-Table은 무엇을 저장하고 어떻게 바뀌나 강화학습의 에이전트는 환경에서 상태를 보고 행동을 선택한 뒤 보상을 받습니다. Q-Table의 한 칸은 특정 상태에서 특정 ...
FrozenLake에서 Q-Learning이 실패하는 가장 흔한 이유는 현재 가장 좋아 보이는 행동만 반복하거나, 불확실한 환경에서도 Q값을 한 번의 결과로 덮어쓰기 때문입니다. Q-Table은 무엇을 저장하고 어떻게 바뀌나 강화학습의 에이전트는 환경에서 상태를 보고 행동을 선택한 뒤 보상을 받습니다. Q-Table의 한 칸은 특정 상태에서 특정 ...
코어 수를 늘려도 프로그램 전체가 같은 비율로 빨라지지는 않으며, 먼저 병렬화할 수 없는 구간과 가속기에 맡길 계산을 구분해야 합니다. 클록 경쟁이 멀티코어와 가속기로 바뀐 이유 CPU의 클록을 높이면 더 많은 전력을 쓰고 열도 늘어납니다. 이 전력·발열 장벽 때문에 한 코어만 더 빠르게 만드는 대신 여러 코어가 일을 나누는 방향이 중요해졌습니다....