def compute_discounted_rewards(rewards, gamma): discounted_rewards = [] cumulative_reward = 0 for reward in reversed(rewards): cumulative_reward = reward + gamma * cumulative_reward discounted_rewards.insert(0, cumulative_reward) return discounted_rewards