def reward_function(state, action): target_reward = compute_target_reward(state) obstacle_penalty = compute_obstacle_penalty(state) energy_penalty = compute_energy_penalty(action) return target_reward - obstacle_penalty - energy_penalty