LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback | Digital Library | PAMCET | PAMCET