Genetic Multiarmed Bandits A Reinforcement Learning Approach For Discrete Optimization Via Simulation (Grade A) - Claude Skill | Skills Directory