group relative policy optimization

A method in reinforcement learning that focuses on optimizing policies with respect to group-level performance metrics rather than individual metrics. This is particularly useful in scenarios involving multiple agents or collaborative tasks.

39 papers