Для работыИсточник изучен
Обучение грпо рлвр
Тренируйте рассуждение и поведение в рамках подтверждённых задач с помощью GRPO и обучения с подкреплением на основе подтверждённых вознаграждений (RLVR).
Что передать AI
Описание задачи, исходные материалы, ограничения и желаемый результат.
Что получите
Готовый результат по задаче, пояснения к ключевым решениям и список следующих действий.
Кому пригодится
Специалистам и командам, которые решают эту задачу с помощью AI.
Требования и ограничения
Для запуска могут понадобиться доступ к проекту и инструменты, указанные в первоисточнике.
Автор и источник
Оригинальное название: grpo-rlvr-training
Автор или репозиторий: wshobson/agents
Лицензия: MIT
Открыть первоисточник ↗