Bespoke Labs ищет исследователя, который поможет спроектировать и оценить среды RL и тесты для долгосрочных агентских задач — таких, которые требуют от агента часов, дней или недель последовательного многоэтапного рассуждения, а не одноразовых...
Bespoke Labs ищет исследователя, который поможет спроектировать и оценить среды RL и тесты для долгосрочных агентских задач — таких, которые требуют от агента часов, дней или недель последовательного многоэтапного рассуждения, а не одноразовых подсказок.
Что ты будешь делать
Проектируйте и создавайте долгосрочные среды RL и средства проверки, основанные на реальных задачах (код, использование инструментов или корпоративные рабочие процессы).
Разработайте критерии оценки, которые измеряют слаженность, планирование и надежность агентов на расширенных траекториях.
Анализируйте режимы сбоев при долгосрочном развертывании (дрейф, взлом вознаграждения, потеря состояния задачи) и предлагайте исправления.
Сотрудничайте с более широкой командой над открытыми наборами данных и воспроизводимыми рецептами оценки.
Обязательно (жесткое требование)
Продемонстрированный долгосрочный опыт работы агентом/РЛ — это не подлежит обсуждению. Вы должны быть в состоянии указать на конкретную работу, включающую многоэтапные, многодневные или последовательные системы агентов (например, вклад в такие среды, как SWE-bench, Vending-Bench, FrontierSWE, DeepSWE, OpenReward, Gymnasium или эквивалентные оригинальные исследовательские/производственные работы). Заявки без конкретных долгосрочных доказательств рассматриваться не будут.
Сильный Питон; комфорт с RL tr