Проект HydraFusion: передовое качество благодаря многомодельной оркестровке


Нашей целью всегда было предоставление разработчикам лучшей модели для решения поставленной задачи. Ранее в этом году мы упростили эту задачу, запустив автоматический выбор модели, который анализирует вашу задачу и подбирает модель, наиболее подходящую для этой задачи.

Сегодня мы представляем Project HydraFusion, предварительную исследовательскую версию, которая обеспечивает передовой интеллект посредством оркестровки во время выполнения. Он создает полный план выполнения, выбирая модели от нескольких поставщиков для составления, критики и пересмотра или каскадирования к более мощным моделям для выполнения вашей задачи.

HydraFusion играет ключевую роль в нашей общей стратегии по обеспечению автоматизированной семантической маршрутизации между локальными, облачными и составными моделями. Для разработчиков эта сложность остается за кадром: вы выбираете HydraFusion, как и любую другую модель, и она выбирает рабочий процесс, который балансирует производительность, стоимость и задержку для каждой задачи.

HydraFusion рассматривает выбор рабочего процесса как проблему оптимизации. Он использует сигналы возможностей для рассуждений, генерации кода, отладки и использования инструментов, чтобы выбрать наиболее эффективный шаблон выполнения, соответствующий планке качества.

Для каждого запроса HydraFusion в настоящее время выбирает один из трех шаблонов выполнения:

  • Одинокий. Одна выбранная модель решает поставленную задачу напрямую.
  • Каскад. Эффективная модель предлагает решение, а контроль качества решает, принять его или перейти к более сильной модели.
  • Критика. Одна модель формирует результат, независимый критик, доступный только для чтения, из другого семейства моделей просматривает его (следуя той же схеме проверки, что и Rubber Duck), а черновой вариант модели вносится один раз.
Проект HydraFusion: передовое качество благодаря многомодельной оркестровке
Рисунок 1. Архитектура HydraFusion

Каждый шаблон учитывает различный компромисс между качеством и стоимостью. Одинокий сохраняет скорость и эффективность, когда одна модель может решить задачу напрямую. Каскад дает эффективную модель с первой попытки, сохраняя при этом путь к более строгому выводу, когда кандидат не проходит приемочные ворота. Критика добавляет независимую перспективу для задач, проверка которых более полезна, чем еще одна попытка без посторонней помощи.

В ходе оффлайн-оценок по трем тестам агентного кодирования HydraFusion неизменно демонстрировала высочайшее качество при существенной экономии затрат. В TerminalBench 2.1 качество проверенных задач улучшилось на 4,9 процентных пункта при снижении ориентировочной стоимости на 67 % по сравнению с Claude Opus 5.

Давайте углубимся в подход, результаты и критерии.

Адаптивная многомодельная оркестровка

Разработчики уже координируют модели вручную: выбирают одну для задачи, просят другую проверить работу или переносят сложную проблему на более эффективную модель. HydraFusion переносит этот знакомый процесс в среду выполнения. Вы выбираете HydraFusion один раз и остаетесь сосредоточенным на своей задаче, пока она управляет моделями и рабочим процессом «за кулисами».

Главное – избирательность. Некоторые задачи кодирования можно решить напрямую, тогда как другие получают пользу от проверки, доработки или эскалации. HydraFusion оценивает каждый запрос и выбирает наименее сложный рабочий процесс, который, как ожидается, будет соответствовать его потребностям, используя дополнительные вызовы модели только тогда, когда они могут улучшить результат. Этот адаптивный подход балансирует качество, стоимость и задержку между моделями.

По мере продвижения границ моделей растет и HydraFusion. Когда новые модели станут доступны в GitHub Copilot, мы сможем оценить и включить их в пул моделей, используя их сильные стороны для задач, которые лучше всего подходят для них.

Строительство HydraFusion

Превращение адаптивной многомодельной оркестрации в единый надежный процесс кодирования требует тщательного контроля выполнения, проверки, стоимости и состояния репозитория. HydraFusion построен на пяти принципах работы:

  • Полный учет. Совокупные затраты и использование на каждом этапе рабочего процесса, включая составление черновиков, критику, пересмотр, эскалацию, повторную попытку и откат.
  • Ограниченное исполнение. Назначьте каждому этапу явный тайм-аут и поведение отмены, чтобы поддерживать выполнение и стоимость в определенных пределах.
  • Отдельный обзор. Выполняйте этапы проверки в изолированном контексте без использования инструментов, в то время как этапы решателя используют общую рабочую область и обычный цикл агента с учетом разрешений. Это позволяет моделям оценивать работу независимо, не изменяя репозиторий.
  • Безопасное приложение. Не применять патчи, если рабочий процесс отменен или не проходит проверку, предотвращая попадание неполных изменений в репозиторий.
  • Утвержденная маршрутизация. Перед началом выполнения проверьте определения рабочих процессов, привязки моделей, резервное поведение и доступность модели.

В совокупности эти принципы делают многомодельную оркестровку практичной для работы на уровне репозитория. Внутренне среда выполнения записывает роль, результат, стоимость, задержку и диагностику каждого этапа, чтобы можно было понять рабочий процесс после выполнения. Извне разработчик получает один последовательный ответ и один набор изменений с учетом разрешений.

Результаты сравнительного анализа

Фиксированные политики HydraFusion оценивались в трех тестах агентного кодирования — TerminalBench 2.1, DeepSWE и CheckpointBench, нашем внутреннем тесте, основанном на реальных сеансах GitHub Copilot, — с использованием Claude Opus 5 и GPT-5.6 Sol в качестве базовых показателей для сравнения. В каждой политике использовались одни и те же входные данные для задач, инструменты, ограничения выполнения, предположения о ценах, условия оценки и обработка отсутствующих результатов. В ходе оценки измерялось проверенное качество задачи, которое представляет собой долю задач, на которые было подтверждено правильное решение, и полную расчетную стоимость рабочего процесса. Учет затрат включал все задействованные этапы, такие как составление проекта, критика, пересмотр, эскалация, повторная попытка и откат. Результаты ниже показывают наилучшую настроенную конфигурацию HydraFusion.

Тесты Стоимость по сравнению с Опусом 5 Качество против Опуса 5
ТерминалБенч 2.1 на 67% ниже +4,9 балла
DeepSWE на 36% ниже -1,5 балла
Контрольно-пропускной пунктСкамейка на 65 % ниже -0,1 балла
Таблица 1. Качество и стоимость HydraFusion в трех тестах агентов по сравнению с Opus 5.

Эти контролируемые офлайн-результаты относятся к оцениваемым версиям эталонных тестов, конфигурациям рабочих процессов, пулу моделей и ценовым предположениям, при этом все модели оцениваются на одном и том же среднем уровне обоснования. Благодаря этому предварительному исследованию мы проверим, как эти результаты соотносятся с реальными рабочими нагрузками разработчиков, и используем результаты для дальнейшей оптимизации HydraFusion с точки зрения качества продукции, задержки, надежности, эффективности кэширования, стоимости и безопасности.

ТерминалБенч 2.1

TerminalBench 2.1 оценивает агентов кодирования при выполнении сложных многоэтапных задач в терминальных средах.

На рис. 2 сравниваются HydraFusion и Opus 5 по подтвержденному качеству задач и предполагаемой стоимости рабочего процесса.

DeepSWE

DeepSWE оценивает сложные задачи разработки программного обеспечения на уровне репозитория, которые требуют навигации по большим базам кода, понимания межфайловых зависимостей и создания сквозных исправлений. По этому показателю HydraFusion отстает от Opus 5 на 1,5 процентных пункта, при этом снижая затраты на 36 %, демонстрируя убедительное соотношение качества и стоимости для сложных реальных инженерных задач.

Контрольно-пропускной пунктСкамейка

CheckpointBench — это внутренний многоэтапный тест, созданный на основе реальных сессий агентского кодирования GitHub Copilot. Каждый разговор привязан к конкретному общедоступному репозиторию и неизменяемому коммиту, что обеспечивает возможность воспроизведения каждого сеанса. Тест сбалансирован по языку, типу задачи, сложности, очищен по качеству, в результате чего получается реалистичный набор оценок, который точно отражает сеансы производственного агента. По этому показателю HydraFusion отстает от Opus 5 на 0,1 процентного пункта при цене на 65 % ниже.

Раннее внутреннее тестирование подтвердило этот результат.

На данный момент способность рассуждать и решать задачи [of HydraFusion] находится на уровне или лучше, чем Opus.

Главный инженер-программист в Microsoft

Горнолыжный подъемник HydraFusion

Политики маршрутизации HydraFusion были сформированы на основе того, как разработчики используют GitHub Copilot для решения реальных задач кодирования. Чтобы сделать эти рабочие процессы воспроизводимыми, мы создали CheckpointBench на основе реальных траекторий сеансов кодирования Copilot. Мы неоднократно совершенствовали HydraFusion в CheckpointBench, DeepSWE и TerminalBench 2.1, оптимизируя все наборы оценок, а не какой-то один тест.

Оценки HydraFusion по возможностям обеспечили последовательную основу для сравнения возможных политик маршрутизации. Вместо ручной настройки порогов мы использовали поиск луча для построения оптимальной политики принятия решений. Каждый кандидат сравнивался с замороженным базовым уровнем качества, стоимости и видов отказов, поэтому улучшения оценивались на стабильной основе.

TerminalBench 2.1 предоставляет наиболее полную последовательность запусков, что дает наиболее четкое представление об этом итеративном улучшении. Развитие не было линейным. В период с 11 по 25 августа два сбоя в работе оценочной системы привели к недействительным запускам. Эти сбои были исключены из тренда производительности, исправлены, после чего последовало дальнейшее улучшение конфигураций HydraFusion. К 25 августа HydraFusion достигла максимальной рабочей точки за всю зарегистрированную серию.

Этот отчет о развитии показывает, как политика улучшилась в результате повторных экспериментов. TerminalBench 2.1 был одним из нескольких тестов, использованных во время разработки. Относительная насыщенность делает важной более широкую проверку, поэтому оценка по трем критериям также включает в себя более требовательные задачи DeepSWE на уровне репозитория. Предварительный просмотр исследования расширяет этот цикл обучения на реальные рабочие нагрузки разработчиков.

Попробуйте предварительный просмотр исследования

Для этого предварительного просмотра лучше всего начать с задач по кодированию в первую очередь, требующих одного запроса. В дальнейшем мы сосредоточимся на высокой производительности в многоходовом режиме, а затем на более длительных итеративных сессиях.

Эта предварительная версия предназначена для того, чтобы узнать, какие задачи выигрывают от составных рабочих процессов и как оркестрация влияет на задержку и стоимость на практике. Чтобы получить наилучшие результаты уже сегодня, начните с масштабных, масштабных задач по кодированию, которые вы можете передать Copilot в режиме автопилота в одном запросе. Поделитесь тем, что вы нашли, в том числе, в чем он превосходен, в чем он не дотягивает и что вы хотели бы увидеть дальше, через /feedback в Copilot CLI или в обсуждении сообщества GitHub.

HydraFusion продолжает активную исследовательскую деятельность. Результаты, модели, рабочие процессы, доступность, названия и поведение продукта могут измениться по мере изучения предварительной версии. Мы считаем, что следующим реальным достижением в области агентов кодирования станет объединение передового интеллекта с оркестровкой во время выполнения. HydraFusion — наша первая ставка на эту идею: переход от выбора лучшей модели к динамическому построению наилучшего способа решения каждой задачи.

Благодарности

Огромное спасибо исследователям, инженерам, менеджерам по продуктам и дизайнерам GitHub и Microsoft, которые курировали данные обучения и создали конвейер обучения, пакеты оценки, клиентский опыт и стек обслуживания. Мы особенно благодарны команде GitHub Copilot CLI, Copilot API и VS Code за то, что они преодолели многочисленные трудности и представили эту предварительную версию исследования нашим клиентам.

Познакомьтесь с командой

Аашна Гарг, главный научный сотрудник Code AI

Шэнъюй Фу, менеджер по партнерским прикладным наукам, Code AI

Карлос Кастро, партнер-архитектор, GitHub Copilot

Сиддхарт Сингха Рой, научный сотрудник II, Code AI

Энди Салерно, главный инженер-программист, GitHub Copilot

Написал

Сотрудники GitHub

GitHub — это лучший в мире опыт разработчиков и единственная платформа на базе искусственного интеллекта, безопасность которой встроена в каждый шаг, поэтому вы можете с уверенностью внедрять инновации.

Leave a Reply

Your email address will not be published. Required fields are marked *