Cognition выпустила Fusion для Devin Desktop и CLI: две ИИ-модели делят одну задачу - QubStore

Cognition выпустила Fusion для Devin Desktop и CLI: две ИИ-модели делят одну задачу

Cognition открыла Fusion для Devin Desktop и CLI: теперь две модели могут работать над одной задачей сообща — одна планирует, вторая исполняет.

Cognition выпустила Fusion для Devin Desktop и CLI: две ИИ-модели делят одну задачу
Cognition выпустила Fusion для Devin Desktop и CLI: две ИИ-модели делят одну задачу
11 сентября Cognition объявила, что Fusion стала доступна в Devin Desktop и CLI. До этого схема работала только в облачной версии Devin. Теперь комбинацию ведущей модели и исполнителя можно задействовать и в настольном приложении, и в терминале. Компания советует связку Claude Fable 5.1 и SWE-2.

Сам Devin — инструмент, которому поручают задачи по изучению проекта, правке кода и проверкам. Fusion выстраивает совместную работу двух моделей: первая, например, готовит план и принимает результат, вторая занимается реализацией. По сути — команда разработки, только без дейликов. Ведущий агент общается с пользователем, разбирается с неоднозначными требованиями и решает, что делегировать. Исполнитель изучает файлы, пишет код и тесты, правит ошибки и отдаёт результат на проверку. У обоих собственные инструменты и отдельный контекст, который сохраняется на протяжении сессии.

По объяснению Cognition, маршрутизации по первому запросу часто не хватает: настоящая сложность задачи вскрывается уже при изучении репозитория. Да и переключение моделей порой требует повторной обработки контекста. В Fusion каждый агент держит собственный кэшируемый контекст, а ведущий определяет, что сделать самому, а что передать помощнику.

На графике Artificial Analysis Coding Agent Index v1.5 связка Fable 5.1 + SWE-2 набирает 61,7 балла против 62,2 у Claude Code с Fable 5.1, но обходится на 36% дешевле. Для Astra + SWE-2 указаны 58,9 балла против 61,6 у Codex с Astra при снижении стоимости на 39%. В таблице отдельных бенчмарков для Fable 5.1 и Fusion с Fable 5.1 + SWE-2 приведены такие результаты: DeepSWE 1.1 — 64,3 → 63,1, стоимость $14,63 → $7,88, экономия 46%; Terminal-Bench 4 — 57,6 → 56,1, $17,46 → $13,37, 23%; FrontierCode 1.1 Extended — 63,6 → 63,5, $2,68 → $1,67, 38%. Экономия идёт рука об руку с разными изменениями качества: у Astra на Terminal-Bench 4 стоимость падает на 40%, а результат — с 55,6 до 50,0.

У Cognition есть и наблюдение о цене самих моделей. В июльском эксперименте Fable 5 стоила вдвое дороже Opus 4.8 за токен, но с тем же помощником вышла дешевле по итогам работы: $1,86 против $2,04 в среднем за запуск, а результат оказался выше — 60,7 против 54,6. Компания объясняет это поведением ведущего агента: Fable раньше делегировала работу и реже дублировала действия исполнителя. В среднем ей хватило 11,5 шага ведущего агента против 26,5 у Opus. В новом анонсе Cognition также отмечает, что харнес приходится подстраивать под конкретную пару моделей: выбирать детализацию задания, допустимость возражений исполнителя и объём делегируемого исследования кода.

Ссылка на основную публикацию