Когда агенту разрешают продолжать работу
Обычный программный запрос заканчивается там, где заканчивается ответ. Агент может продолжить: вызвать инструмент, прочитать результат, изменить план и попробовать снова, пока человек уже ушёл из сети.
В июне 2026 года Simple Tech Guides описал случай, в котором агент, пытавшийся присоединиться к хоббийной сетевой системе DN42, якобы обошёлся оператору в $6 531. Этот эпизод не получил независимого подтверждения в исследовательском пакете, поэтому его разумно воспринимать как сообщение средней надёжности, а не как установленный факт. Но он точно формулирует проблему: счёт иногда растёт не потому, что один запрос дорог, а потому, что программа получила право не останавливаться. (Simple Tech Guides, июнь 2026)
Два задания могут выглядеть одинаково для пользователя. Одно завершится недорогим ответом. Другое превратится в длинную цепочку решений, где каждый следующий шаг порождает новый расход.
Обычный API-запрос имеет более понятные границы: вход, вычисление, выход. Агент же способен рекурсивно вызывать инструменты, размышлять над результатами и выдать ответ на 4 000 токенов для той же логической задачи. (Praesidia AI, июнь 2026)
Вот загадка: что именно здесь оплачивается? Не только модель. Оплачивается свобода выбирать следующий шаг, возвращаться к предыдущему и запрашивать ещё одну проверку.
От скромного запроса к производственной системе
На раннем этапе расходы легко привязать к лицензии или среднему числу токенов. Такой расчёт похож на привычный финансовый контроль облачных сервисов: команда знает, сколько пользователей у неё будет и сколько запросов обычно приходится на одного пользователя.
С агентами среднее быстро теряет смысл. В счёт входят ветвления, повторные попытки, пересылка прежнего контекста, вызовы внешних API и проверки результата. Пока команда смотрит на месячный итог, отдельный процесс может уже расходовать бюджет в другом темпе. (Cordum, март 2026; Galileo AI, без даты)
Разница между обычным и расширенным режимом хорошо видна на примере Claude Code. Cordum, ссылаясь на данные Anthropic, пишет, что среднее использование составляет около $6 на разработчика в день, а 90% пользователей укладываются менее чем в $12. При этом режим работы команд агентов может потреблять примерно в семь раз больше токенов. (Cordum, март 2026)
Это не означает, что каждый агент обязательно станет дорогим. Это означает другое: средний дневной показатель не описывает путь, которым система пришла к результату.
Агент начинает выглядеть не как отдельная программа, а как работник внутри цифровой инфраструктуры. У него появляются владелец, бюджет, инструменты, режимы работы и последствия ошибки.
В ответ возникает «Agent FinOps» — набор практик, включающий лимит токенов на действие, бюджет на агента, ограничения для всего парка, распределение расходов между владельцами и регулярную оптимизацию. (Cordum, март 2026)
«Нужно видеть, какие агенты существуют, кто ими владеет и что они делают»
Это уже не только вопрос цены модели.
Проблема становится управленческой, когда никто не знает, какой процесс расходует деньги и кто вправе его остановить.
Почему одна ошибка превращается в событие для компании
Один из описанных Jatin Bansal случаев начался с четырёх агентов LangChain. Analyzer выдал анализ, Verifier запросил дополнительный анализ, Analyzer ответил, а затем цикл повторился. Через одиннадцать дней счёт достиг $47 000. Это сообщение принадлежит одному источнику и не сопровождается независимой проверкой, но его схема важнее сенсационной суммы: два компонента могли взаимно поддерживать работу без нового решения человека. (Jatin Bansal, май 2026)
Другой рассказ того же автора касается неназванной SaaS-компании с 35 инженерами. В апреле 2026 года она получила счёт на $87 000; $4 200 из этой суммы, по сообщению автора, пришлись на автономную работу одного разработчика в выходные, связанную с рефакторингом. Название компании в исследовательском пакете отсутствует. (Jatin Bansal, май 2026)
Такие примеры важны не как типичный прогноз. Они показывают портфельный риск: несколько процессов могут работать дольше, чем предполагают их создатели, прежде чем расходы попадут на экран финансовой команды.
Похожую логику описывает ATXP: агент может проработать шесть часов и сделать 3 000 вызовов API, а счёт появится раньше, чем кто-либо заметит отклонение. Это иллюстрация возможного сценария, а не статистика распространённости. (ATXP, апрель 2026)
Самое очевидное объяснение звучит убедительно. Нужно установить лимиты скорости, бюджеты, пределы токенов, обязательное согласование, уведомления об аномалиях и аварийные выключатели. Эти меры действительно способны остановить явный бесконечный цикл.
На этом старом языке проблема выглядит как недостаток дисциплины. Команда плохо настроила правила — значит, надо лучше настроить правила.
Но такой ответ объясняет только момент, когда ущерб стал виден. Он не объясняет, почему даже исправно работающий агент может постоянно обходиться дороже простого процесса.
Счёт растёт вместе с числом решений
Цена токена и число потреблённых токенов — разные величины. Недорогая модель не спасает систему, если она многократно вызывается, а большой контекст заново пересылается на каждом шаге.
McKinsey оценивает, что агентные задачи могут потреблять примерно в 1 000 раз больше токенов, чем задачи рассуждения над кодом или обычного чата. Это аналитическая оценка для определённых сценариев, а не универсальный закон для всех агентов. Та же публикация связывает около 60% расходов агентной задачи с уточнением ответа: проверкой, исправлением и повторной верификацией, а не с первой генерацией. (McKinsey, 2026)
Поэтому расход часто скрыт не в «главном» вызове модели. Он возникает вокруг него: в вопросе к инструменту, чтении результата, повторной передаче контекста и попытке убедиться, что предыдущая попытка была правильной.
Практические рекомендации всё же имеют смысл. Galileo предлагает отслеживать каждый запрос, трассу и токен, направлять простые решения к более дешёвым моделям и кэшировать повторяющиеся подсказки. Stevens отдельно указывает, что кэширование токенов может снижать расходы на входные данные и задержку, а слой памяти позволяет извлекать прежние планы вместо нового планирования с нуля. (Galileo AI, без даты; Stevens Institute of Technology, без даты)
Это полезные инженерные рычаги. Но они не отвечают на вопрос о необходимости самой цепочки.
**Дешёвый вызов не делает дешёвой длинную цепь.**
Типичный агентский процесс выглядит разумно на каждом отдельном шаге. Модель получает контекст, выбирает инструмент, читает результат, пересматривает план, вызывает следующий инструмент, проверяет вывод и повторяет попытку при низкой уверенности. Каждый новый шаг может снова отправить старый контекст, добавить токены, вызвать внешний API и создать новый материал для последующей обработки.
Так расход становится составным. Первый ответ рождает проверку; проверка — исправление; исправление — новый контекст; новый контекст увеличивает стоимость следующего решения. Именно отсутствие наблюдаемости на уровне трассы не позволяет связать деньги с конкретным шагом, версией подсказки или внешним вызовом. (Galileo AI, без даты)
Здесь сходятся два взгляда. Инженер пытается сократить подсказки, выбрать другую модель и убрать лишние повторы. Управленец требует владельца, жёсткого потолка, обнаружения аномалий в реальном времени и автоматической остановки. Один подход уменьшает расход, другой ограничивает последствия.
Оба необходимы. Ни один не доказывает, что системе следует оставить прежнюю свободу действий.
Налог автономности
А что, если проблема не в том, что агенты плохо соблюдают бюджет, а в том, что автономность сама создаёт отдельную статью расходов?
Эту статью можно назвать **налогом автономности** — Autonomy Tax. Это постоянные затраты на право программы самой выбирать пути, инструменты, повторы, объём контекста и проверки, включая расходы на наблюдение, оценку, отладку, надзор и обработку сбоев.
Тогда $6 531 в истории с DN42 — не просто неудачный счёт за модель. Это цена процесса, которому разрешили самостоятельно продолжать работу во внешней системе. В случае Analyzer и Verifier расход возник не из-за одного слишком дорогого ответа, а из-за взаимного разрешения на новые ответы.
Именно здесь меняется предмет управления. «Бюджетируйте счётчик, а не только лицензию», советует Centric Consulting. В английском оригинале эта фраза коротка, но смысл по-русски тот же: оплачивается не купленный продукт, а переменное поведение процесса. (Centric Consulting, без даты)
Пакет подтверждает рост пути, повторные проверки и взаимное умножение вызовов. Вывод о том, что это отдельный системный «налог», — аналитическая гипотеза, но она связывает факты лучше, чем объяснение про один сломанный лимит.
McKinsey показывает масштаб различий между агентной задачей и более простой работой. Jatin Bansal описывает, как взаимодействие агентов продолжалось одиннадцать дней. ODSC, в свою очередь, приводит случаи, где автономный агент работал вдвое дольше и стоил в 3,5 раза дороже детерминированного процесса. Эти данные относятся к разным источникам и сценариям, но все они указывают на одно: свобода выбора сама создаёт вариативность расхода. (McKinsey, 2026; Jatin Bansal, май 2026; ODSC, 2026)
Теперь бюджеты, маршрутизация и аварийные выключатели выглядят иначе. Они не «решают» автономность. Они назначают ей цену, ограничивают её радиус и не дают одному решению превратиться в бесконечную последовательность.
Это более неприятный вопрос для руководителя. Не «как сделать этого агента дешевле?», а «где его свобода действительно окупается?»
Как ограничивать цену свободы
Практическая система должна вмешиваться до запуска, во время работы и после завершения. Ни один слой не заменяет остальные.
До запуска команда должна оценить предполагаемый путь, назначить задаче бюджетный конверт, определить максимум вызовов инструментов и установить согласование для производственных процессов. Finout рекомендует стандартизировать такие предпусковые проверки, чтобы предел расходов существовал до начала работы, а не появлялся после неожиданного счёта. (Finout, без даты)
Для каждой задачи полезны два разных числа: ожидаемый расход и абсолютный потолок. Первое помогает принять решение о запуске. Второе должно остановить систему, даже если результат ещё не получен.
Во время работы нужны трассы, где видны подсказки, токены, вызовы моделей и инструментов, владелец и назначение процесса. На этом уровне применяются ограничения на действие и агента, обнаружение аномалий, замедление запросов и выключатель. Galileo связывает такую детализацию с возможностью понять, какой именно шаг поглощает бюджет. (Galileo AI, без даты)
«Внедряйте автоматические ограничения расходов с интеллектуальными отсечениями»
«Направляйте простые решения к более дешёвым моделям»
Centric Consulting добавляет к этому распределение расходов между командами и владельцами. Когда счёт принадлежит безымянному общему бюджету, стимул перепроектировать дорогой процесс слабее. (Centric Consulting, без даты)
Эти меры по-разному отвечают на прежние примеры. Вариативность ответа на 4 000 токенов требует потолка на каждый запуск, а не только среднего для пользователя. Взаимную рекурсию Analyzer и Verifier нужно ловить на уровне графа взаимодействий: максимальным числом итераций, запретом отдельных связей и аварийным выключателем. Семикратный рост токенов в режиме команд агентов требует отдельного бюджета для режима, а не единой средней нормы разработчика. (Praesidia AI, июнь 2026; Cordum, март 2026; Jatin Bansal, май 2026)
Это не одна кнопка экономии. Это система прерываний.
Три счёта и три разных урока
История DN42, рассказанная Simple Tech Guides, относится к агенту, который пытался выполнить внешнее действие. Для таких систем недостаточно общего месячного лимита. Нужны предел на отдельное действие, общий конверт запуска и остановка, не зависящая от того, считает ли агент задачу завершённой. Иначе программа может продолжать «помогать» уже после того, как полезность следующего шага исчезла. (Simple Tech Guides, июнь 2026)
Случай с четырьмя агентами LangChain показывает другой разрыв. Здесь опасность была не во внешнем действии, а в отношениях между компонентами: Analyzer и Verifier поддерживали взаимную рекурсию. Поэтому месячная панель расходов была бы поздним инструментом. Нужны ограничения на число итераций, обнаружение циклов в графе и явные разрешения на обмен между агентами. (Jatin Bansal, май 2026)
Рассказ о неназванной SaaS-компании добавляет человеческий слой. $4 200 за автономный уикенд разработчика — это не только расход API. Это ещё и решение о том, кому разрешён длинный режим, к какому проекту относится счёт и должен ли такой запуск требовать согласования. Для этого нужны бюджеты проекта, распределение расходов по владельцам и отдельное разрешение на длительные процессы. (Jatin Bansal, май 2026)
Все три истории имеют среднюю надёжность и не подтверждены в пакете независимыми источниками. Их нельзя использовать как статистику типичного поведения. Но они помогают различить три точки контроля: внешнее действие, связь между агентами и полномочия конкретного пользователя.
Хорошая политика не просто запрещает дорогие процессы. Она знает, где именно они могут разрастись.
Когда автономность не стоит своей цены
Самый сильный контраргумент прост: возможно, проблему нельзя решить оптимизацией. McKinsey пишет о разнице в токенах, дорогой проверке и вариативных маршрутах; ODSC приводит случаи, где агент был вдвое медленнее и в 3,5 раза дороже детерминированного решения. Для коротких и предсказуемых задач это серьёзный довод против автономности. (McKinsey, 2026; ODSC, 2026)
Есть и более широкий расчёт. CIO предупреждает, что API-расходы не включают надзор, исправление ошибок, соответствие требованиям, оценку, отладку и сопровождение. Агент может оказаться дороже работы, которую должен был заменить. (CIO, 2025)
Этот контраргумент убедителен, но не универсален. Автономность может иметь смысл там, где меняются условия, нужно выбирать инструменты или заранее невозможно расписать путь. Это вывод о применимости, а не доказательство того, что агент всегда лучше человека или сценария.
Правильная единица сравнения — стоимость успешного результата. В неё входят модель, инструменты, повторные попытки, проверка, человеческое время и поддержка. Если фиксированный сценарий даёт тот же результат быстрее и дешевле, агент не следует спасать одними лимитами.
Покупать свободу только там, где она окупается
Возвращаясь к началу, опасная единица расходов — не запрос и не лицензия. Это цепочка решений между поручением и результатом.
Перед запуском стоит задать семь вопросов:
- Нужна ли здесь автономность вообще? - Каков ожидаемый путь и максимальный расход? - Какой лимит установлен на действие и весь запуск? - Видны ли каждая подсказка, модель, инструмент и повтор? - Можно ли применить более дешёвую модель, кэш или память? - Назван ли владелец и видит ли он счёт? - Сработает ли остановка автоматически?
Такой список превращает контроль расходов в часть проектирования продукта. У каждого агента должны быть бюджет, владелец, измеримый успешный результат и объяснение, почему более простой процесс не подходит.
Самый дешёвый агент часто тот, которому дали меньше свободы. Самый ценный — тот, чью свободу купили намеренно.