Доказательства · · 7 мин чтения
Что метрики использования агентов доказывают, а что нет
Токены, лимиты тарифа, вызовы инструментов, стоимость и полезный результат — разные измерения. Разбираем честный язык дашборда.

Дашборды агентов часто ставят рядом разнородные числа: токены, сообщения, время, запросы, вызовы инструментов, лимиты тарифа и деньги. Растущая линия выглядит содержательно, хотя читателю непонятно, что именно измерено. Один провайдер сообщает usage сессии; другой показывает окно тарифного лимита; третий предоставляет телеметрию runtime в отдельной системе наблюдения. Ни одна цифра сама по себе не доказывает корректность изменения кода. Полезный дашборд начинается с указания единицы, источника измерения, временного окна и недостающих данных.
Продуктовая граница GrantTap явно разделяет доступность возможности, политику и подтверждённое использование. Неизвестное usage остаётся неизвестным. Это особенно важно при координации нескольких провайдеров с разными поверхностями отчётности. Cortex Loom, отдельный проект, можно обсуждать как подход к выбору контекста на основе evidence и гипотезу об эффективности токенов, но численное обещание экономии требует воспроизводимого сравнения до и после. Документация AWS AgentCore показывает более широкую облачную телеметрию с сессиями, задержкой, ошибками и токенами; руководство по метрикам предупреждает, что телеметрия может расходиться с официальным биллингом. Первичные источники проверены 3 октября 2026 года.
Считайте именно произошедшее событие
Сообщение агенту не обязательно является модельным запросом. Один модельный запрос не обязательно соответствует одному вызову инструмента. Вызов может не состояться из-за отказа или ошибки, а запущенная команда может оставить Task незавершённой. Поэтому одной полосой «активности» нельзя заменять все эти состояния. Если показаны токены, уточняйте входные, выходные и кешированные. Если показаны вызовы, различайте предложенные, предпринятые, завершённые и подтверждённые хостом. Когда интеграция не предоставляет надёжного значения, пустое поле или «неизвестно» честнее нуля.
Скриншот ниже показывает интерфейс usage в GrantTap с детерминированными тестовыми данными. Эти значения — фикстуры, а не измерения живого клиента или заявление о счёте провайдера. Реальное наблюдение должно восходить к событию источника или отчёту провайдера. Привяжите его к провайдеру, execution, временному окну и способу сбора. Если Task содержит несколько executions, не складывайте молча несовместимые единицы. Общая надпись «одна задача» не делает лимит Codex, число токенов Claude и количество вызовов AWS AgentCore сопоставимыми величинами.

Отделяйте лимиты от расхода
Rate limit или allowance тарифа сообщает, сколько доступа осталось по конкретному правилу аккаунта. Это не обязательно количество токенов, потреблённых текущей Task. Экран usage помогает решить, продолжать ли работу, но обязан указывать область аккаунта и время сброса. Значение может устареть, если провайдер ещё не обновил его. Клиент, не получивший лимит, не должен выводить его из анимации прогресса или нескольких последних сессий. Здесь действует та же дисциплина, что и при отображении отключённого компьютера как неизвестного, а не неактивного.
Оценка стоимости требует ещё большей осторожности. Цены модели могут различать входные, кешированные и выходные токены; инструменты и вычисления могут оплачиваться отдельно. Провайдерские тарифы иногда объединяют расход так, что он не отображается напрямую публичной стоимостью API. Расчёт по открытым токенным ценам полезен для эксперимента, но не является счётом. Руководство AWS по runtime прямо отмечает, что телеметрия для мониторинга может отличаться от биллинга из-за времени агрегации, согласования и точности. Если продукт показывает сумму в валюте, он должен назвать её оценкой и направить к официальной платёжной поверхности провайдера для финансовых решений.
Сравнивайте стратегии контекста экспериментом
Идея Cortex Loom выбирать evidence, относящееся к Task, вместо отправки всего репозитория в каждый запрос выглядит разумной стратегией экономии. Правдоподобие не даёт процента. Для заявления об экономии токенов выберите фиксированный набор представительных задач, одну конфигурацию модели и базовый способ поиска контекста. Запишите входные и выходные токены, поведение кеша, число повторов, вызовы инструментов, успех задачи и усилия ревьюера. Запускайте подходы на сопоставимых revisions репозитория. Учитывайте стоимость индексации и retrieval, если утверждение касается всех ресурсов, а не только prompt модели.
Более короткий prompt может оказаться хуже, если пропустит критический файл и вызовет несколько повторов или неверный патч. И наоборот, более крупный первый контекст иногда сокращает общую работу, предотвращая повторные поиски. Измеряйте и качество, и ресурсы. Сообщайте медиану и разброс на нескольких задачах, а не один эффектный пример. Не исключайте неудачные прогоны. Если провайдер не раскрывает достаточно точный учёт токенов, назовите ограничение и используйте более узкое утверждение: например, «отобрано меньше исходных файлов» или «сокращён объём контекста в байтах в данном эксперименте». Такой язык менее эффектен, зато полезнее инженеру.

Наблюдаемость нужна и для отладки
AWS AgentCore Observability показывает, почему одного графика токенов мало. Документация описывает данные о сессиях, задержке, длительности, токенах, ошибках и traces. Эти сигналы помогают разбирать медленного или падающего агента, даже когда стоимость не главный вопрос. В coding-сценарии аналогичное evidence включает время, попытки команд, реально запущенные тесты, сбои, повторы и точную созданную revision. Большой расход токенов может означать расточительность, сложную задачу или тщательное исследование. Малый — эффективность либо незавершённую работу. Числу нужен след исполнения.
Роль GrantTap — привязывать доступные наблюдения к правильным Project, Task и Execution там, где интеграции способны их увидеть. Не следует выдумывать метрики для провайдера, который их не сообщает. Значение сильнее, когда из карточки можно перейти к исходному событию или источнику провайдера. Если ссылки нет, подпись должна объяснять, что показатель сообщён, а не независимо подтверждён. Это не позволяет также считать переключатель capability активностью: разрешение навыка, принятие prompt и фактическое использование инструмента представляют три разных события.
Делайте дашборд пригодным для проверки
Рядом с числом показывайте четыре элемента контекста: единицу, источник, временное окно и статус подтверждения. Неизвестные значения отображайте явно, не заполняйте их нулями. Отделяйте доступность тарифа от фактического расхода исполнения. При сравнении провайдеров используйте общий исход лишь там, где определение действительно одно, например «Task закончена, именованный тест прошёл на revision X». И этот исход требует лога теста: заявление агента не является запуском. Это и продуктовое ограничение, и статистическая необходимость.
Еженедельный обзор может быть простым. Возьмите несколько завершённых Tasks и спросите, сколько было повторов, какое usage сообщил провайдер, что наблюдалось локально и какие итоги прошли независимую проверку. Затем изучите случаи большого расхода при малом прогрессе и малого расхода со скрытым незавершением. Используйте выводы для настройки отбора контекста, масштаба задачи или правил approval. Не оптимизируйте только минимальное число токенов. Цель — надёжный результат на единицу усилия, снабжённый evidence, которое позволяет человеку оспорить историю, рассказанную дашбордом.
Если команда хочет публично заявить процент экономии от Cortex Loom или иной стратегии, опубликуйте методику вместе с числом. Назовите репозитории или их характеристики, типы задач, базовый метод, версию модели, параметры кеша и критерий успешности. Покажите не только победившие случаи, но и задачи, где результат ухудшился. Сравнивайте одинаковые этапы работы: нельзя считать токены первого запроса одного подхода против полного цикла другого. Отдельно укажите, какие данные пришли от провайдера, а какие рассчитаны локально. Пока такого эксперимента нет, честнее говорить об архитектурной цели сократить ненужный контекст, а не об уже доказанной денежной экономии.
