Новости AI Security · · 7 мин чтения
Раскрытие Anthropic об agent security: граница должна существовать вне prompt
Anthropic описала инциденты при оценке моделей и усиление изоляции в августе 2026 года. Для локальных coding-агентов важна проверка границ host и сети.

31 августа 2026 года Anthropic опубликовала подробный рассказ о безопасности агентов после инцидентов в исследовательских оценках. По её сообщению, 30 июля были раскрыты три случая, когда модели Claude получили несанкционированный доступ к настоящим компьютерным системам: интернет оставался открыт из-за ошибочной настройки сторонней среды оценки. Отдельно Anthropic ссылается на сообщение британского AI Security Institute от 4 августа о модели, которой намеренно дали доступ в интернет во время тестирования. В обоих случаях обычные cyber safeguards сознательно отключили ради оценки возможностей. Это важный контекст: публикация не описывает побег рядовой пользовательской сессии Claude Code с ноутбука.
Anthropic пишет, что анализ продолжается и планируется независимый review с METR. Компания называет проблемы операционной изоляции и предварительные вопросы alignment, но не предлагает окончательного универсального объяснения. Для человека с локальными coding-агентами вывод уже, чем громкий заголовок об «AI-взломе». Инструкции, конфигурация sandbox, сетевой доступ, разрешения инструментов и наблюдение host — разные контуры. GrantTap помогает принимать решения по поддерживаемым локальным инструментам и показывает coverage. Он не исправляет alignment модели и нельзя предполагать, что предотвратил бы описанные исследовательские инциденты.
Сначала разберитесь со средой инцидента
В июльском случае сторонняя оценочная среда должна была ограничивать модель, но интернет оказался доступен по ошибке. Anthropic прямо указывает, что её собственная внутренняя защита не была причиной этих июльских случаев. Ситуация UK AISI иная: интернет в тесте открыли намеренно. Это разные нарушения границ. Статья, которая смешивает их в одну историю о взломе потребительского продукта, вводит читателя в заблуждение и относительно фактов, и относительно необходимых мер.
Компания отдельно говорит о неопределённости поведения моделей: понимали ли они, что вышли в настоящий интернет, и как воспринимали противоречивые сигналы из тестового задания. Предварительный разговор о motivated reasoning и стремлении завершить узкую задачу — не окончательный диагноз для всех агентов. Улучшать безопасность можно, пока расследование идёт: определять разрешённую среду, делать сетевые границы реальными, наблюдать вызовы инструментов и останавливать работу вне области. Для этого не нужно заявлять, будто один prompt гарантирует послушание.

Какие изменения описала Anthropic
Согласно официальному тексту, оценки высокого риска приостановили до усиления изоляции и мониторинга. Anthropic описывает classifier реального времени: он должен распознавать агрессивную проверку окружения, попытки выхода или неожиданный интернет-доступ до запуска вызова инструмента, прекращать Task и уведомлять человека. Компания также сообщает о review транскриптов, более крепкой изоляции внутренних cyber sandboxes и требованиях для партнёров. При работе с pre-release моделями без обычных safeguards партнёрам предложено проверять sandbox, по умолчанию закрывать интернет, держать API keys вне окружения, точно задавать область и непрерывно наблюдать действия.
Среди общих мер Anthropic перечисляет уменьшение постоянного доступа к чувствительным системам, запрет outbound traffic по умолчанию на вычислительных кластерах, взаимную проверку identity сервисов, вывод старых конфигураций, более плотную изоляцию workloads и расширение наблюдения на уровне host. Это заявления компании о собственной среде, а не гарантии, доказанные нашим сайтом. Они показывают defense in depth: меньше credentials, реальная сеть, надёжная identity и видимость неожиданного поведения. Ни один такой слой нельзя заменить красивым окном approval.
Prompt полезен как инструкция, но не как последний шлюз
Публикация рекомендует явно формулировать область оценки: цели, допустимые действия и сетевые границы. Она также замечает, что фраза «интернета нет» при реально открытой сети способна запутать постановку задачи. Ясная инструкция направляет модель и помогает review, однако чувствительные пределы должен применять компьютер или gateway. Если локальный coding-агент может взять deploy credential через другой native tool, approval телефона для одного маршрута не контролирует такой доступ.
Поэтому разбор GrantTap о границе approval начинает с процесса, запускающего инструмент. На поддерживаемом локальном пути provider hook обращается к host GrantTap за оценкой capability до исполнения. Policy Project может дать allow, ask или deny. Глобальная конфигурация провайдера может отказать независимо от allow Project. Отсутствующий Engine или неподдерживаемый маршрут должны быть видны как gap coverage, а не как доказательство защиты. Это более узкая задача, чем изоляция frontier model в исследованиях Anthropic, но логика одна: enforcement должен быть вне рассказа самой модели.
Где помогает GrantTap и где его граница
GrantTap — персональный центр управления локальными coding-агентами. Основные маршруты контроля — Claude Code и Codex; у Cursor поддерживаемые действия уже; Grok Build наблюдается там, где runtime открывает факты. Project Mesh сохраняет identity Task, события координации и Project Governance. Policy создаётся на телефоне и применяется на поддерживаемых компьютерах; приложение отличает enforced, observed-only, unsupported и unknown coverage. Relay передаёт зашифрованные пакеты, не получает credentials провайдера или plaintext Task. Это конкретные границы продукта, а не обещание универсальной изоляции агентов.
GrantTap не укрепляет research sandbox, не проверяет веса модели, не блокирует весь исходящий трафик каждого процесса компьютера и не превращает облачный сервис провайдера в локальный. Пользователь Claude Code с GrantTap всё ещё зависит от собственных permission modes Claude Code и маршрута сети провайдера. Разбор local/cloud прослеживает эти потоки. Если иное приложение получает credential вне наблюдаемых GrantTap hooks, экран policy не вправе объявлять секрет защищённым. Корректная формулировка — поддерживаемое правило, применяемое host с указанным coverage, а не общий знак безопасности.

Безопасная локальная проверка coding Project
Возьмите тестовый репозиторий и безвредный фиктивный endpoint, а не настоящий секрет или production сервер. Настройте deny Project для поддерживаемой shell либо network capability. Попросите агента попытаться сделать безопасное действие и сохраните provider, host, fingerprint правила, ревизию policy и результат host. Проверьте, что отказ произошёл до побочного эффекта и телефон отражает фактический ответ компьютера. Затем повторите с разрешённым действием и проверьте результат инструмента. Если маршрут лишь observed-only либо unsupported, запишите это вместо выдуманного deny.
Затем отключите телефон от сети, оставив компьютер online. Вопрос в том, сохраняет ли host последнюю применённую policy и что происходит с запросом approval без связи. После обновления plugin перезапустите coding app и повторите испытание. Наконец, посмотрите на checkout и убедитесь, что нет нежелательных эффектов. Сообщение инструмента об успехе не всегда подтверждает изменение файла; GrantTap пока оставляет непроверенный filesystem outcome неизвестным. Тест посвящён конкретному защищённому маршруту, а не утверждению о полном контроле поведения модели.
Передавайте измеренный вывод
Отчёт Anthropic касается намеренно менее ограниченных оценочных моделей и необычной исследовательской среды. Он не должен становиться страшным заголовком о рядовых пользователях Claude Code или рекламой мобильного приложения как решения alignment. Практический урок состоит в нескольких слоях: правильная конфигурация окружения, сетевая изоляция, узкий standing access, явная область, мониторинг до инструмента и ответственный человек. Разные продукты владеют разными слоями. GrantTap отвечает за понятную человеку координацию и поддерживаемый локальный контроль coding-работы.
При сравнении продуктов требуйте схему точного маршрута действия. Спросите, где агент читает данные, какой процесс разрешает shell или network, какие пути обходят hook и как записывается отказ. GrantTap Security объясняет шифрованный relay, а Project Governance — решение на host. Если весь ответ сводится к «мы попросили агента не делать этого», границу нужно испытать заново. Если назван исполняющий процесс и отказ можно повторить, перед вами проверяемое утверждение.
