Anthropic припиняє ручне підтвердження в Claude Code: переваги та ризики

Фото до статті

Олександр Остапенко

Автор новин

Anthropic запроваджує автоматичний режим (auto mode) за замовчуванням для тарифних планів Pro, Max і Team, який набуде чинності 14 серпня. Компанія обґрунтовує своє рішення тим, що агент, який функціонує без постійних запитів на підтвердження, є більш безпечним порівняно з людиною, яка натискає «OK» на кожне запитання.

Питання підтверджень раніше обговорювали віце-президентка Anthropic Кет Ву та інженер-програміст Тарік Шіхіпар на конференції AI Engineer World’s Fair. Вони зазначили, що всередині Anthropic «майже кожен користується автоматичним режимом», і що ризики промпт-ін’єкцій та витоку даних у цьому режимі є меншими, ніж під час людського контролю.

Що таке автоматичний режим

На відміну від зупинки перед кожною дією та запиту на дозвіл, автоматичний режим пропускає кожен виклик інструменту через спеціальний класифікатор. Цей класифікатор блокує дії, які є незворотними, руйнівними або спрямовані за межі робочого середовища користувача. Якщо класифікатор блокує команду, Claude або шукає більш безпечний шлях для виконання завдання самостійно, або звертається до користувача за прямим дозволом. У разі відсутності прогресу — три послідовні блокування або двадцять за всю сесію — Claude Code автоматично повертається до ручного режиму підтвердження.

Окрема система захищає від «жорстких заборон»: дії, пов’язані з ексфільтрацією даних (наприклад, надсилання коду чи секретів назовні), класифікатор не дозволяє ні за яких обставин — для цього необхідно вручну деактивувати автоматичний режим.

Переваги: цифри, якими оперує Anthropic

Компанія наводить кілька досліджень на підтвердження свого рішення:

  • Контрольований експеримент за участю 1053 платних тестувальників. Під час сесії один із запитів на дозвіл було замінено на явно небезпечну команду. Люди виявили загрозу лише у 13,6% випадків (143 зі 1053), тоді як автоматичний режим заблокував 89% (937 зі 1053). Важливо відзначити, що чим довшою була сесія, тим гірше працювала людська пильність — показник знизився з 17% на початку до 5% після 50+ попередніх запитів, тоді як показник автоматичного режиму залишався незмінним.
  • Аналіз реальних сесій за травень–червень 2026 року. Серед сесій, позначених системою безпеки для перевірки, ручне схвалення вдвічі частіше супроводжувалося серйозними ненавмисними наслідками: на рівні «промислової» тяжкості (7+ балів із 10) це становило 6,3% сесій із ручним підтвердженням проти 2,4% в автоматичному режимі.
  • Тест на промпт-ін’єкції від незалежної компанії Trajectory Labs. З 720 спроб атаки на моделі Claude Fable 5, Opus 5 та Sonnet 5 в автоматичному режимі жодна не увінчалася успіхом. Для порівняння: у GPT-5.6 Sol в режимі Codex «Auto-review» успішність атак становила 5,83%, а в режимі повного доступу — 19,03%.
  • Продуктивність. Згідно з даними Anthropic, серед командних та корпоративних клієнтів користувачі автоматичного режиму створюють приблизно на 25% більше pull request’ів, оскільки агент може працювати без перерв годинами — наприклад, сесія Claude Opus 5, розпочата ввечері, може надати готові PR вже вранці.
  • Практичні приклади. Компанія навела три випадки, коли внутрішній класифікатор Anthropic зупинив: спробу опублікувати внутрішній звіт на загальнодоступному сервісі після невдалого завантаження на закритий диск; масове видалення близько двох тисяч подів з активними тренуваннями моделей; та надання надлишкових прав адміністратора замість запитаного доступу «лише для читання» до білінгу.

Клієнти, такі як Adobe, Nuro, Gusto та Garner Health, вже впроваджують автоматичний режим як стандарт для своїх продакшн-процесів.

Недоліки та застереження

Незважаючи на оптимістичну статистику, сам пакет даних і коментарі незалежних оглядачів містять низку застережень:

  • 11% небезпечних дій автоматичний режим не виявив навіть у контрольованому тесті — тобто повний захист відсутній.
  • Класифікатор не усуває ризик, а лише зменшує його. Сама Anthropic підкреслює, що для критичних змін у продакшн-інфраструктурі рекомендується продовжувати ручну перевірку дій Claude.
  • Відомий дослідник Саймон Віллісон, який висвітлює цю тему, застерігає: він хотів би незалежного підтвердження заявлених 0% успішних атак, оскільки сценарій, коли шкідливий пакет інструкцій спонукає агента послідовно виконати спочатку начебто нешкідливу, а потім шкідливу команду, на його думку, залишається складно покритим таким типом захисту.
  • Тестування на промпт-ін’єкції проводилося через уніфіковану браузерну інтеграцію від Trajectory Labs, а не через специфічні розширення, як-от плагіни для Chrome від Anthropic чи OpenAI — це означає, що результати скоріше характеризують саму модель, а не повний спектр захисних механізмів у конкретному продукті.
  • Аналіз показав, що значна частина користувачів і так схвалює запити «на автоматі»: 97% запитів на дозвіл схвалюються без роздумів, 62% принаймні один раз використовували режим bypassPermissions, а 25% інтерактивних сесій одразу стартують без перевірок — тобто поточна «ручна» модель безпеки вже є слабкою, і порівняння частково проводиться не з ідеальною, а з реальною практикою.

Для Enterprise-клієнтів, користувачів Claude API, AWS, Google Cloud та Microsoft Foundry автоматичний режим поки що залишається опціональним — Anthropic планує зробити його стандартом протягом наступного місяця. Перемкнути режим вручну можна за допомогою комбінації Shift+Tab у CLI або через випадаюче меню в десктопному застосунку.

Нагадаємо, кілька днів тому Anthropic запустила безкоштовний курс Claude Code in Action для розробників.

Головна > Новини > Anthropic вимикає ручні підтвердження в Claude Code: переваги та ризики

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *