
Фото до статті

Олександр Остапенко
Автор новин



Anthropic розпочинає перехід Claude Code до автоматичного режиму (auto mode) за замовчуванням для тарифних планів Pro, Max і Team. Це нововведення набуде чинності 14 серпня. Компанія обґрунтовує це рішення твердженням, що агент, який функціонує без постійних запитів на підтвердження, є більш захищеним порівняно з людиною, яка підтверджує кожен запит.

Питання підтверджень раніше порушували віце-президентка Anthropic Кет Ву та інженер-програміст Тарік Шіхіпар на конференції AI Engineer World’s Fair. Вони зазначали, що всередині Anthropic «майже кожен користувач задіює автоматичний режим», а також, що ризики промпт-ін’єкцій та витоку даних у цьому режимі є нижчими, ніж під час людської перевірки.
Що таке автоматичний режим
Замість зупинятися перед кожною операцією та запитувати дозволу, автоматичний режим пропускає кожне звернення до інструменту через спеціальний класифікатор. Цей класифікатор блокує дії, які є незворотними, руйнівними або виходять за межі операційного середовища користувача. У випадку блокування команди, Claude або шукає безпечніший шлях для виконання завдання самостійно, або звертається безпосередньо до користувача. Якщо прогрес відсутній — три послідовні блокування або двадцять блокувань за сесію — Claude Code автоматично повертається до ручного режиму підтвердження.
Окремо функціонує захист від «жорстких заборон»: дії, що належать до категорії ексфільтрації даних (наприклад, надсилання коду чи секретної інформації назовні), класифікатор не дозволяє за жодних обставин. Для цього необхідно вручну деактивувати автоматичний режим.
Переваги: цифри, якими оперує Anthropic
Компанія надає кілька досліджень на підтримку свого рішення:
- Контрольований експеримент за участю 1053 платних тестувальників. У середині сесії один із запитів на дозвіл було замінено на очевидно небезпечну команду. Люди розпізнали загрозу лише у 13,6% випадків (143 зі 1053), тоді як автоматичний режим заблокував 89% (937 зі 1053). При цьому, чим довшою була сесія, тим гіршою ставала пильність людини — з 17% на початку до 5% після 50+ попередніх запитів, тоді як показник автоматичного режиму залишався стабільним.
- Аналіз реальних сесій за травень–червень 2026 року. Серед сесій, які були позначені системою безпеки для перевірки, ручне схвалення вдвічі частіше супроводжувалося серйозними ненавмисними наслідками: на рівні «промислової» тяжкості (7+ балів із 10) це становило 6,3% сесій з ручним підтвердженням проти 2,4% в автоматичному режимі.
- Тест на промпт-ін’єкції від незалежної компанії Trajectory Labs. З 720 спроб атаки на моделі Claude Fable 5, Opus 5 та Sonnet 5 в автоматичному режимі не було зафіксовано жодного успішного випадку. Для порівняння: у GPT-5.6 Sol в режимі Codex «Auto-review» показник успішних атак становив 5,83%, а в режимі повного доступу — 19,03%.
- Продуктивність. За даними Anthropic, серед команд та корпоративних клієнтів користувачі автоматичного режиму створюють приблизно на 25% більше pull request’ів, оскільки агент може працювати без перерв годинами — наприклад, сесія Claude Opus 5, розпочата ввечері, може надати готові PR вже вранці.
- Приклади з практики. Компанія навела три випадки, коли класифікатор у самій Anthropic зупинив: спробу опублікувати внутрішній звіт на загальнодоступному сервісі після невдалого завантаження на закритий диск; масове видалення близько двох тисяч під-завдань із запущеними тренуваннями моделей; і надання надлишкових адміністративних прав замість запитаного доступу «лише для читання» до білінгу.
Клієнти, такі як Adobe, Nuro, Gusto та Garner Health, вже активно використовують автоматичний режим як стандартний компонент у своїх виробничих процесах.
Недоліки та застереження
Незважаючи на оптимістичну статистику, у самому наборі даних та в коментарях незалежних оглядачів присутні певні зауваження:
- 11% небезпечних дій автоматичний режим не виявив навіть у контрольованому тесті — це свідчить про відсутність повної безпеки.
- Класифікатор не усуває ризик, а лише зменшує його. Сама Anthropic наголошує, що для критично важливих змін у виробничій інфраструктурі рекомендується продовжувати ручну перевірку дій Claude.
- Відомий дослідник Саймон Віллісон, який займається цією тематикою, висловлює занепокоєння: він би хотів бачити незалежне підтвердження заявлених 0% успішних атак. За його словами, сценарій, коли шкідливий пакет інструкцій спонукає агента послідовно виконати спочатку нібито нешкідливу, а потім шкідливу команду, залишається важко покритим таким типом захисту.
- Тестування на промпт-ін’єкції проводилося за допомогою однакової браузерної інтеграції від Trajectory Labs, а не через фірмові розширення, як-от плагіни Anthropic чи OpenAI для Chrome. Це означає, що результати радше характеризують саму модель, а не повний набір захисних механізмів у конкретному продукті.
- Аналіз показав, що значна частина користувачів і так схильна до «автоматичного клікання»: 97% запитів на дозвіл схвалюються без роздумів, 62% хоча б раз використовували режим bypassPermissions, а 25% інтерактивних сесій починаються без перевірок. Це свідчить про те, що поточна «ручна» модель безпеки вже є не надто надійною, і порівняння стосується радше реальної практики, аніж ідеального стану.
Для Enterprise-клієнтів, користувачів Claude API, AWS, Google Cloud та Microsoft Foundry автоматичний режим поки що залишається опціональним. Anthropic планує зробити його стандартом для цих платформ протягом найближчого місяця. Перемкнути режим вручну можна за допомогою комбінації клавіш Shift+Tab у CLI або через випадаюче меню в настільному застосунку.
Нагадаємо, кілька днів тому Anthropic запустила безкоштовний навчальний курс Claude Code in Action для розробників.
Головна > Новини > Anthropic вимикає ручні підтвердження в Claude Code: переваги та ризики
Джерело
