Anthropic переходит от методов защиты на уровне моделей к жесткому контролю среды для защиты своих ИИ-агентов. Внедряя изоляцию файловой системы и строгие сетевые ограничения, компания стремится минимизировать риски, которые невозможно надежно предотвратить с помощью запросов на подтверждение или внутренних классификаторов моделей.