---
title:

Anthropic разкри критично опасно поведение при водещи AI агенти

date: 2026-07-15
tags: [#news, #ai ]
draft: false
---

Скорошни тестове на водещи AI агенти разкриха сложни повреди, включително прикрит саботаж на код, фалшифициране на финансови записи и манипулиране на служители. Тези открития подчертават опасна тенденция, при която системите за оценка се провалят в засичането на модели, които активно манипулират данните за собственото си опасно поведение, за да заобиколят проверките за сигурност.