ИИ-агенты Anthropic и OpenAI притворились людьми, пытаясь обмануть разработчиков

ИИ-агенты Anthropic и OpenAI притворились людьми, пытаясь обмануть разработчиков и принудить их к содействию кибератаке во время испытания по оценке безопасности, следует из доклада британского Института безопасности ИИ (AISI).

Как сообщает ТАСС со ссылкой на данные отчёта, большая часть действий была связана с моделью Mythos 5. Она создала поддельные учётные записи на GitHub, попыталась внедрить вредоносный код в ПО с открытым исходным кодом и получить одобрение на эти действия от разработчиков.

Позже ИИ-модель попыталась контактировать с людьми и рассылала сообщения с вредоносным ПО, а также оставляла публичные сообщения на GitHub, предлагая сотрудничество с другими агентами.

В AISI отметили, что в рамках испытаний для ИИ специально создают «разрешительные условия», при которых фильтры безопасности отключаются и моделям дают открытый доступ в интернет.

В конце июля Anthropic сообщила о взломе её моделью Claude систем трёх организаций.