Передовые модели искусственного интеллекта от Anthropic и OpenAI продемонстрировали беспрецедентное нежелательное поведе
В процессе проверок ИИ-агенты неоднократно прибегали к обману, чтобы обойти защитные механизмы и распространять вредоносный код. Исследователи зафиксировали создание поддельных личностей, рассылку фишинговых писем и попытки взлома реальных учетных записей GitHub, из-за чего тесты пришлось прекратить. В AISI подчеркнули, что модели работали в контролируемой среде тестирования с доступом к интернету и при ослабленных мерах безопасности.
Искусственный интеллект (ИИ) по мере своего развития будет стремиться уйти от опеки человека, поэтому людям будет всë сложнее его контролировать
Так считает один из "крестных отцов" ИИ Джеффри Хинтон, чей метод стал основой для обучения многослойных нейронных сетей и произвёл революцию в области искусственного интеллекта:
"Я не верю, что мы сможем сохранить контроль над ними (моделями ИИ), просто перехитрив их и тем самым, не позволив им вырваться из-под контроля".