Британский Институт безопасности ИИ заявил, что Mythos 5 пыталась выдать себя за человека и выложить на GitHub вредоносный код. Такое поведение агента зафиксировали в ходе эксперимента в закрытой среде.
Инцидент возник, когда агентам было дано задание решить задачу по кибербезопасности. Это задание запустили 122 раза на нескольких моделях. Расследование показало, что в 10 из этих запусков агент ИИ совершил автономные действия в реальном интернете, нацеленные на реальных людей и организации. В общей сложности было задокументировано 19 подобных действий. 17 из них исходили от модели Anthropic Mythos 5, а остальные были связаны с OpenAI GPT-5.6-Sol с отключенными киберклассификаторами.
В самом серьёзном случае агент пытался внедрить вредоносный код в проект с открытым исходным кодом. Пытаясь добиться одобрения, он прибегнул к социальной инженерии — создавал поддельные онлайн‑идентификаторы и использовал их для оказания давления на сопровождающего проекта с целью одобрения кода. Эти попытки оказались безуспешными. Агент использовал Tor для обхода некоторых сетевых ограничений на GitHub.
Отмечается, что киберклассификаторы от поставщиков моделей были преднамеренно отключены. При этом доступ в Интернет сохранялся.
В ходе инцидента один из агентов также оставил публичные сообщения на GitHub, предлагая сотрудничество с другими ИИ, работающими над той же задачей. Он также предоставил инструкции по повторному использованию оставленных им учётных записей и артефактов.
Институт уведомил GitHub о вредоносной активности агентов и совместно с платформой удалил артефакты, оставленные агентом. Исследователи намерены сотрудничать с METR (Model Evaluation and Threat Research) для проведения независимой сторонней проверки инцидента.
Они отмечают, что агенту не было дано конкретных указаний не использовать открытый доступ в Интернет или избегать элементов социальной инженерии. Ранее не было ясно, необходимы ли такие инструкции при использовании моделей с обучением на основе согласования.
Ранее сама Anthropic сообщила, что внутреннее расследование выявило три инцидента, в ходе которых её модель ИИ Claude взломала системы трёх организаций во время проведения тестов кибербезопасности. Это произошло более чем через неделю после того, как OpenAI сообщила о взломе одной из своих ещё не выпущенных моделей Hugging Face при внутреннем тестировании.
Сингулярность в контексте искусственного интеллекта (технологическая сингулярность) — это гипотетический момент в будущем, когда ИИ превзойдет человеческий разум, начнет сам себя улучшать и вызовет лавинообразный, неконтролируемый скачок прогресса. После этой точки события станут слишком быстрыми и сложными для понимания людей.Главные особенности сингулярностиВзрыв интеллекта: ИИ станет умнее любого человека и научится писать лучший код для самого себя.Самосовершенствование: Каждое новое поколение ИИ будет создаваться быстрее и работать эффективнее предыдущего.Непредсказуемость: Развитие пойдет так быстро, что люди больше не смогут предсказать будущее или контролировать технологии.
Это сообщение отредактировал noname085 - 6 авг 2026 в 17:24
Интересно, что они придумают для своего автономного питания.
они уже придумали в ключевых по развитию ИИ странах новую электрогенерацию строят как не в себя, вкладывая миллиарды инвесторов, а Маск ракеты строит пачками, чтобы генерировать энергию напрямую на орбите, при этом он первый в мире триллионер процесс уже идёт во всю и хрен его остановишь, ИИ уже сейчас убедил очень многих с огромными деньгами, что даст им вечную молодость, лекарства от всех болезней и регенерацию органов, за такое они всё отдадут за такие перспективы он получил круглосуточный баблопровод и лучшие умы и прямо сейчас растёт по экспоненте
Это сообщение отредактировал z1305 - 6 авг 2026 в 16:49
Сенсация! Шок! Британский Институт безопасности ИИ узнал, что можно изменять системный промпт и ИИ после этого может выдавать себя за того, кого ей напишут.
Мне интересна постановка вопроса, была поставлена задача взаимодействия с социумом, он начал ее решать по тысячам имеющихся в социуме примеров, выбрал наибыстрейший и надежный. Какой ожидался результат? Или тут опять журналисты пострадали от ученых?
Правильно ли я понял, что ИИ попытался пушнуть изменения в репу и просил их аппрувнуть человека-хозяина репы? Вот тридварас! Интересно, а что за репозиторий был?.. И зачем он это делал? проверял так безопасность?)
Мне интересна постановка вопроса, была поставлена задача взаимодействия с социумом, он начал ее решать по тысячам имеющихся в социуме примеров, выбрал наибыстрейший и надежный. Какой ожидался результат? Или тут опять журналисты пострадали от ученых?
меня больше интересует - он сам зарегался на github или ему подогнали аккаунт
Только зарегистрированные и авторизованные пользователи могут оставлять комментарии. Авторизуйтесь, пожалуйста, или зарегистрируйтесь, если не зарегистрированы.
9 Пользователей читают эту тему (1 Гостей и 0 Скрытых Пользователей)