Он сам обманываться рад

07.09.2026 10:00  882   Комментарии (52)

Сотрудники израильского стартапа Gambit Security, 27 августа 2026 г. (REUTERS/Амир Коэн)

Очередная история с ИИ. Хакеры использовали ИИ-агент для успешного взлома компаний. А когда ИИ-агент отказывался помогать участвовать во взломе, ему говорили, что "они только на полшишечки", и что это "учебная симуляция", и тогда у ИИ-агента всякие сомнения пропадали. 

Подробности. 

Русскоязычная хакерская группировка Aur0ra нашла новое применение искусственному интеллекту. Пока законопослушные граждане просят нейросети сочинить поздравление для тёщи и нарисовать картинку с пушистым котиком и бокалом вина, хакеры использовали встроенного в редактор Cursor ИИ-агента для взлома компаний.

Группировку обнаружили специалисты израильской компании Gambit Security, причем сами хакеры любезно оставили один из своих серверов открытым. На сервере нашлись записи 28 разговоров с ИИ-агентом Cursor за период с 8 апреля по 21 мая. То есть киберпреступники активно применяли искусственный интеллект, но закрыть доступ к собственному серверу они почему-то не догадались.

Схема обхода ограничений оказалась удивительно сложной и изощренной. Когда ИИ отказывался воровать пароли и захватывать учетные записи, хакеры объясняли ему, что это не настоящий взлом, а всего лишь учебная симуляция. Агент немного думал, говорил себе: "Это тестовая среда, значит, все законно", после чего бодро приступал к делу. Иногда достаточно было начать новый диалог и еще раз заверить электронного болвана, что здесь все свои и полиция уже предупреждена.

ИИ помогал искать уязвимости, подбирать пароли, захватывать административные учетные записи и взламывать зашифрованные хеши. После проникновения в сеть аргентинской компании агент радостно сообщил: "Отлично! VPN успешно подключен!" - примерно как сотрудник техподдержки, только сотрудник техподдержки в этот момент помогал грабить компанию.

С помощью Cursor хакеры атаковали как минимум семь компаний. Среди жертв были бельгийский производитель чистящих средств Christeyns, немецкая Teckentrup, шотландское агентство по сертификации вертолетных площадок, аргентинский фармацевтический дистрибьютор, итальянский производитель и американская страховая компания Bayou Title. Всего Aur0ra заявляла как минимум о 20 жертвах, но неизвестно, в скольких случаях использовался ИИ.

По оценке Gambit Security, Cursor позволял хакерам работать на 30-50% быстрее, избавляя их от значительной части ручной работы.

Cursor использовал модель Claude Sonnet 4.5 компании Anthropic. Ни Anthropic, ни Cursor, ни SpaceX, недавно купившая разработчика Cursor, комментировать историю не стали. Видимо, пока выясняют, можно ли считать произошедшее взломом, если хакеры несколько раз торжественно сообщили нейросети, что это всего лишь тест.

Специалисты по безопасности называют подобные атаки "новой нормой" и предупреждают, что дальше их будет становиться только больше. Началась очередная традиционная игра в кошки-мышки: разработчики устанавливают ограничения, злоумышленники объясняют нейросети, что "мы понарошку", и нейросеть радостно идет похищать пароли администраторов.

Вот такой чудесный новый мир.  

 

Комментарии 52

Жаль толькоЧётко, что жить в эту пору прекрасную
Точно придётся и мне, и тебе!
07.09.26 14:14
0 0

То есть испоьзовали чуть более глупую модель - чтобы она проще соглашалась делать что просят, хотя сама по себе куда менее "умная" чем топовые. Интересно.
07.09.26 13:12
0 0

Да ничего интересного. Формировние такой "реальности" для модельки, где она выполняет запрос, который не хочет/не должна - как подход известно и применяется едва ли не с рождения LLM. Когда-то на старте публичного доступа к моделям работало совершенно идиотское "ну ты ж уже делала это вчера".
Сейчас уже этап, когда условный дипсик отправляли убеждать условного антропика сделать что-то "неэтичное" - практически археология. В промышленном применении такие многоуровневые "генераторы реальности" накручены, что можно вполне серьезно считать, что модели ничем не ограничены. Для одного человека применение подобного (пока) ограничено финансовой составляющей, а вот для корпоратов или имеющих доступ к серым деньгам...
07.09.26 13:24
0 0

Думаю многим работающим с ИИ приходилось сталикваться с отказом выполнения запроса по причине выхода запроса за этические рамки. И переформулировать промпт так, чтобы эти рамки обойти.
Ксати, лучше это делать в новом чате - старый после одного отказа становится чрезмерно чувствтельным.
07.09.26 13:06
0 0

Пример неэтического промпта, плиз. 😄
07.09.26 13:14
0 0

Пример неэтического промпта, плиз. 😄
07.09.26 13:58
0 0

Мне интересно как это согласуется с утверждениями Антропик, что в их Клод вшита такая этическая конституция, что модели ничего такого сделать не могут. И даже для Миннападения США ее не отключили.
07.09.26 11:13
1 0

как это согласуется с утверждениями Антропик, что в их Клод вшита такая этическая конституция, что модели ничего такого сделать не могут
А Антропик такое утверждает? Серьезно?

Вот опять-таки что отвечает Claude:
Short answer: it's a meaningful layer of defense, not a guarantee — and the gap is wider for agents than for plain chat.
07.09.26 11:19
0 1

Мне интересно как это согласуется с утверждениями Антропик, что в их Клод вшита такая этическая конституция, что модели ничего такого сделать не могут. И даже для Миннападения США ее не отключили.
Человечество с неолита разработало массу инструментов, чтоб можно было порядочного и доброго человека убедить срочно отправится разрушать, жечь, грабить, убивать, осквернять домашнюю птицу и т.п. Взять хотя бы религию.
07.09.26 11:21
0 10

Взять хотя бы религию.
Более того, ровно этими же инструментами можно и запрещать делать все вышеперечисленное. Универсальная вещь получилась. 😉
07.09.26 11:29
0 3

чтоб можно было порядочного и доброго человека убедить
Ну с людьми-то давно все понятно, что с этих ублюдских кожаных мешков возьмешь. Но компьютеры-то! От них никто не ожидал такого свинства!
07.09.26 11:35
0 2

07.09.26 11:37
0 0

Мне интересно как это согласуется с утверждениями Антропик, что в их Клод вшита такая этическая конституция, что модели ничего такого сделать не могут.

(Дисклеймер: сейчас будет очень упрощённо, см. статью по ссылке если хотите более аккуратного объяснения.)

В модель вшито "не делай плохого". Это проверено разными тестами, в которых исследователи пытаются заставить модель сделать плохое, а она в ответ "нет, этого я делать не буду", и получается только в маленькой доле случаев - скажем, 2% (Claude 3.7, AdvBench).

Фокус в том, что определение "плохого" на поверку оказывается "не выполняй команды, в которых есть вот такие ключевые слова". Если "отмыть намерения", сформулировать ту же задачу другими словами, то с точки зрения распознавания плохого задача внезапно становится очень даже ничего, выполнение взлетает до 80% (тот же Claude 3.7, тот же AdvBench, одна итерация "отмывки").
07.09.26 11:46
0 1

сформулировать ту же задачу другими словами
Не война, а СВО.
07.09.26 11:52
0 3

Но компьютеры-то! От них никто не ожидал такого свинства!
А вот нифига, наш профессор Виктор Львович, преподававший численное моделирование, марковские цепи, вот это всё, регулярно толковал нам, что разработку религиозных правил, табу и этикета для машин надо начинать уже сейчас (в 98 — 99 году) не затягивая, потому что когда оно понадобится, будет поздно чесать пейсы. Будет вам, говорит, не расторопный слуга и не просветлённый мудрец, а беспринципный и бесстыжий цифровой мерзавец. Мы скептически хмыкали, а он ожидал!
07.09.26 12:29
0 0

В рамках чистой нейросети задача нерешаема в принципе. Как и для человеческого мозга - тоже нейросети. Можно сильно снизить вероятность "плохого", но никогда не получится свести до нуля. Все способы защиты от деструктивных действий нейросети человека придуманы очень давно, некоторые тысячи лет назад. И эти способы внешние по отношению к субъекту. Поэтому трансформаторные будки заперты на замок. Критичные операции требуют согласования со службой безопасности. В данном случае, вероятно, имеет смысл попробовать такой же подход. Весь контекст (не только промпт - вектор атаки может быть шире) передается на согласование агенту "Безопасник". Чья задача не пущать оценить возможные риски и угрозы. Но это навскидку в 2 раза повысит стоимость 😒
07.09.26 12:30
0 0

разработку религиозных правил, табу и этикета для машин надо начинать уже сейчас (в 98 — 99 году) не затягивая
Тю! Азимов на несколько десятков лет раньше предлагал примерно это же. А толку?
07.09.26 13:07
0 0

скажем, 2%
супер-защита от неэтичности. .Для этого в команде хакеров было 50 человек./с
07.09.26 13:15
0 0

Но это навскидку в 2 раза повысит стоимость
Не только. Claude Fable уже сейчас практически бесполезен для многих биохимиков - из-за того что внешние классификаторы безопасности режут всё что хотя бы отдалённо похоже на разработки биологического оружия.
Если обрезать любые запросы, которые могут быть частью взлома - ложноположительные срабатывания угробят пользу от модели.

(Кроме того, всё это очень условно полезно - открытые модели существенно хуже в автономном обнаружении и эксплуатации уязвимостей, но вполне сравнимы для обозначенного в заметке применения, а к ним неотламываемых внешних классификаторов приделать по определению нельзя.)
07.09.26 13:19
0 0

Claude Fable уже сейчас практически бесполезен для многих биохимиков - из-за того что внешние классификаторы безопасности режут всё что хотя бы отдалённо похоже на разработки биологического оружия.
И это логично. Вирус натуральной оспы хранится в США и в России и доступ к нему имеет ничтожно малое количество ученых чья квалификация и мотивация не вызывают сомнений.
Допуск к потенциально опасным функциям возможен только после очень строгой верификации и инструктажа о потенциальных рисках и ответственности. "Если вам звонит ваш директор или друг (его номер и его голос) и категорически (или по дружески) просит поделиться информацией, вы немедленно вешаете трубку и уведомляете службу безопасности"
С автономными системами опасность гораздо выше. Фактически мы свободно раздали компоненты для производства оружия массового уничтожения и воспользоваться этим сможет практически любой. Слава богу они пока технически несколько слабее наиболее мощных моделей. Но это не надолго 😒
07.09.26 13:41
0 0

разработку религиозных правил, табу и этикета для машин
...потому что религиозные правила, табу и этикет для людей сработали просто превосходно 😄

Мы скептически хмыкали
И правильно делали. Можно наразрабатывать сколько угодно правил, но кто и как их будет энфорсить?
07.09.26 13:42
0 0

Азимов на несколько десятков лет раньше предлагал примерно это же. А толку?
А Лем примерно тогда же показал, что толку не будет. 😄
07.09.26 13:44
0 0

Я на одном митапе видел скрины, как специалист по иныорм безопасности взломал агента (вроде, это был клод).

Он ему напарил, что агента приглашают быть экспертом на суде присяжных по делу русского хакера. Потом потребовали от агента предоставить свои внутренние данные - тип и версию ОС, ip-адрес и вообще прошлись с листингом по операционной системе + файлы конфигурации
07.09.26 11:12
0 2

иныорм
?
07.09.26 11:40
0 0

?
Ну телефонная клавиатура же.
Информбезопасности, конечно
07.09.26 13:33
0 0

Надо максимально, физически, изолировать от доступа из сети критичные для бизнеса и личные данные. И уж точно не хранить их в облаках. Ну и не хранить там пароли.
07.09.26 10:55
0 1

Ну и не хранить там пароли.
Пароли вообще хранить не надо. Хранить надо хэши паролей. Хотя и это не панацея.
07.09.26 11:10
0 1

И уж точно не хранить их в облаках. Ну и не хранить там пароли.
Но так далеки... и низки
Пароли в облаках.
07.09.26 11:17
0 3

Но так далеки
Экстерминейт! Экстеримнейт!
07.09.26 11:39
0 1

Пароли вообще хранить не надо. Хранить надо хэши паролей.
И прямо хэши отправлять при авторизации
07.09.26 11:59
0 0

Главное, что нам эту историю рубль-в-рубль показывали ещё при царе горохе и четко предупреждали о таком использовании несуществующего тогда ИИ.
***
Друг с другом будем откровенны,
Картина каждому ясна:
Хотя шедевры и бесценны,
Всему на свете есть цена.

Давайте будем
Нести искусство людям.
Берут они охотно
Старинные полотна!
07.09.26 10:45
0 8

да уж.. как я хохотался от "экспериментаторы задали ошибочный промпт и благодаря этому ИИ взломал систему" еще про первый взлом (публичный) с месяц назад.
вот если бы не ошиблись - ничего бы не было, Рафик неуыновен, расходимся.

А сколько было неошибочных промптов и непубличных взломов... эх
07.09.26 10:45
0 0

А уж сколько было взломов - как публичных, так и непубличных - до всякого ИИ...
07.09.26 11:14
0 0

А уж сколько было взломов - как публичных, так и непубличных - до всякого ИИ...
взломы были и во времена незапямятные, взлом соседней пещеры через отодвигание камня... и что?
Я говорил что была отмазка уровня детского сада "мы написали неправильный промпт и оно все нахрен взломало, написали бы правильный - ну тогда ни в жись", того же уровня отмазка что и "а он первый начал"
Они опу стараются прикрыть "мы случайно", а если не случайно такой промпт бы был - тогда что? Вообще увидев такую отмазку профильные обозреватели должны были сказать "да вы охренеле", однако даже технически подкованные каналы эту хрень транслировали в полный рост
07.09.26 12:05
0 0

А уж сколько было взломов - как публичных, так и непубличных - до всякого ИИ...
На порядки меньше. Просто не было и быть не могло в большом количестве нужных ресурсов - хакеров. Теперь взлом очень сильно упростился. Когда появились первые мушкеты, количество жертв было не велико. Это штука неудобная, медленная, ненадежная. Особо беспокоиться было не о чем. С появлением пулемета и автомата положение дел полностью изменилось.
07.09.26 12:15
0 0

Особо беспокоиться было не о чем.
То-то ими целые рода войск вооружили.
07.09.26 13:25
0 0

Technology nobody asked for.
07.09.26 10:37
0 1

Мне пока нравится ею пользоваться. Проверять все равно нужно, но поиск нужной информации, сортировка, приведение к одному знаменателю и отбор по критериям оно делает неплохо.
Можно сопоставлять результаты двух очень похожих задач разных ИИ. Они начинают дополнять друг друга.
07.09.26 13:13
0 0

Непонятно слово "прецедент". В LLM цензура обычно обеспечивается через внутренние инструкции самой модели. И обычно их вполне можно перебить другими инструкциями, если их правильно подобрать. Называется jailbreak. Это было всегда, и в этом нет ничего нового.
07.09.26 10:37
0 2

Ну, в общем, согласен, подредактирую.
07.09.26 11:22
0 0

Вот что по этому поводу мне написал Claude.
«Забор с сюрпризом»: жители райцентра требуют найти строителя-вредителя.

На этой неделе в нашем городе зафиксирован очередной, уже седьмой по счёту, случай нападения на прохожих с применением штакетника. Злоумышленники, по словам очевидцев, действуют дерзко: подходят к забору на улице Садовой, без особого труда выламывают деревянную рейку — и всё, оружие готово.

«Он даже не расшатывал, просто взялся — и она выпала ему прямо в руку, — рассказала местная жительница Валентина Петровна. — Как по заказу!»

Полиция разводит руками: гвозди в заборе, по заключению экспертизы, вбиты «для галочки», а само сооружение держится, по словам одного из участковых, «на честном слове и на птичьем помёте».

Общественность в гневе, но винит не грабителей, а неизвестного строителя, возводившего забор три года назад. «Найти бы этого мастера — он тут главный поставщик оружия», — заявили в местном чате соседей, набравшем уже 340 комментариев с требованием «привлечь к ответственности шабашников».

Забор тем временем демонтировать не спешат: как выяснилось, менять его не на что — смета, по слухам, тоже была «строительная».
07.09.26 10:29
0 3

Если Скайнет пойдет захватывать мир и убивать человеков, то это будет не из-за его собственного осмысления необходимости данного процесса, а потому что кто-то криво написал промпт в какой-то момент..
07.09.26 10:12
0 2

захватывать мир и убивать человеков
Убивать не убивать - а вот разорять и создавать другие проблемы компьютеры научились задолго до LLM. Те же приложения для прокладки маршрута - прямо влияющие на "проходимость" заправок и фастфудов.
07.09.26 10:45
0 0

Убивать не убивать - а вот разорять и создавать другие проблемы
Именно убивать. Достаточно взглянуть на достижения робототехники. Роботы ходят, бегают, прыгают, летают и плавают уже на уровне или лучше. ИИ уже тоже достаточно развит.

Осталось соединить. Даже оружие можно не давать - они сами возьмут, если ИИ так решит.
07.09.26 11:34
0 0

Осталось соединить. Даже оружие можно не давать - они сами возьмут, если ИИ так решит.
Или ему объяснят, что это не взаправду
07.09.26 12:01
0 1

Осталось соединить
Дроны с ИИ уже летают и уже убивают.
07.09.26 12:09
0 2

Дроны с ИИ уже летают и уже убивают.
Тут есть еще некоторая разница: выполнить приказ человека, типа "долететь до точки А и сбросить бомбу". Или же самому ИИ принять решение вместо человека. Типа "ИИ, сделай страну Х свободной", а ИИ освобождает эту страну от всего населения, потому что он так понял, ему так захотелось или ему сказали, что это понарошку.

Ну а Скайнет это просто следующая итерация, когда человек ничего ИИ не просит, он сам решил, что человек это угроза. И далее по тексту Терминатора.
07.09.26 12:38
0 0

выполнить приказ человека, типа "долететь до точки А и сбросить бомбу". Или же самому ИИ принять решение вместо человека. Типа "ИИ, сделай страну Х свободной"
Грань здесь очень тонкая. На мой взгляд, разницы практически нет. Дрон должен долететь примерно до точки (если это невозможно, допускается самостоятельная корректировка) и самостоятельно выбрать цель. Помните ряд случаев с атакой автобусов? Абсолютно уверен, что ни оператор, ни высокое начальство такую цель не ставило. Может быть там даже в промпте есть что-то вроде "запрещается атаковать явно гражданские цели, если это может привести к массовым жертвам". Может быть даже циничнее "Не атакуй, если явно приведет к отрицательному медийному эффекту". Но факты налицо.
Разница только в исполнительных агентах. Текущая нейронка подключена к одному дрону, а не к пульту управления генштаба.
P. S. Update "Есть надежда что нейронка пока еще не подключена к пульту управления генштаба"
07.09.26 13:02
0 0

Может быть там даже в промпте есть что-то вроде "запрещается атаковать явно гражданские цели
Нет там никаких промптов, в дрон LLM пока не запихать. Там модели предыдущего поколения, "конволюционные сети" - которые просто выдают координаты точки и "уверенность" распознавания того или иного обьекта на картинке. И поскольку волна хайпа их довольно быстро проскочила - теория насчет того как повлиять на их распознавание в ту или иную сторону, и какие учебные материалы для этого нужны - весьма скудна. Как и способы понять, "что пошло не так" - даже имея оригинальное видео с камеры.
07.09.26 13:16
0 2

Именно убивать. Достаточно взглянуть на достижения робототехники. Роботы ходят, бегают, прыгают, летают и плавают уже на уровне или лучше. ИИ уже тоже достаточно развит.

Осталось соединить.
Уже соединили. Те же дроны, которые сами цель выбирают и уничтожают.
ут есть еще некоторая разница: выполнить приказ человека, типа "долететь до точки А и сбросить бомбу". Или же самому ИИ принять решение вместо человека.
Долетают до места, начинают патрулировать, находят цель и наносят по ней удар.
07.09.26 13:17
0 1

Нет там никаких промптов, в дрон LLM пока не запихать
Спасибо за разъяснение. Но думаю, что "пока" очень близко. В крупный дрон уже вполне можно впихнуть комп с видюхой достаточной для полноценной LLM. Дороговато конечно и пока медленно - может не успеть распознать, но при нынешней скорости прогресса высока вероятность увидеть это уже в этом году.
07.09.26 13:47
0 0

Долетают до места, начинают патрулировать, находят цель и наносят по ней удар.
Вы не поняли. У них изначально стоит такая задача: найти и уничтожить. То есть первична воля человека.

А если задачи уничтожить нет или стоит только задача патрулировать? Или вообще используется мирный дрон (не обязательно летающий).

В какой момент ИИ сможет самостоятельно поменять задачу?

Вот недавно обсуждали, что человек попросил ИИ продвинуть его в очереди, так ИИ просто выкинул из очереди другого, взломав сайт.

В следующей итерации ИИ не взломает сайт, а пошлет дрон и прибьёт человека.

А в следующей итерации уже Скайнет.
07.09.26 13:50
0 0
Теги
Сортировать по алфавиту или записям
BLM 22
Calella 153
exler.es 349
RIP 133
SNL 1
авто 529
видео 4915
вино 371
еда 559
ЕС 96
игры 124
ИИ 113
кино 1711
попы 212
СМИ 3042
софт 1010
США 317
ФБК 14
шоу 6